当单独展示时,大型语言模型的“创意”回答常常比人类更令人惊艳。然而,一旦把它们放在一起比较,一个根本性的问题便暴露出来:不同模型、甚至同一模型的不同次回答,都会不约而同地给出极其相似的“创意”。
这一发现来自一项发表于 PNAS Nexus 的新研究。研究者通过让人类与多个主流大语言模型(包括 Gemini、GPT 与 Llama)完成经典创造力测试(如“为常见物品找出尽可能多的用途”),首次从群体层面系统比较了创意输出的多样性。
个体“高分”与集体“雷同”的矛盾
在单一任务中,一个 AI 的回答往往能被评价为与人类平均水平相当、甚至更具创造性。但当研究者将所有 AI 的回答放在一起比较时,发现它们之间的相似度远高于人类群体内部的相似度。
这种“雷同”并非某个模型的缺陷,而是跨模型、跨任务的一致现象。无论使用 Gemini、GPT 还是 Llama,AI 们给出的“好点子”都会在思路上高度重合。
“温度”调节的困境
为了增加输出的多样性,研究人员尝试提高模型的“温度”参数(即控制随机性的超参数)。结果发现:
-
温度适度升高,输出确实变得更多样;
-
但温度一旦过高,输出很快会变成语无伦次、不符合任务要求的“胡言乱语”。
这表明,AI 的“想象力”被框定在一个刚性边界内——它无法像人类那样在保持逻辑的前提下,真正开拓出完全不同的思维路径。
为什么 AI 难以达到人类的创造力?
研究者指出,人类创造力植根于具身体验、个体意图、生活经历和独特的自我感。而大语言模型本质上是统计机器,它们没有身体,没有欲望,没有个人历史,也无法真正“理解”自己产生的内容。
“目前尚不清楚,仅靠扩大模型规模或调整算法,是否能填补这一根本性鸿沟。”论文作者、芝加哥大学的 Emily Wenger 与 Yoed N. Kenett 写道。
对创作与创新的警示
这项研究向越来越依赖 AI 进行头脑风暴、艺术创作与问题解决的潮流,投下了一枚警示弹。如果创作者在灵感阶段过度依赖 LLM,哪怕每次只使用一个模型,也可能会在不知不觉中被导向越来越趋同的“创意”轨道,从而丧失人类思维本该有的多样性与原创性。
核心要点
个体 vs. 群体:单个 AI 回答的创意评分常高于人类平均水平,但群体层面高度雷同
跨模型一致:Gemini、GPT、Llama 等主流模型均表现出同质化倾向
温度悖论:提高随机性可增加多样性,但很快导致输出失效
根本原因:AI 缺乏具身体验、个体意图与生活经历,而这些可能是真正创造力的必要条件
原始论文信息(英文)
Title:
Large language models are homogeneously creative
Authors:
Emily Wenger, Yoed N. Kenett
Journal:
PNAS Nexus
DOI:
10.1093/pnasnexus/pgag042
Abstract Summary (English):
This study systematically compares creative outputs from humans and multiple large language models (Gemini, GPT, Llama) on standardized creativity tasks. The authors find that LLM responses mirror each other far more than human responses mirror other humans, even after controlling for key confounding variables. The findings suggest that using LLMs as creative partners—regardless of which model—may drive users toward similar, homogeneous outputs, raising concerns about their role in creative work.