LLMs是否变得同样具有创造力?来自三年模型的证据
摘要
本文分析了三年来LLM的输出,使用开放式任务和创造力评估,发现多样性在统计上显著下降,这表明创造性内容在不同模型间趋于一致,这可能会削弱人类在协作创意工作中的自主性。
arXiv:2608.19437v1 Announce Type: new
摘要:许多基准测试跟踪大语言模型(LLM)在具有可验证答案的任务上的表现,但对于LLM在开放式任务上的表现如何演变知之甚少,在这些任务中,创造力、原创性和多样性可能与质量同样重要。随着LLM越来越多地支持人类的构思和创意工作,理解LLM在开放式任务上的表现趋势至关重要。本文对跨越三年模型发布的LLM创造性输出进行了初步分析,检查了模型对Infinity-Chat100(一个真实的开放式用户查询集合)和Alternate Uses Task(一种既定的心理测量创造力评估)的响应。使用句子嵌入相似性,我们检查了LLM对这些提示的响应趋势。我们的研究结果表明,随着时间的推移,模型输出的多样性在统计上显著下降,这表明LLM输出可能在创造性内容上跨模型趋于一致。如果这种趋势持续下去,LLM驱动的同质化可能会逐渐削弱人类在人机协作创意工作中的自主性,这要求我们仔细考虑LLM在人类创意过程中的角色。
查看缓存全文
缓存时间: 2026/08/21 10:03
# 大语言模型是否正变得趋同?来自三年模型演进的证据 来源:https://arxiv.org/html/2608.19437 Nirav Patel *通讯作者:[[email protected]](mailto:[email protected])* 机构:杜克大学计算机科学系 Eva Aggarwal 机构:杜克大学计算机科学系 Emily Wenger 机构:杜克大学计算机科学系 机构:杜克大学电气与计算机工程系 ###### 摘要 现有基准测试多关注大语言模型(LLM)在可验证答案任务上的性能,但对其在开放式任务上的表现演变了解甚少——而在这类任务中,创造力、原创性与多样性可能与质量同等重要。随着LLM越来越多地辅助人类构思与创作工作,理解其在开放式任务上的表现趋势至关重要。本文对跨越三年模型发布的LLM创造性输出进行了初步分析,研究了模型对Infinity-Chat100(一个真实世界的开放式用户查询集合)和替代用途任务(一种经典的心理测量创造力评估)的回应。通过句子嵌入相似度分析,我们探讨了LLM对这些提示回应的演变趋势。研究发现,模型输出的多样性在统计学意义上随时间显著降低,表明不同模型在创造性内容上可能正在趋同。若此趋势持续,LLM驱动的同质化或将逐步削弱人类在人机协同创作中的主导性,这要求我们审慎思考LLM在人类创作过程中所扮演的角色。 ## 1 引言 短短几年内,由大语言模型驱动的对话式人工智能系统已从实验原型演变为广泛使用的日常工具。截至2025年7月,ChatGPT每周活跃用户超过7亿,每日发送消息总量逾25亿条,相当于每秒约29,000条消息。其他主流AI聊天机器人提供商如Anthropic和DeepSeek同样拥有数千万用户。 研究表明,LLM产品的应用场景极为广泛,但其中与创造力相关的任务(如写作、内容创作和研究)尤为常见。约70%的ChatGPT消费级使用属于非工作范畴,而实践指导(包含“创意构思”)和写作类内容占ChatGPT消息总量的半数以上。类似地,Anthropic估计近20%的Claude消息属于“内容创作”或“跨学科学术研究与写作”等类别。随着LLM越来越多地介入创造性工作,理解这些系统如何影响用户接触到的想法范围,以及模型生成的内容如何塑造下游人类创造力,变得至关重要。 越来越多研究表明,LLM的输出虽在个体层面可能显得富有创造性,但在集体层面却常呈现同质化——即与其他LLM产出的“创意”内容高度相似,或不同LLM生成的内容彼此雷同。一项关于AI辅助创意写作的研究发现,能接触AI生成想法的创作者所完成的故事,被评为比独立创作者的故事更具创造性、文笔更佳;然而,这些AI辅助创作的故事之间也更为相似。在真实世界的开放式查询中,模型既表现出模型内部的重复性,也显示出模型之间的趋同性。在标准化发散思维任务上的人类基线研究再次印证了这一模式:LLM在这些任务上的创造性评分与人类相当甚至更高,但多样性显著不足。 算法单一化长期受到学界关注,而AI创造性输出中观察到的同质性代表了这一已充分记录问题的又一维度。然而,这种同质性究竟是尚在发展的技术暂时产生的副产品,还是统计语言模型不可避免——甚至可能加剧——的特征,目前仍不明确。合理的论据指向两方面:大量学术研究指出,在重叠数据上训练并针对相似目标优化的生成模型,将以越来越相似的方式组织概念与语义关系,导致输出相似。但另一方面,随着模型能力提升,它们可能生成更具情境敏感性、风格独特性和领域特异性的回应,从而抵消同质化趋势。 所有这些因素都表明,迫切需要理解AI生成创造性输出的同质化趋势,但现有研究尚未提供此类分析。目前关于同质性的研究仅捕捉了特定模型在某一时间点的行为快照,而非模型在创造性任务上表现的纵向视角。同时,现有AI模型基准测试也无法阐明这一趋势。大多数流行的LLM基准测试(如MMLU、HELM、SWE-Bench和“人类终极考试”)依据明确标准对可验证答案进行评估。相比之下,研究创造性输出则需要评估模型对新颖性、多样性或情境敏感性比答案正确性更重要的问题的表现。 **我们的贡献**:本文通过执行对模型回应开放式提示的时间序列分析填补了这一空白。我们选取2023年至今的主流模型提供商及不同发布时期的模型,对两组互补的创造性提示生成回应,并跨模型和代际比较输出。本分析结合了替代用途任务对发散思维的评估与Infinity-Chat100的开放式提示(涵盖从创意内容生成、多样化写作风格,到信息检索、头脑风暴与构思等六类真实世界用例)。 随后,我们通过基于嵌入的距离度量计算回应的语义相似度,分析模型回应多样性的变化趋势。本研究为追踪LLM创造性如何在不同模型代际间演进提供了框架与初步发现。 **关键发现**:我们发现,LLM对测试的开放式提示(AUT和Infinity-Chat100)的回应随时间推移变得日益相似。这表明LLM在生成开放式回应的任务中正变得缺乏创造性,这要求我们审慎评估其作为创意助手的长期价值。 ## 2 相关工作 **LLM创造力的度量**:近期研究LLM创造力的工作多改编自人类创造力心理测量评估方法,通常包括托兰斯式创造力维度(如流畅性、灵活性、原创性和精细度)以及通过语义距离衡量新颖性的发散思维任务。AI创意写作研究结合专家人工判断、共识评估方法及受托兰斯启发的评分标准,检验LLM输出是否是真正的创造性产物而不仅是流畅文本。其他基准测试从写作转向问题解决,探究模型能否针对日常挑战提出物理可行、非传统解决方案。近期关于科学构思的研究同样将创造力视为领域特定的想法生成。 尽管将人类心理测量方法应用于AI模型存在局限性,但对比研究表明LLM能在标准创造力任务上接近甚至超越人类表现。例如,Hubert等人发现模型在标准创造力任务(包括发散联想测试DAT)上的得分优于人类,生成的答案更具原创性和精细度。然而,一项涉及9,198名人类与215,542个LLM观测值的大规模研究发现,人类在DAT上的平均创造力略高于LLM。近期研究同样发现LLM超越人类DAT平均表现,但不及最具创造力的人类亚群体。值得注意的是,模型DAT回应中存在显著重复——“海洋”一词在超过90%的模型回应集中出现。这暗示了新兴的“AI创造力悖论”:LLM在个体层面可能显得富有创造性,但集体产出却缺乏多样性。 **LLM的同质性**:越来越多文献记录了创造性场景中的这种同质性。在短篇小说生成中,LLM能产出流畅且风格复杂的文本,但在专家和自动化评估的新颖性、惊喜度和多样性上得分低于人类。AI辅助写作研究发现了类似权衡:LLM生成的创意虽提升单个故事质量,却降低了整体多样性。更多研究表明,LLM生成的回应彼此之间比人类回应更相似,重用情节元素,并在真实世界开放式提示中同时表现出模型内部的重复与模型之间的同质性。 尽管这些同质性观察值得关注,现有研究仅提供了特定时间点的现象快照。此外,同质性趋势无法从现有基准数据集中反向推导,这些数据集主要依据明确标准对可验证答案进行评估。即使是CreativityPrism、LitBench和Deep Associations等创造力专用基准测试,也主要关注LLM能否达到公认的创造力标准,而非回应之间的关系。因此,目前尚无追踪LLM创造性输出多样性或原创性演变趋势的框架。 ## 3 方法论 我们通过四个步骤执行LLM输出多样性的时间序列分析。首先选取一组开放式提示,对不同代际语言模型运行这些提示,在语义空间中嵌入回应以计算彼此距离,最后通过回归分析研究回应距离的变化趋势。这些步骤总结于图1并详述如下。 **提示选择**:我们选取了两组以不同方式激发创造力的提示集:替代用途任务(AUT)和来自Infinity-Chat100的100个真实世界开放式提示。AUT是认知心理学中经典的发散思维评估,要求参与者为日常物品(如书、鞋或锤子)提出非常规用途。其标准化结构可分离模型在一致任务约束下产生的想法差异,为衡量回应语义相似度提供受控环境。 Infinity-Chat100提示则提供了更广泛、更自然的创造性任务集合。这些提示源自Infinity-Chat(一个包含真实用户与语言模型交互的大规模数据集),涵盖创意内容生成、问题解决、头脑风暴、构思及其他开放式请求。这些提示允许模型在产出内容和任务处理方式上具有显著变异性,自然补充了AUT的结构化方法。 **跨模型代际评估提示**:为构建回应数据集,我们对68个在2023年3月至2026年7月间发布的模型评估了这些提示,涉及12家主要模型提供商。这包括33个闭源模型和34个开源模型,覆盖27个发布月份。每个模型通过OpenRouter API接收完整的AUT和Infinity-Chat100提示集,温度参数和top-p均设置为1.0以保持随机采样,允许我们在不扭曲输出分布的前提下衡量独立生成回应的相似性。 我们根据模型公开发布的月份分配发布日期,并据此排序回应结果。发布日期可能无法完全捕捉区分连续模型代际的综合变更(包括更新的训练数据、架构和后训练方法),但我们认为其可作为模型在LLM发展进程中位置的稳定可观测代理。因此,跨发布时期的趋势应被理解为与宏观模型发展模式的关联,而非时间本身的因果影响。 **计算嵌入与语义距离**:我们使用all-MiniLM-L6-v2句子转换器模型嵌入模型回应,并计算这些嵌入间的语义距离。句子转换器将每个回应表示为语义空间中的稠密向量,使含义相似的回应由指向相近方向的向量表示。对于AUT,针对每个物品提示生成的所有用途被嵌入为单一回应,每个模型产生10个嵌入。对于Infinity-Chat数据集,每个回应单独嵌入,每个模型产生100个嵌入。 **回归分析**:我们进一步通过回归分析探究语义距离随时间的变化趋势。
相似文章
大型语言模型与人类在评估创造力时为何趋同与分歧
本文研究了LLM与人类在评估创造力时何时及为何趋同或分歧,发现对齐程度取决于维度(新颖性方面更强,上下文方面较弱),且不同LLM采用不同标准。
利用熵提升大语言模型的创意写作能力
本文介绍了一种通过修改采样过程利用熵来改进大语言模型创意写作的技术,旨在减少生成文本中常见的“大语言模型风格”。
LLMs陷入了群体思维的窠臼。这家初创公司正试图让它们摆脱困境。
一家名为Springboards的初创公司开发了一款名为Flint的LLM,旨在生成比主流模型更多样化和更具创意的回答,以解决AI输出中普遍存在的同质化问题。文章强调了相关研究,表明许多LLM因为训练数据和方法相似而趋同于类似的答案。
大语言模型能否进行具有法律意义的推理?基于欧洲人权法院案例的小规模研究
本小规模研究通过欧洲人权法院案例评估了大语言模型在法律案件预测中的推理能力,发现模型能够生成结构完整但实质浅薄的分析,且基于大语言模型的评估器与人类标注者的一致性较低。
对齐更优,多样性下降?分析两代大语言模型的语法与词汇特征
这篇学术论文分析了两代大语言模型与人类撰写新闻文本相比的句法和词汇多样性,发现较新的对齐模型表现出多样性降低的现象。