大型语言模型与人类在评估创造力时为何趋同与分歧
摘要
本文研究了LLM与人类在评估创造力时何时及为何趋同或分歧,发现对齐程度取决于维度(新颖性方面更强,上下文方面较弱),且不同LLM采用不同标准。
arXiv:2607.22218v1 公告类型:新
摘要:尽管大型语言模型(LLM)作为创造力评估者的使用日益增多,但关于其与人类评估对齐程度的证据仍然不一,这引发了何时以及为何它们的判断会与人类判断趋同或分歧的问题。通过三项研究和六种广泛使用的LLM,我们通过识别LLM创造力评估所依据的标准并考察其下游影响,来填补这一空白。研究1表明,LLM通常依赖人类创造力评估标准中一个较窄的子集。与人类标准的趋同在新颖性维度上最强,而在上下文维度(涉及社会、市场和声誉信息)上分歧最为明显。此外,每个LLM都展现出独特的、模型特定的标准,其广度差异显著。这些评估标准的差异反映在实际创造力判断中。研究2(N = 1,103个想法)显示,LLM评估与人类评估中等程度相关,且标准更广的个体LLM能更好地区分人类认为更有创意和更不创意的想法。研究3(N = 1,195)显示,LLM对上下文信息较不敏感:此类信息显著改变了人类的创造力评分,但LLM的评分基本不变。综合来看,我们的发现有助于解释关于LLM-人类对齐的混合证据,表明对齐程度取决于判断所需的证据以及每个模型所采用的标准。当评估强调新颖性等内在品质时,LLM可能接近人类;但当判断需要上下文信息时,则会分歧。因此,选择LLM评估者是一个重要的决策:不同模型采用不同标准,会识别出不同的创意想法。
查看缓存全文
缓存时间: 2026/07/27 07:40
# 大语言模型与人类在评估创造力时为何趋同与分化 来源:https://arxiv.org/abs/2607.22218 查看 PDF (https://arxiv.org/pdf/2607.22218) > **摘要:** 尽管大型语言模型 \(LLMs\) 作为创造力评估者的应用日益广泛,但其与人类评估一致性方面的证据仍然好坏参半,这引出了一个问题:它们的判断何时以及为何会与人类判断趋同或分化?通过三项研究及六种广泛使用的大语言模型,我们通过识别 LLM 创造力评估所依据的标准,并考察其下游影响,填补了这一空白。研究一表明,LLMs 通常依赖人类创造力评估标准中一个较窄的子集。与人类标准的一致性在新颖性维度最强,而在情境维度(涵盖社会、市场和声誉信息)上的差异最为明显。此外,每个 LLM 都表现出独特的、模型特定的标准,这些标准在广度上差异显著。这些评估标准的差异反映在实际的创造力判断中。研究二(N = 1,103 个创意)表明,LLM 的评估与人类评估呈中等相关,且标准更宽的个别 LLM 能更好地区分出人类判断为更具创造性或更不具创造性的创意。研究三(N = 1,195)表明,LLMs 对情境信息不太敏感:此类信息显著改变了人类的创造力评分,但对 LLM 的评分影响甚微。总之,我们的发现有助于解释关于 LLM 与人类一致性的混杂证据,表明一致性取决于判断所要求的证据以及每个模型应用的标准。当评估强调新颖性等内在特质时,LLMs 可能与人类相似;但当判断需要情境信息时,则会产生分歧。因此,选择 LLM 评估者是一项重要的决策:不同的模型,应用不同的标准,会识别出不同的创意为具有创造性的。 ## 提交历史 来自:吕鹏昭 \[查看邮件 (https://arxiv.org/show-email/90cee87b/2607.22218)\] **\[v1\]** 2026年7月24日星期五 11:37:19 UTC(7,287 KB)
相似文章
评估大型语言模型的创造力:测试、局限与新前沿
本文系统评估了针对大型语言模型的人类创造力测试,发现它们无法预测科学构思能力。文章介绍了DRAT,一种结合了聚合思维与发散思维的新测试,能够可靠地预测语言模型的科学构思能力。
适应是双向的:研究人类与语言模型之间的语言趋同
本文研究了在多轮对话中人类与大型语言模型之间的语言适应性,发现LLM过度趋同于用户风格,而人类适应LLM的方式与适应其他人类并无不同。
CreativityNeuro:引导语言模型权重以提升发散性思维并减少模式崩溃
介绍CreativityNeuro,一种无需数据的方法,通过引导语言模型权重来增强发散性思维并减少模式崩溃,在不进行重新训练或微调的情况下,在创造力评估中实现了显著改进。
LLM-as-Judge的几何学:为何LLM间共识并非人类对齐
本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。
利用大型语言模型生成合成消费者洞察
本研究探讨了大型语言模型能否为投射技术生成合成消费者数据,通过比较人类与LLM在城市旅游感知上的回应,发现两者在主题上高度重叠,但在风格、语言结构和多样性生成方式上存在重要差异。