模型趋同与人类分歧:开放生成中分布多元性的覆盖框架
摘要
本文提出了一个以人类为基础的框架,用于衡量开放任务中LLM生成内容的分布广度(文化覆盖面),引入了LLM覆盖率(LLM Coverage)和边界内比率(In-Boundary Rate)两个指标。实验表明,当前的LLM生成的内容合理但狭窄,集中在人类回答空间的中心附近。
arXiv:2608.05576v1 公告类型:新
摘要:当大语言模型(LLM)写哈利·波特同人小说时,它总能可靠地产生霍格沃茨世界的基本元素,如熟悉的地点和角色。然而,人类写的哈利·波特同人小说通常包含这些基本元素以及更多内容,融入风格不规则的内容和关系多样的情节。这种LLM与人类写作之间的差距已在多个领域被注意到。LLM倾向于产生“平均”的写作,而人类写作包含更多样化的内容,覆盖更广泛的分布。现有工作已表明这种分布性“差距”的存在,但没有工作提出系统的测量方法。本文提出了一个以人类为基础的框架,利用人类在某一主题上写作的经验分布来衡量LLM在同一主题上生成内容的分布广度。我们提出了两个指标,LLM覆盖率(LLM-Cov)和边界内比率(IBR),将LLM内容的合理性与其分布广度分开。在构思和叙事任务中,我们发现当前的LLM产生的内容合理但狭窄,集中在人类回答空间的中心附近。我们的框架可以使研究人员更好地评估LLM创作内容的分布广度,我们称之为其“文化覆盖面”。
查看缓存全文
缓存时间: 2026/08/07 07:50
# 模型汇聚之处,人类分歧之域:开放生成中分布多元性的覆盖框架 来源:https://arxiv.org/html/2608.05576 ###### 摘要 当大语言模型(LLM)撰写哈利·波特同人小说时,它总能稳定地生成霍格沃茨宇宙的基本元素,例如可辨识的地点和人物。然而,人类创作的哈利·波特同人小说通常包含这些基本元素,并且远不止于此,它们还融入了风格不规则的内容和关系多元的情节线。这种LLM与人类写作之间的差距已在多个领域被注意到。LLM倾向于生成“平均”的文本,而人类写作则包含更多样化的内容,覆盖更广泛的分布。已有工作证明了这种分布性“差距”的存在,但没有研究提出系统性的测量方法。我们的论文提出了一个以人类为基准的框架,利用人类在某个主题上写作的经验分布,来衡量LLM在同一主题上生成内容的分布广度。我们提出两个指标:LLM覆盖率(LLM-Cov)和边界内比率(IBR),将LLM内容的合理性与其分布广度分离开来。在构思和叙事任务中,我们发现当前LLM生成的内容合理但狭窄,集中于人类应答空间中心附近的高密度区域。我们的框架能使研究者更好地评估LLM创作内容的分布广度——我们称之为“文化触达”(cultural reach)。 ## 1 引言 生成式AI现在可以说在真正意义上是一种文化技术。大语言模型(LLM)在海量的人类表达记录上训练,并广泛用于生成书面内容,在生成输出时,它们会对什么才是可识别的体裁、合理的风格或有效的文化形式做出隐含选择。这提出了一个当前评估框架尚不足以回答的问题:这样的系统在文化意义上取得成功意味着什么?不仅是避免生成冒犯性或语无伦次的内容,还要生成能够代表人类和文化社群所产生的各种合理应答范围的内容。因此,开放式生成使文化触达的差异尤为显著。这个问题在开放式生成任务中尤为突出,因为这类任务没有唯一正确答案。两位作者被要求续写同一个故事时,可能会选择不同的人物、情感基调、配对或与原著的关系,而两种续写都可能合理。 哈利·波特同人小说——由粉丝创作、探索这些深受喜爱的人物的另类情节线的内容——就是一个常见例子。探索这个世界的同人小说支持多种故事类型,这些故事由不同的子体裁、关系配对、社群惯例和对原著的解读所塑造。如果LLM撰写哈利·波特同人小说,评估其回复质量不仅涉及判断正确性,还涉及其回复是否跨越了这些合理的文化可能性的范围。我们将这种广度称为文化触达。 “多元对齐”框架为思考这个问题提供了一种有用的方式,它询问LLM能否保留异质的人类观点、价值观和偏好,而不是将它们压缩成一种平均应答(Sorensen 等,2024(https://arxiv.org/html/2608.05576#bib.bib51);Xie 等,2025(https://arxiv.org/html/2608.05576#bib.bib56);Kirk 等,2024(https://arxiv.org/html/2608.05576#bib.bib30))。然而,该领域现有的许多实证工作通过预定义的立场、人口群体、偏好标签或标注者分歧来衡量多元性(Santurkar 等,2023(https://arxiv.org/html/2608.05576#bib.bib48);Meister 等,2025(https://arxiv.org/html/2608.05576#bib.bib38);Novis-Deutsch 等,2025(https://arxiv.org/html/2608.05576#bib.bib41))。当重要的变异维度可以预先指定时,这些方法效果良好。然而,在开放式文化生成中,多元性往往通过同一提示的不同合理*实现*呈现出来。相关差异可能是语义的、风格的、叙事的或社群特定的,而且可能难以预先指定或识别。这就在多元对齐的目标与当前评估方式之间留下了一个差距。现有方法通常考察预定义观点、偏好或群体上的分布,但不太适用于相关变异形式事先未知的开放式任务。 #### 我们的方法。 我们利用人类应答的经验分布作为自下而上的参照,来评估LLM生成内容的多样性,从而弥合这一差距。这允许在无需预先指定应答类别或变异维度的情况下测量分布多元性。为此,我们引入了一个基于几何学的覆盖框架,将人类和模型的应答嵌入到一个共享语义空间中。我们将人类应答周围的局部邻域的并集视为一个经验性的人类应答边界,并沿两个互补维度评估模型输出。我们的**边界内比率(IBR)**指标衡量模型输出落入人类应答边界内的频率,捕捉LLM应答相对同一主题下人类应答的**合理性**。我们的**LLM覆盖率(LLM-Cov)**指标衡量模型触达人类应答分布的程度,捕捉LLM应答相对人类的**分布广度**。我们还构建了一个“人类对人类的参照”,方法是将一个留出的人类样本与其余应答进行评估,以展示当输出来自另一个人群时覆盖率会是什么样子。 我们将该框架应用于另类用途任务(Alternative Uses Task)、发散联想任务(Divergent Association Task)和哈利·波特同人小说。在所有三个任务中,LLM输出总体上是合理的,但相对人类对人类的参照,它们覆盖人类应答空间的范围要小得多,尤其是在边缘区域。在同人小说中,这种覆盖不足是有结构的而非随机的,揭示了模型更可能或更不可能触达哪些文化可能性。 #### 我们的贡献。 我们的贡献有三方面。首先,我们提出了第一个以人类为基准的覆盖框架,用于评估开放式LLM生成。与以往的评估方法不同,它不需要预定义的应答类别或变异维度,也不限制有效答案的数量。因此,它为评估开放式生成提供了一种更灵活的方式。其次,我们发现模型覆盖不足具有清晰的分布结构。与先前发现类似,模型输出比人类输出更狭窄,主要覆盖人类应答分布中高密度的中心区域。第三,我们的框架识别出哪些类型的人类表达最不可能被LLM应答“覆盖”。例如,在哈利·波特同人小说中,我们考察了哪些风格和社群特定的文化可能性更可能被模型遗漏。这为审计模型覆盖提供了一种方法。 ## 2 相关工作 ### 2.1 文化AI与多元对齐 近期工作认为生成式AI系统应被理解为文化和社会技术,而不仅仅是生成文本的工具(Brinkmann 等,2023(https://arxiv.org/html/2608.05576#bib.bib14);Farrell 等,2025(https://arxiv.org/html/2608.05576#bib.bib22))。特别是,Kommers 等(2026(https://arxiv.org/html/2608.05576#bib.bib32))开发了一种计算诠释学方法,将生成式AI作为文化技术进行评估,强调模型输出参与了解释和意义建构。面向人文学科的工作同样认为,模型生成的是词语,而意义取决于使用这些词语的人、情境和社群(Klein 等,2025(https://arxiv.org/html/2608.05576#bib.bib31))。从这个角度来看,准确性、流畅性和单一质量分数只捕捉了模型表现的一部分。模型可能生成可识别且合理的文本,却仍未捕捉到相关语境,正如历史语言建模中表面风格的合理性并不一定意味着历史充分性(Underwood 等,2025(https://arxiv.org/html/2608.05576#bib.bib54))。 多元对齐为思考这个问题提供了一个自然的框架。它询问AI系统如何反映异质的人类价值观、观点和偏好,而不是将它们压缩成一个单一答案或平均应答(Sorensen 等,2024(https://arxiv.org/html/2608.05576#bib.bib51);Xie 等,2025(https://arxiv.org/html/2608.05576#bib.bib56);Kirk 等,2024(https://arxiv.org/html/2608.05576#bib.bib30))。已有工作研究了语言模型代表谁的观点(Santurkar 等,2023(https://arxiv.org/html/2608.05576#bib.bib48);Novis-Deutsch 等,2025(https://arxiv.org/html/2608.05576#bib.bib41))、模型如何与观点或视角的分布对齐(Meister 等,2025(https://arxiv.org/html/2608.05576#bib.bib38);Poole-Dayan 等,2026(https://arxiv.org/html/2608.05576#bib.bib45);Nie 等,2026(https://arxiv.org/html/2608.05576#bib.bib40);Zhang 等,2026(https://arxiv.org/html/2608.05576#bib.bib58))、如何将公众意见纳入对齐(Anthropic,2023(https://arxiv.org/html/2608.05576#bib.bib5)),以及如何跨人群、语言和文化维度评估文化对齐(AlKhamissi 等,2024(https://arxiv.org/html/2608.05576#bib.bib2);Masoud 等,2025(https://arxiv.org/html/2608.05576#bib.bib36))。其他工作开发了模块化、基于强化学习或自我多元化的方法,旨在支持多种价值观或用户视角(Feng 等,2024(https://arxiv.org/html/2608.05576#bib.bib23);Fu 等,2026(https://arxiv.org/html/2608.05576#bib.bib24);Xu 等,2025(https://arxiv.org/html/2608.05576#bib.bib57))。 该领域的大多数实证工作使用预定义的观点、价值观、人口群体、偏好标签或标注者分歧来衡量多元性。这非常适合调查、偏好和价值负载情境,在这些情境中相关的替代方案可以预先识别。透视主义NLP从标注角度提出了相关论点,将分歧视为有意义的人类变异,而不是应总是被聚合掉的噪音(Plank,2022(https://arxiv.org/html/2608.05576#bib.bib44);Mostafazadeh Davani 等,2022(https://arxiv.org/html/2608.05576#bib.bib39);Uma 等,2021(https://arxiv.org/html/2608.05576#bib.bib53);Basile 等,2021(https://arxiv.org/html/2608.05576#bib.bib9))。然而,在开放式文化生成中,合理的应答可能在风格、体裁、解读、叙事方向或社群惯例上有所不同。这些维度在人们实际产生内容之前可能难以指定。我们的工作与分布的多元性方法最为接近,但使用观察到的人类应答而非预定义的替代方案作为参照分布。 ### 2.2 创造力、开放式生成与同质化 大量工作通过新颖性、原创性、惊喜度以及有用性或有效性等标准来评估创造力(Runco & Jaeger,2012(https://arxiv.org/html/2608.05576#bib.bib47);Amabile,1988(https://arxiv.org/html/2608.05576#bib.bib3);Simonton,2018(https://arxiv.org/html/2608.05576#bib.bib49);Corazza,2016(https://arxiv.org/html/2608.05576#bib.bib17);Diedrich 等,2015(https://arxiv.org/html/2608.05576#bib.bib19))。近期的LLM评估使用人类评分、基于LLM的判定、阐述度和语义多样性度量、任务特定基准以及基于嵌入的度量来扩展这些标准(Atmakuru 等,2024(https://arxiv.org/html/2608.05576#bib.bib6);Bellemare-Pepin 等,2026(https://arxiv.org/html/2608.05576#bib.bib10);Chakrabarty 等,2024(https://arxiv.org/html/2608.05576#bib.bib15);Chen & Ding,2023(https://arxiv.org/html/2608.05576#bib.bib16);Dinu 等,2025(https://arxiv.org/html/2608.05576#bib.bib20);He 等,2025(https://arxiv.org/html/2608.05576#bib.bib26);Hou 等,2025(https://arxiv.org/html/2608.05576#bib.bib27);Ismayilzada 等,2025(https://arxiv.org/html/2608.05576#bib.bib28);Zhang 等,2025(https://arxiv.org/html/2608.05576#bib.bib59);Zhao 等,2025(https://arxiv.org/html/2608.05576#bib.bib60))。一种常见方法是使用基于词汇或嵌入的度量来量化模型生成或AI辅助应答之间的相似性或离散程度,将较低的相似性或较大的离散度视为多样性的证据(Padmakumar & He,2024(https://arxiv.org/html/2608.05576#bib.bib43);Wenger & Kenett,2025(https://arxiv.org/html/2608.05576#bib.bib55))。这些度量很有用,但模型可能在人类应答分布的一个狭窄区域内产生多样的输出。因此,模型样本之间的多样性并不一定意味着对人类应答的广泛覆盖。这种区分之所以重要,是因为创造力和开放式变异是由任务结构、体裁和评估情境所塑造的(Baer,1998(https://arxiv.org/html/2608.05576#bib.bib7);Baer & Kaufman,2005(https://arxiv.org/html/2608.05576#bib.bib8);Hou 等,2025(https://arxiv.org/html/2608.05576#bib.bib27);Jain 等,2025(https://arxiv.org/html/2608.05576#bib.bib29);Lai 等,2025(https://arxiv.org/html/2608.05576#bib.bib34))。在发散性思维任务中,如另类用途任务和发散联想任务,变异可能通过不同的用途、联想或概念联系出现(Guilford,1967(https://arxiv.org/html/2608.05576#bib.bib25);Mednick,1962(https://arxiv.org/html/2608.05576#bib.bib37);Olson 等,2021(https://arxiv.org/html/2608.05576#bib.bib42))。在叙事写作中,相关变异可能涉及情节、体裁、背景和其他任务特定的叙事组成部分;在同人小说中,社群规范和真实性感知也很重要(Jain 等,2025(https://arxiv.org/html/2608.05576#bib.bib29);Alfassi 等,2026(https://arxiv.org/html/2608.05576#bib.bib1))。因此,不存在一个单一的预定义轴能够捕捉开放式任务中的相关变异。 近期研究发现,LLM辅助可以提高单个输出的数量、阐述度或感知创造力(Anderson 等,2024(https://arxiv.org/html/2608.05576#bib.bib4);Doshi & Hauser,2024(https://arxiv.org/html/2608.05576#bib.bib21);Lee & Chung,2024(https://arxiv.org/html/2608.05576#bib.bib35);Kumar 等,2025(https://arxiv.org/html/2608.05576#bib.bib33))。与此同时,一些研究发现AI辅助输出在群体或人口层面上变得更加相似(Anderson 等,2024(https://arxiv.org/html/2608.05576#bib.bib4);Doshi & Hauser,2024(https://arxiv.org/html/2608.05576#bib.bib21))。其他工作直接考察了跨模型、跨用户或跨任务的同质化(Padmakumar & He,2024(https://arxiv.org/html/2608.05576#bib.bib43);Wenger & Kenett,2025(https://arxiv.org/html/2608.05576#bib.bib55);Jain 等,2025(https://arxiv.org/html/2608.05576#bib.bib29))。综上所述,这些研究表明AI辅助和模型生成的输出可能变得更相似,或整体占据更狭窄的区域。我们的问题不同但互补:相对于人类生产,这种更狭窄的分布位于何处?两个模型分布可以具有相似的内部多样性,却触达人类应答空间的不同部分。一个以人类为基准的参照是
相似文章
衡量人类与LLM研究思路之间的差距
本研究论文引入了一个框架,用于衡量人类生成与LLM生成的研究思路之间的分布差距,发现LLM思路集中在特定的机会模式与综合方法上,而人类思路则更为多样化。
通过潜在视角评估LLMs中的多元性
本文介绍了一个领域无关的多层框架,用于无监督提取视角,以评估LLM生成文本中的多元性,发现稀有视角被不成比例地低估。
适应是双向的:研究人类与语言模型之间的语言趋同
本文研究了在多轮对话中人类与大型语言模型之间的语言适应性,发现LLM过度趋同于用户风格,而人类适应LLM的方式与适应其他人类并无不同。
大型语言模型与人类在评估创造力时为何趋同与分歧
本文研究了LLM与人类在评估创造力时何时及为何趋同或分歧,发现对齐程度取决于维度(新颖性方面更强,上下文方面较弱),且不同LLM采用不同标准。
大型语言模型有多像人类?一个关注语域的语言评估框架
本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。