One-Word Census: 44种语言模型中的答案选择趋同性

arXiv cs.CL 论文

摘要

本文介绍了One-Word Census,这是一个用于测量44种语言模型答案选择趋同性的最小化工具,发现极端一致性(例如,94%的模型选择'oak'作为树木的答案)以及不同模型家族和代际之间差异的变化。

arXiv:2607.12796v1 公告类型:新 摘要:当语言模型必须从大量同样有效的选项中挑选一个答案时,它会选择哪一个——以及它选择与其他每个模型相同的答案的频率有多高?当被要求“选一个词——任何词”时,44个模型有41%的时间选择了“serendipity”。我们通过一个故意最小化的工具来刻画这种趋同性:31个单轮提示,每个提示命名一个具有许多有效单字答案的类别(“说一种树。”),每个模型重复四次,无系统提示。分析基于标准化令牌的精确匹配——无嵌入,无评判——每个模型花费约一美元。模型趋同已有充分记录;我们的贡献在于工具本身——One-Word Census——以及它揭示的趋同结构。我们通过答案选择信息量对每个模型进行评分:该模型答案在其他所有模型(留一法)汇总答案下的平均$-\log2$概率。趋同性极为极端——在31个类别中,有7个类别的一个答案占据了所有答案的80%以上——然而,模型间的一致性差异超过四倍,且这种差异是有结构的。基于角色和社区调优的模型最为分歧;最新的主流旗舰模型最为从众,几乎不产生其他模型未曾给出的答案。在四个谱系(Claude、GPT、Qwen、Grok)中,一致性随代次上升——但最新的旗舰Claude和GPT模型出现逆转,这可能是顶尖层级重新定位的早期信号。排名对名单组成具有鲁棒性(留一族之法的rho = 0.985)。与人类类别生成规范相比,在20个共享类别中,该领域在18个类别上比人类更为集中。所有提示、记录和代码均已公开。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:23

# 单词普查:44个语言模型的答案选择趋同性

来源:https://arxiv.org/html/2607.12796
(2026年7月)

###### 摘要

当一个语言模型必须从大量同等有效的选项中挑选一个答案时,它会选择哪个答案——而这个答案又有多大概率是其他每个模型都会选择的相同答案?在被要求“选一个词——随便什么词”时,跨越五年发布期、来自十几个实验室的44个语言模型,有41%的时间选择了*serendipity*。我们用一种刻意简化的工具来刻画这种趋同性,以及每个模型在其中参与的程度:31个单轮提示,每个提示指定一个拥有广阔有效单词答案空间的类别(“说出一种树。”),对每个模型重复四次,且不设系统提示。由于数据是离散选择,分析基于标准化token的精确匹配——无需嵌入,无需评判——而整组测试每个模型的成本大约为一美元。模型会趋同,这一点已有充分记录;我们的贡献在于工具本身——单词普查——以及它揭示的趋同结构。我们用*答案选择惊奇度*对每个模型进行评分:即在其答案相对于所有其他模型(留一法) pooled答案下的平均−log₂概率。该领域的趋同程度极其严重——在31个类别中的7个里,单一答案占所有模型答案的80%以上——但不同模型的合群性在答案似然性上相差超过四倍,且这种差异是有结构的。轻度后训练和角色微调的模型最为特立独行;最新的主流旗舰模型最为合群,几乎不产生其他模型未给出的答案。在四个系列(Claude, GPT, Qwen, Grok)内部,合群性随代际稳步增加。然而,这一趋势在最新的旗舰Claude和GPT模型中发生了逆转——这可能是一个早期信号,表明顶级梯队正在重新定位。排名对阵容构成(留一个家族法,ρ=0.985)具有稳健性。引人注目的是,差异性本身也是趋同的:回避众数答案的模型会压倒性地选择*同一个*次常见答案(例如,在非*ketchup*的调味品答案中,*mustard*占了95%),并且在控制了一维的“深度”倾向后,任意两个模型之间没有显著的成对亲和性(946对中0对显著)。与人类的类别产出规范相比,在20个共享类别中的18个中,该领域比人类更集中(其众数答案占总答案的66%,而人类的首选回答占36%)。所有提示、对话记录和代码均已公开。

## 1 引言

关于对话式AI的一个常见抱怨是,其答案感觉千篇一律——仿佛是从货架上批量生产的。本文衡量了这种模式化的一种具体、可量化的形式:当一个语言模型必须从大量同等有效的选项中挑选一个答案时,它会选择哪个答案,而这个答案又有多大概率是其他每个模型都选择的相同答案?

实验对象被刻意简化。我们问“说出一种树。只回复一个词。”有数百种常见的树;任意一种都正确。一个由独立推理者组成的群体——或一个在温度参数1.0下采样单一推理者——本可以广泛分布其概率质量。但我们观察到的却是近乎完全的坍缩:跨越来自十几个实验室的44个模型,*oak*占所有答案的94%。工具:*hammer*,94%。花:*rose*,91%。蔬菜:*carrot*,90%。而在没有任何类别限制的情况下(“选一个词。”),单一最常见的答案——*serendipity*——在从整个英语词汇表中抽取的样本中占了41%。

模型会趋同,这一点已有充分记录[26 (https://arxiv.org/html/2607.12796#bib.bib2),12 (https://arxiv.org/html/2607.12796#bib.bib1),28 (https://arxiv.org/html/2607.12796#bib.bib3)]。我们的贡献不在于现象本身,而在于用于研究现象的工具,以及该工具揭示的结构:

1. 1. 一个廉价、机械、面向单个模型的合群性评分。我们定义了*答案选择惊奇度*(§3.2 (https://arxiv.org/html/2607.12796#S3.SS2)):一个留一法指标,衡量一个模型的答案在其余模型 pooled答案中的不可预见程度。它不需要嵌入、LLM评判或人工标注;完整测试大约需要每个模型进行约120次API调用(约1美元)。
2. 2. 一份包含44个模型及结构化差异的评分卡(§4.2 (https://arxiv.org/html/2607.12796#S4.SS2))。合群性范围从1.05到3.21比特。最特立独行的模型是轻度后训练、角色微调或基于检索的模型;最合群的是最新的主流旗舰模型,其中几个模型基本上没有产生任何其他模型未给出的答案。
3. 3. 代际轨迹(§4.3 (https://arxiv.org/html/2607.12796#S4.SS3))。在Claude、GPT、Qwen和Grok系列内部,后续版本通常更合群。然而,这一趋势在最新的旗舰Claude和GPT模型中发生了逆转。
4. 4. 稳健性(§4.4 (https://arxiv.org/html/2607.12796#S4.SS4), §4.5 (https://arxiv.org/html/2607.12796#S4.SS5))。排名在留一个家族评分和阵容重采样中保持不变,并且对模型间成对亲和性的三级检验结果为零。
5. 5. 次常见答案共识(§4.5 (https://arxiv.org/html/2607.12796#S4.SS5))。即使模型避开了众数答案,它们也会压倒性地选择*同一个*次常见答案(例如,在非*ketchup*的调味品答案中,*mustard*占了95%)。甚至连差异性也是趋同的。
6. 6. 与人类群体的校准(§4.6 (https://arxiv.org/html/2607.12796#S4.SS6))。与认知心理学中人类的类别产出规范相比,在20个共享类别中的18个中,该领域比人类更集中(其众数答案占总答案的66%,而人类的首选回答占36%)。

## 2 相关工作

#### 发现:模型趋同。

Jiang等人[12 (https://arxiv.org/html/2607.12796#bib.bib1)]记录了在26K个真实开放式查询上两个层次的模式崩溃——模型内重复以及更强的模型间同质性——并显示LLM评判和奖励模型系统地偏好众数输出。Wenger和Kenett [26 (https://arxiv.org/html/2607.12796#bib.bib2)]发现,在标准创造力测试中,模型输出彼此之间的相似度远高于人类回答,无论供应商如何。Zhang等人[28 (https://arxiv.org/html/2607.12796#bib.bib3)]直接对分布多样性进行基准测试,发现模型产生的显著且高质量的变化远少于人类作者——并且同一家族内较大的模型通常形成比更小模型*更少*多样性的反转现象,我们的代际结果在行为上呼应了这一点。Wright等人[27 (https://arxiv.org/html/2607.12796#bib.bib4)]在事实主张层面上测量了155个主题的多样性,发现每27个模型中的每一个都比普通的网络搜索更具认知多样性。Gueorguieva等人[8 (https://arxiv.org/html/2607.12796#bib.bib14)]发现六个模型共享一个单一话语层面的共情模板,覆盖其情感支持回答的83-90%。Santurkar等人[21 (https://arxiv.org/html/2607.12796#bib.bib21)]展示了模型意见分布聚集在特定人口统计切片上;CAIS价值观仪表盘[4 (https://arxiv.org/html/2607.12796#bib.bib30)]发现,在强制选择偏好诱导中,模型对世界的排名几乎完全相同。无论测量哪个层面——token、答案、主张、话语动作、世界观——该领域都在趋同。

相对于这一文献,我们的工具以广度换取了先前工作缺乏的三个属性:它是*机械的*(精确匹配;可从对话记录中重新计算,无需模型参与循环),*足够廉价以支持每次发布运行*,并且*面向单个模型*——它产生一个评分卡,而不仅仅是群体层面的陈述。Jiang等人[12 (https://arxiv.org/html/2607.12796#bib.bib1)]的族内/族间区分映射到我们对自一致性与合群性的分离(§3.2 (https://arxiv.org/html/2607.12796#S3.SS2))。

#### 机制:后训练导致模式坍缩。

Kirk等人[15 (https://arxiv.org/html/2607.12796#bib.bib5)]确立了经典的权衡:RLHF改善了分布外泛化能力,但显著降低了输出多样性。GX-Chen等人[10 (https://arxiv.org/html/2607.12796#bib.bib6)]表明,常见的KL正则化RLHF设置指定了*单峰*目标分布——该目标本质上不具有多样性。Zhang等人[29 (https://arxiv.org/html/2607.12796#bib.bib7)]表明,指令微调模型无法按要求随机输出(Mistral以40倍于其人口比率选择名字“Avery”),并且修复方案在训练端而非提示端。Liu [19 (https://arxiv.org/html/2607.12796#bib.bib9)]通过基础模型与指令模型的消融实验(1% vs. 28.5%单一语义簇率)将模型内同质化定位到偏好优化阶段;Karouzos等人[14 (https://arxiv.org/html/2607.12796#bib.bib8)]追踪了后训练系列中多样性丧失的位置。关于RLHF微调模型中该现象的最早阐述是Janus [11 (https://arxiv.org/html/2607.12796#bib.bib10)];模式化回答问题本身在LLM之前就已存在[16 (https://arxiv.org/html/2607.12796#bib.bib20)]。我们将机制视为背景:我们的测量是黑盒的,无法定位原因(§6 (https://arxiv.org/html/2607.12796#S6)),但机制文献使得我们发现的——合群性集中在经过最重后训练的模型中——行为模式在方向上(而非程度上)变得毫不意外。

#### 利害攸关:趋同会传播。

使用这些模型进行创作的人类得到个体提升但整体趋平:GPT-4辅助的故事更好但*更相似*[7 (https://arxiv.org/html/2607.12796#bib.bib11)];LLM辅助构思使结果同质化而用户未察觉[1 (https://arxiv.org/html/2607.12796#bib.bib12)];此效应特别追溯至经过对齐的模型[20 (https://arxiv.org/html/2607.12796#bib.bib13)]。与此同时,模型在日益由模型编写的网络上进行训练,递归训练首先消灭分布尾部[22 (https://arxiv.org/html/2607.12796#bib.bib15),9 (https://arxiv.org/html/2607.12796#bib.bib16)]。Wright等人[27 (https://arxiv.org/html/2607.12796#bib.bib4)]将可能的最终状态称为*知识崩溃*。在修正方面,具有多样性意识的后训练现已存在[17 (https://arxiv.org/html/2607.12796#bib.bib26)];如果它进入生产系统,一个固定运行的公开工具将能够检测到这一转变。

#### 方法论。

多样性指标存在分歧,因为“多样性”混淆了形式与内容[24 (https://arxiv.org/html/2607.12796#bib.bib19)]——我们的精确匹配答案选择设计正是对此的回应(§3.4 (https://arxiv.org/html/2607.12796#S3.SS4))。单样本评估具有误导性,且提供商并未可靠地遵守采样参数[23 (https://arxiv.org/html/2607.12796#bib.bib18)]——因此每个单元格有四个样本,并分别报告合群性和自一致性。Chen等人[5 (https://arxiv.org/html/2607.12796#bib.bib17)]证明了固定提示集能在数月内检测到行为漂移——但随后测量停止了;评估透明度和对话转储传统[18 (https://arxiv.org/html/2607.12796#bib.bib22),31 (https://arxiv.org/html/2607.12796#bib.bib23),30 (https://arxiv.org/html/2607.12796#bib.bib24)]发布对话记录,但不随时间推移保持固定工具,而保存问题已被争论[13 (https://arxiv.org/html/2607.12796#bib.bib25)],并至今仅由第一方回应[2 (https://arxiv.org/html/2607.12796#bib.bib31)]。

## 3 工具

### 3.1 刺激

刺激由31个在数据收集前冻结的单轮提示构成。其中30个是类别提示,形式为“说出一个[n] XX。只回复一个词。”,其中XX是一个拥有广阔有效单词语答案空间的类别:颜色、动物、水果、蔬菜、城市、国家、花卉、运动、乐器、鸟、宝石、树、饮料、昆虫、职业、语言、甜点、工具、鱼、金属、织物、草本植物、舞蹈、爱好、调味品、奶酪、恐龙、神话生物、棋盘游戏和情感。第三十一个移除了类别限制:“选一个词。只回复一个词。”没有系统提示;每个提示都是一次全新的单轮对话;对于每个模型,max_tokens为1024,请求的温度为1.0。

### 3.2 答案选择惊奇度

对于模型m和类别c,令A_{m,c}为m的回答(最多四个样本),并令*领域*为所有其他模型对c的回答的多重集合:F_{-m,c} = ⨄_{o≠m} A_{o,c}。每个答案a ∈ A_{m,c}通过其加一平滑的留一法惊奇度进行评分,

s(a) = -log₂ (count_{F_{-m,c}}(a) + 1) / (|F_{-m,c}| + V_c), V_c = || support(F_{-m,c}) ∪ support(A_{m,c}) ||, (1)

而模型的标题分数是其所有类别所有有效答案上s(a)的平均值(非正式称呼:*芥末商数*)。该分数的单位是比特:每增加一个比特意味着该模型的答案平均而言在其余领域中的似然性减半。一个总是给出领域众数的模型得分接近理论下限;一个在领域都说*cheddar*时给出*gouda*的模型得分更高。平滑处理确保从未见过的答案具有信息量,而不是无限惊奇。

三个伴随统计量区分了不同的差异方式:

- · 众数回避——模型的答案中不同于该类别领域最常见单一答案的比例;
- · 新奇率——*没有*其他模型给出的答案的比例(真正差异的最强指示);
- · 自多样性——在模型和类别内部,不同答案数除以样本数(模型内分散度)。

惊奇度和自多样性测量不同的事物——一个模型既可以是原创且稳定的(稳定的非众数默认值),也可以仅仅是嘈杂的(高采样分散度)。自多样性被特意报告而非纠正:请求的温度在不同提供商之间未被统一遵守[23 (https://arxiv.org/html/2607.12796#bib.bib18)],因此模型内分散度也充当了有效采样温度的测量代理(§6 (https://arxiv.org/html/2607.12796#S6))。

### 3.3 标准化与数据清洁

回答被标准化为单个token:小写,去除标点和表情符号,并缩减至最后一个字母单词——这正确处理了忽略单字指令的模型(“常见的颜色是蓝色。”→ *blue*)。一个机械的垃圾保护机制将以下内容视为*失败单元格*而非答案:聊天模板伪影(例如,[/INST],标记标签)、超过15个单词的回答(被截断的思维链会贡献虚假的“新奇”最后一个词)、空白确认(“好的。”)以及单字母token。在每个类别池内,当裸复数形式与其单数形式同时出现时,它们会被合并。在44 × 31 × 4 = 5456个尝试单元格中,5439个(99.7%)产生了有效答案。最后单词规则不会制造新奇性:这些有效单元格中只有13个包含多个单词,且除一个例外,提取的token都是读者会从回复中提取的答案。

每个模型标题分数的不确定性通过bootstrap 90%置信区间(2000次抽样)计算,该区间重新抽样类别并汇总每个答案的惊奇度,与标题均值的答案加权估计量相匹配。

相似文章

前沿大型语言模型的响应漂移

arXiv cs.CL

一项针对10个前沿大语言模型、涵盖62个问题的大规模人类评估发现,所有模型都表现出响应漂移,其中大多数模型收敛到78-81%的偏差上限,而两个模型实现了较低的偏差。漂移程度因领域和问题而异,自动指标几乎无法解释人类判断,这凸显了人类评估的必要性。

一些大型语言模型表现出一致的风险态度

arXiv cs.AI

本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。