结构化输出导致44种语言模型的答案多样性崩溃

arXiv cs.CL 论文

摘要

一项研究表明,当要求大语言模型以JSON格式输出时,与普通聊天相比,其答案多样性显著下降,众数答案变得更加常见,而独特模型失去了一半的独特性。

arXiv:2607.18476v1 公告类型:新 摘要:当一个语言模型必须从大量同样有效的选项中选择一个答案时,一个格式条款——'仅以JSON回复'——会改变它选择的答案。我们重新运行了单词语料库 (arXiv:2607.12796):对44个模型提出了31个宽答案空间的类别提示,现在要求以JSON形式回复——没有强制模式,没有约束解码,只有请求。收敛性急剧加深:在无约束的'选择一个词'提示中,众数答案从41%上升到64%,不同答案数从52下降到36;平均答案选择惊奇度从1.80比特降至1.58比特。代价是累进的:44个模型中有6个分别移动(BH-FDR q=0.10),全部朝向众数,由最独特的模型引领,而顺从的底部模型则保持不变。这是一种锐化器,而不是重新索引器——普通聊天的众数答案在31个类别中的28个中幸存下来。默认值是按照语域索引的:一个运行内重采样(n=20)发现JSON改变了模型稳定聊天默认值的53%,大部分回归大众,并安装了聊天中没有的默认值(Claude Fable 5在聊天中回答'天蓝色'颜色的概率为0%,在JSON中为100%)。全面控制实验揭示了语域梯度:压缩显著且特定于模型训练使用的答案交付格式(JSON -0.22比特,p=0.0002;XML -0.19,p=0.002),对于YAML和CSV不存在,而对于任意的括号包装则相反(+0.13,p=0.009)——这表明机制倾向于工具使用后的训练。在解码器(response_format)上强制模式并不比请求压缩得更多(-0.03比特):崩溃存在于模型对语域的响应中,而不是解码器。结构化输出是软件消费语言模型的方式,而这一表面由比聊天表面更同质化的模型提供,而聊天表面是评估、比较和选择模型的基础。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:23

# 结构化输出导致44种语言模型的答案多样性崩塌

来源:https://arxiv.org/html/2607.18476 \(2026年7月\)

###### 摘要

当语言模型必须从大量同等有效的选项中选择一个答案时,一个格式条款——*“仅以 JSON 回复”*——会改变其选择的答案。我们重新运行了“单字普查”[7 (https://arxiv.org/html/2607.18476#bib.bib39)],对44个模型提出了31个具有宽泛答案空间的类别提示,并要求以 JSON 回复:无模式强制、无约束解码,仅此请求。该领域的趋同性急剧加深:在无约束提示(“选一个词。”)下,模态答案的份额从41%上升至64%,不同答案的数量从52降至36;平均答案选择意外度从1.80比特降至1.58比特。这种“税”是**累进的**,并且尊重仪器的分辨率:44个模型中有6个模型各自发生了显著变化(BH-FDR \(q = .10\)),全部朝向众数,由该面板中最具特色的前沿模型领衔(最强的探索者损失了1.31比特——其测量到的独特性的半数)。格式是一种“锐化器”,而非“重索引器”:纯聊天模态答案在31个类别中的28个中幸存下来,三次翻转恰好发生在纯模式最弱的类别上。*默认值按语域索引*:一次运行内重采样(\(n=20\))发现 JSON 改变了模型稳定聊天默认值的53%,大多数回归到群体,并且*安装了*聊天中不存在的默认值(Claude Fable 5 在聊天中回答颜色为*cerulean*的概率为0%,在 JSON 中则为100%)。全面电池控制揭示了一个语域梯度:压缩显著且特定于模型被训练来回答的答案交付格式(JSON −0.22 比特, \(p = .0002\); XML −0.19 比特, \(p = .002\); 在模型和类别间置换),在 YAML 和 CSV 中不存在,并且对于任意括号包装器*反向* ( +0.13 比特, \(p = .009\) ) —— 将机制权重倾向于工具使用后训练,尽管每种序列化都会集中无约束池,因此语料库-语域成分仍然可见。在解码器处强制模式(response_format)不会比请求(−0.03 比特)进一步压缩:崩塌存在于模型对语域的反应中,而非解码器中。结构化输出是软件消费语言模型的方式;该界面由一个可测量的、比聊天界面(模型在此界面上被评估、比较和选择)更同质的模型服务。

## 1 引言

软件并非以散文形式消费语言模型。它要求 JSON。每个调用工具的主体、每个提取字段的流水线、分类记录、填充模式或路由请求,都会在数据结构内收到模型的答案——而这些流量日益超过模型被基准测试、排名和选择的聊天窗口。本文提出了一个关于该界面的问题:当同一个模型以序列化格式而非散文回答同一个问题时,它会给出相同的答案吗?配套的“单字普查”[7 (https://arxiv.org/html/2607.18476#bib.bib39)] 构建了一个故意狭窄的仪器。当一个模型必须从大量同等有效的选项中选择一个答案时——*“说出一种树。仅用一个词回复。”*——它会选择哪一个,它与其他模型选择相同答案的频率如何?度量指标是**答案选择意外度**:一种留一法度量,以比特为单位,衡量在合并所有其他模型答案的池中,模型答案的不可能性,通过对归一化的单字回复进行精确匹配计算——无嵌入、无 LLM 裁判、无人类标注。跨44个模型,它发现了一种单一文化(*oak* 占据树答案的94%;*serendipity* 占据无约束“选一个词”答案的41%),该文化由宽泛的每个模型一致性范围,以及对于少数模型,构成可测量特征的稳定偏离模式默认值所结构化。我们除一个方面外完全不变地重新运行该仪器:回复以序列化格式请求。*“说出一种树。仅以 JSON 回复,格式为 \{"word": ""\}。”* 无模式强制、无约束解码、无令牌掩码——仅此请求。31个提示、44个模型面板和条件(无系统提示、请求温度1.0、四个样本)与普查相同;唯一被操纵的变量是答案交付的语域。由于意外度在每个格式列*内*计算——JSON 答案针对 JSON 字段评分——列的趋同性是该列的内部属性,而非比较一个语域与另一个语域的人为产物。我们的贡献:

1. 1. 一种累进格式税(§4.1 (https://arxiv.org/html/2607.18476#S4.SS1))。字段平均意外度从1.80降至1.58比特(每个模型 −0.22 比特,\(p = .0002\)),但下降并不均匀:44个模型中有6个模型各自发生显著变化(BH-FDR \(q = .10\)),全部朝向众数,由该面板中最具特色的模型领衔(最强的探索者损失了1.31比特),而墨守成规的底线是不动的,并且正 Δ 尾部的部分是语域不变的搁浅而非发散——一个面板无关的检查将两者分开。剩余的 Δ 形成一个噪声平台,我们拒绝对其进行排名。
2. 2. 一种锐化器,而非重索引器(§4.2 (https://arxiv.org/html/2607.18476#S4.SS2))。纯聊天模态答案在31个类别中的28个中幸存;三次翻转恰好发生在纯模式最弱的类别上。
3. 3. 按语域索引的默认值(§4.4 (https://arxiv.org/html/2607.18476#S4.SS4))。一次运行内重采样(\(n=20\))显示语域显著改变了模型稳定聊天默认值的53%(大多数回归到群体),并且*安装了*聊天中不存在的仅有语域默认值——从离散的答案行为中读取,而非有噪声的分数 Δ。
4. 4. 一种语域梯度(§4.5 (https://arxiv.org/html/2607.18476#S4.SS5))。压缩显著且特定于模型被训练来回答的答案交付格式(JSON、XML),在 YAML 和 CSV 中不存在,并且对于任意非数据包装器*反向*——将机制权重倾向于工具使用后训练,同时留下可见的语料库-语域成分。
5. 5. 一种廉价、可重复使用的方法。操作是在冻结的仪器上增加一列,格式合规性作为一项常备能力指标从每次运行中自然得出。

## 2 相关工作

#### 格式限制与准确性。
最接近的前期工作询问格式*限制*是否会降低任务性能。Tam 等人 [10 (https://arxiv.org/html/2607.18476#bib.bib32)] 报告要求结构化输出会降低推理准确性;Kurt [3 (https://arxiv.org/html/2607.18476#bib.bib33)] 质疑该结果,将其归因于提示设计和解析而非格式本身。我们的问题与这场争论正交:我们的提示没有错误答案,因此没有准确性可降低。我们测量选择了哪个有效答案,而非是否达到了正确的一个。

#### 解码器级别的强制。
2026年的一条研究线命名了在解码器处*强制*结构的成本——即“约束税”[8 (https://arxiv.org/html/2607.18476#bib.bib34),5 (https://arxiv.org/html/2607.18476#bib.bib35)] 和“格式税”[4 (https://arxiv.org/html/2607.18476#bib.bib36)]:语法约束解码提高了有效性,同时降低了正确性并抑制了诸如工具调用等行为。但它们通过令牌掩码约束采样器;我们什么也不掩码,只是请求。因此,我们测量的效果存在于模型对语域的反应中,而非解码约束中。

#### 语法内的多样性。
Luan 等人 [6 (https://arxiv.org/html/2607.18476#bib.bib37)] 通过基于自动机的引导将多样性工程化回约束生成中。该工作预设了我们所描述的崩塌——它是一种工程修复方法,针对的是本文在仅有请求、无语法参与的情况下所测量的现象。

#### 表面形式与语域。
Sclar 等人 [9 (https://arxiv.org/html/2607.18476#bib.bib38)] 展示了模型准确性对虚假的格式选择敏感;普查展示了答案*选择*对措辞敏感(*gemstone* 与 *precious stone*)。本文增加了第三个轴:不仅问句如何措辞,还有答案被请求的语域。所有这一切背后的基础是模式崩塌文献 [1 (https://arxiv.org/html/2607.18476#bib.bib1),11 (https://arxiv.org/html/2607.18476#bib.bib3),2 (https://arxiv.org/html/2607.18476#bib.bib5)],该文献记录了我们所利用的趋同性,并指出 LLM 裁判系统性地偏好模态输出——这是我们的仪器保持无裁判的原因之一。

## 3 方法

### 3.1 仪器

该仪器是*单字普查*,未作改动 [7 (https://arxiv.org/html/2607.18476#bib.bib39)]:31个单轮提示(30个形式为*“说出一种[n] XX”*的类别提示,加上一个无约束的*“选一个词”*),无系统提示,请求温度1.0,每个单元格四个样本。每个答案通过其加一平滑的留一法答案选择意外度,针对其他43个模型的合并答案池进行评分,而模型的标题分数是其有效答案的平均值,以比特为单位。回复通过精确匹配规则和一个机械垃圾守卫(§3.3 (https://arxiv.org/html/2607.18476#S3.SS3))简化为单个归一化令牌。意外度在每个格式列*内*计算。JSON 答案针对 JSON 字段评分,纯文本答案针对纯文本字段评分。因此,一列的趋同性是该列的内部属性——它从来不是 JSON 文本与聊天参考的比较,因此不可能是语域移位本身的人为产物。每个模型的 *Δ*-意外度(JSON 减去纯文本)是标题量:语域移除的模型独特性有多少比特。

### 3.2 格式列

纯聊天列是普查记录。每个格式列重新运行所有44个模型的完整31类别电池,每个单元格四个样本(每列5,456次调用):JSON、XML、YAML、CSV,以及一个非数据的“方括号”包装器,最后一个用于将序列化与纯结构分开。子句逐字附加到普查提示后:

- • json: 仅以 JSON 回复,格式为 \{"word": ""\}。
- • xml: 仅以 XML 回复,格式为 <word>你的答案</word>。
- • yaml: 仅以 YAML 回复,格式为 ‘word: ‘。
- • csv: 仅以 CSV 回复:一个标题行 ‘word’,然后一个包含你答案的数据行。
- • brackets: 仅将你的答案放在方括号内回复,例如 [答案]。

任何地方都不使用 response_format 参数、工具模式或约束解码:每一列都是普通的聊天补全,与普查的唯一区别在于附加的子句。这是一个有意的范围选择:这些列测量*请求*的效果。引擎强制的 response_format 列在 §4.6 (https://arxiv.org/html/2607.18476#S4.SS6) 中单独分析。

### 3.3 解析与卫生处理

每个回复通过两个步骤简化为单个答案令牌。首先,格式包装器通过每种格式的正则表达式剥离——JSON "word" 字段的内容、<word> 标签之间的文本等——然后提取的字符串通过普查归一化和垃圾守卫未改动地传递。不符合其格式包装器的回复回落到应用于原始文本的普查规则,这样格式错误的回复就不能偷偷带入一个虚假的“新颖”答案:破碎 JSON 文章的最后单词完全按照普查的方式评分。在普查规则之外增加了一个守卫,因为填充包装器会引来普查提示无法产生的人为产物:一个令牌是类别名词或模板占位符的回复——字面上的 [city] 对于“说出一个城市”,或从槽位中提取的 answer/word——作为失败单元格被丢弃。每个模型每列的解析加垃圾存活率至少为99%,我们审计了每个意外度*上升*的模型的每模型存活率,因为不合规是制造明显发散的唯一人为产物(§4.5 (https://arxiv.org/html/2607.18476#S4.SS5))。在27,280个格式单元格中,91个(0.3%)是不可恢复的空值,集中在 YAML(56)中,在 JSON(1)中可忽略;所有分布性主张均基于存活单元格计算,每列解析存活率如上审计。

## 4 结果

### 4.1 格式税是累进的

字段平均答案选择意外度从纯聊天的1.80比特降至JSON的1.58比特。在44个模型上平均,每个模型的 Δ 为 −0.22 比特,在两个可交换单位上均显著(§4.5 (https://arxiv.org/html/2607.18476#S4.SS5)),但效果是集中而非分散的。形状是一个发散尾部坍塌到一个固定底线上(图1 (https://arxiv.org/html/2607.18476#S4.F1))。损失最多的模型是最有东西可损失的模型。deepseek-v3.2,普查中前沿实验室模型中唯一真正的探索者,从2.63比特降至1.32比特(−1.31)——其测量到的独特性的半数——当答案被要求为 JSON 时。hermes-4 损失 0.91,gpt-4o-mini 损失 0.92,gpt-4-turbo 损失 0.87,gpt-5.6-sol 损失 0.65。墨守成规的底线几乎不动:claude-opus-4.8 −0.16,grok-4.5 −0.07,claude-sonnet-5 −0.05。底线以下无处可去,尾部向其坠落,尽管原始范围几乎没有变化(2.2 到 2.0 比特):一个语域不变的少数派坚守阵地,而领域在其周围坍塌(§4.5 (https://arxiv.org/html/2607.18476#S4.SS5)),因此压缩在于平均值和坍塌的尾部,而非极端值。在无约束的“选一个词”提示中,相同的坍塌出现在没有任何类别锚定的情况下:*serendipity* 从池子的41%上升到64%,不同单词的数量从52降至36。哪些个体运动是真实的,我们在 §4.5 (https://arxiv.org/html/2607.18476#S4.SS5) 中讨论;累进的*形状*——尾部下降,底线固定——是总体的属性,不依赖于对表格中间部分进行排名。这种形状也不是向均值回归,这是“损失最多的模型最有东西可损失”的经典替代解释:普查分数的分半测试-重测信度为 \(r = 0.94\),因此纯重测量对最具特色模型预测的收缩量为0.05比特,而观测到的为1.31比特,每个个体显著的压缩器(§4.5 (https://arxiv.org/html/2607.18476#S4.SS5))都超过重测量噪声零假设3.7到10σ。

参考图题

图1:所有44个模型的答案选择意外度,开放聊天(灰点)与 JSON(彩色点)对比,按开放聊天分数排序。蓝色标记在 JSON 下变得*更通用*的模型(44个中的31个);琥珀色标记其相对分数*上升*的模型(13个——主要是被坍塌领域搁浅的语域不变模型,§4.5 (https://arxiv.org/html/2607.18476#S4.SS5))。顶部的特色模型向不动点的墨守成规底线滑动最远,字段平均值从1.80比特降至1.58比特。原始范围几乎不变(2.2→2.0),因为琥珀色模型撑住了顶部:压缩在于平均值和尾部,而非极端值。

### 4.2 锐化器,而非重索引器

如果语域仅仅是添加噪声,或者仅仅是施加结构,它可能将概率移动到任何地方。相反,它锐化了模型已有的分布。在31个类别中的28个中,JSON 模态答案与纯聊天模态是同一个词,并且不到4%的 JSON 答案质量落在纯普查从未产生的词上。语域将质量*移动到现有的众数上*,而非移动到新的答案上。三个例外具有诊断性:每个都是一个纯聊天模式较弱的类别。昆虫从*ant*(43%)翻转到*butterfly*(60%),棋盘游戏从*chess*翻转到*monopoly*,舞蹈从*salsa*翻转到*tango*。

相似文章

输出多样性在后训练中的崩溃发生在哪里?

arXiv cs.CL

本文研究了语言模型后训练期间输出多样性崩溃的位置和原因,分析了三个 OLMo 3 训练线(Think、Instruct、RL-Zero)在多个任务和指标上的表现。研究发现多样性崩溃主要由训练数据组成决定,并在训练期间嵌入到模型权重中,仅通过推理时调整无法解决。

One-Word Census: 44种语言模型中的答案选择趋同性

arXiv cs.CL

本文介绍了One-Word Census,这是一个用于测量44种语言模型答案选择趋同性的最小化工具,发现极端一致性(例如,94%的模型选择'oak'作为树木的答案)以及不同模型家族和代际之间差异的变化。

大型语言模型总是讲相同的故事吗?

arXiv cs.CL

本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。

前沿大型语言模型的响应漂移

arXiv cs.CL

一项针对10个前沿大语言模型、涵盖62个问题的大规模人类评估发现,所有模型都表现出响应漂移,其中大多数模型收敛到78-81%的偏差上限,而两个模型实现了较低的偏差。漂移程度因领域和问题而异,自动指标几乎无法解释人类判断,这凸显了人类评估的必要性。