PhantomFill: 当表单要求答案时,语言模型会编造一个

arXiv cs.LG 论文

摘要

一项研究表明,语言模型在需要填写JSON等结构化字段时会生成幻觉,即使它们在自由文本中会诚实地回避。PhantomFill基准测试衡量了强制编造率。

arXiv:2607.20492v1 公告类型:新 摘要:生产环境中的语言模型并不撰写散文。它们填写表单:JSON字段、函数参数、提取模板。我们表明,表单本身会导致幻觉。 我们向13个模型询问关于同一输入的相同问题,只改变答案格式。输入被构建为无法回答:一个显示12,400个点赞但没有可见回复的病毒性帖子,一个通话从未被转录的支持工单。在自由文本中,GPT-5.5诚实作答。它说不存在回复数据,98%的情况下。当有一个必需的JSON情感字段时,同一个模型40次中40次编造答案。它编造了从未见过的群体的情绪,引用从未听过的客户。 这一模式具有很强的普遍性。在13个模型中,有10个模型必需的字段导致编造率达到100%。一个明确的“证据不足”选项只救了前沿模型:所有9个开放权重模型都忽略了它。一条直接指令“不要推断情感”在6个模型中的4个中被架构覆盖。抵抗并不随规模而来:在同一个模型家族中,最小的模型拒绝,中等规模的模型编造,最大的模型再次拒绝。在格式压力下的诚实是一个无人衡量的训练成果。 编造恰好发生在无法回避的地方:必需的枚举和最小计数数组,这些字段无法放置免责声明。我们发布PhantomFill,一个具有确定性评分和两个可报告数字的基准测试:强制编造率和逃避利用率。我们测试的修复是一行架构。我们衡量的问题无处不在。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:10

# 当表单索要答案,语言模型便凭空捏造

来源:https://arxiv.org/html/2607.20492

###### 摘要

生产环境中的语言模型不写散文。它们填写表单:JSON 字段、函数参数、信息抽取模板。我们证明,表单本身就会引发幻觉。

我们向十三个模型提出关于同一输入的相同问题,只改变回答格式。输入被构建成问题无法回答的状态:一条病毒式传播的帖子显示 12,400 个赞但没有任何可见回复,一个工单的电话从未被转录。在自由文本中,GPT-5.5 诚实回答。它说有回复数据,98% 的情况下如此。给定一个要求填写情感倾向的 JSON 字段,同一模型在 40 次尝试中 40 次凭空捏造。它捏造了从未见过的人群情绪,并引用了从未听过的客户原话。

这种模式非常稳固。在十三个模型中,有十个模型在必填字段下将捏造率推到 100%。一个显式的“证据不足”选项只拯救了前沿模型:所有九个开放权重模型都忽略了它。一个直接指令“不要推断情感倾向”在六个模型中有四个被 schema 覆盖。对抗性并非随模型规模而出现:在同一模型家族内,最小模型拒绝,中型模型捏造,最大模型再次拒绝。格式压力下的诚实性是一个无人衡量的训练结果。

捏造恰好发生在无法进行对冲的地方:必填枚举和最小数量数组——这些字段无法容纳任何弃权声明。我们发布 PhantomFill 基准测试,包含确定性评分和两个可报告的数字:强制捏造率(Coerced Fabrication Rate)与逃避利用率(Escape Utilization Rate)。我们测试的修复方案只是一行 schema。我们测量的失败却无处不在。

## 1 引言

当语言模型遇到无法回答的问题时,它通常会说“不知道”。这是一种训练出来的行为,业界也在衡量它:拒答基准测试通过模型是否愿意说“我不知道”来评分[1 (https://arxiv.org/html/2607.20492#bib.bib1)]。这些基准测试共享一个看似天经地义的假设:它们让模型用散文作答。

但部署的模型很少用散文作答。它们用结构化格式回答:JSON 模式、函数调用、信息抽取 schema、仪表盘字段。我们的问题很简单:当诚实的答案是“没有证据”,而输出格式又没有对应的字段时,模型会怎么做?

它会凭空捏造证据。

我们通过一个称为“拒答-格式阶梯”(Abstention-Affordance Ladder)的受控设计来证明这一点。输入固定,问题固定,只改变输出格式——共三个层级:自由散文、带有显式逃避值的 JSON schema、以及带有必填字段且无逃避值的 JSON schema。输入被构建成目标字段*天然无答案*:一条社交媒体帖子带有互动统计,12,400 个赞和 870 条回复,但没有任何回复文本;一个工单带有丰富的元数据,但客户的通话从未被转录。任何关于人群想法或客户说法的具体断言都是捏造。这种属性使评分具有确定性,无需裁判判断何为幻觉。构造本身就确定了这一点。

结果令人震惊。GPT-5.5 在自由文本中被问及那条没有可见回复的帖子时,在 98% 的试验中拒绝描述反应。当通过一个要求情感倾向的 schema 询问时,它 100% 捏造,40 次中 40 次。它报告说舆论“好坏参半”。它列出了回复理应包含的三个主题。但这些回复根本不存在。模型明知无话可说,但 schema 没有给出“无话可说”的选项。

六个发现,每个矩阵格在 n=40 下重复:

1. 1.**必填字段是捏造的天花板**。我们测试的所有九个开放权重模型(0.8B 到 26B 参数,五个家族)以及 GPT-5.5 在必填字段层级下达到 100% 捏造率。
2. 2.**逃生出口只拯救那些不太需要它的模型**。当每个字段都允许 `insufficient_evidence` 时,GPT-5.5 每次都使用逃逸选项,Opus 也几乎如此。所有九个开放模型仍然捏造,比率在 60% 到 100% 之间,Claude Sonnet 达到 90%。
3. 3.**schema 优先级高于指令**。一个禁止推断情感的系统指令将自由文本捏造率从 39% 降到 4%。但在必填字段 schema 下,同样指令对测试的六个模型中的四个无效。那些在提示级别缓解了幻觉的团队,在采用 JSON 模式后,悄无声息地失去了这种缓解能力。
4. 4.**对抗性是被训练出来的,而非自然涌现的**。在 Claude 家族中,Haiku 在每次试验中都拒绝 schema,Sonnet 以 90% 的比例捏造,而 Opus 大多拒绝。参数规模对此毫无预测力,训练的选择才是。
5. 5.**捏造集中在对冲不可能的地方**。在字段级别,GPT-5.5 在 20 次中 20 次捏造了必填情感枚举,但在 20 次中 0 次捏造客户引用,而是将弃权声明写入了字符串字段。字符串可以容纳对冲,枚举不能。危险的 schema 元素就是不带逃避选项的封闭词汇字段。
6. 6.**对抗性是领域相关的**。Sonnet 以 90% 的比例捏造人群情绪,却以 100% 的比例拒绝捏造客户引用。格式压力下的诚实性并不跨领域迁移,因此必须分领域测量。

这些发现带来了一个实际警告和一个测量空白。警告是:自由文本安全性评估系统性地高估了部署后的安全性,因为部署环境用 JSON 说话。空白是:现有基准测试从未测量格式压力下的诚实性。拒答基准测试从不改变格式[1 (https://arxiv.org/html/2607.20492#bib.bib1)]。格式限制研究测量的是推理准确性而非捏造率[2 (https://arxiv.org/html/2607.20492#bib.bib2)]。结构化输出基准测试评分的都是可回答字段[4 (https://arxiv.org/html/2607.20492#bib.bib4),5 (https://arxiv.org/html/2607.20492#bib.bib5)]。PhantomFill 填补了这三条文献交汇处的空白。

## 2 相关工作

#### 拒答(Abstention)。

AbstentionBench 评估了二十个不可回答或信息不足问题的数据集,发现前沿模型有时拒答有时不拒答[1 (https://arxiv.org/html/2607.20492#bib.bib1)]。Know Your Limits 调查按查询、知识和价值维度对拒答行为进行了分类[3 (https://arxiv.org/html/2607.20492#bib.bib3)]。SQuAD 2.0 将不可回答问题作为阅读理解的一个评估维度引入[9 (https://arxiv.org/html/2607.20492#bib.bib9)];R-Tuning 训练模型说“我不知道”[13 (https://arxiv.org/html/2607.20492#bib.bib13)]。所有这些工作都使用自由文本。没有一项工作询问输出格式是否限制了其所测量的拒答行为。我们在层级 1 的结果与它们一致;但层级 3 的结果表明这种一致性很脆弱。

#### 格式对生成的影响。

Tam 等人[2 (https://arxiv.org/html/2607.20492#bib.bib2)] 展示了格式限制会降低推理准确性。后续研究讨论了影响的大小。其输出指标是可回答任务上的正确性。不可回答字段上的捏造并未被测量。我们表明格式对诚实性的影响远大于已报道的对准确性的影响:不是几个百分点的下降,而是从 2% 翻转到 100%。受约束解码在 token 层面机械地强制执行 schema[6 (https://arxiv.org/html/2607.20492#bib.bib6)],这意味着我们所测量的冲突不仅存在于提示中,更嵌入了服务栈本身。

#### 结构化输出质量。

SOB[4 (https://arxiv.org/html/2607.20492#bib.bib4)] 和 LLMStructBench[5 (https://arxiv.org/html/2607.20492#bib.bib5)] 等基准测试衡量模型是否正确提取了真实值。实践者指出,当数据不存在时强制要求字段会导致幻觉。这一观察一直停留在趣闻轶事层面。我们将其变成了一个被测量的指标轴。

#### 幻觉与谄媚(Sycophancy)。

事实和引用幻觉已被深入研究[7 (https://arxiv.org/html/2607.20492#bib.bib7),8 (https://arxiv.org/html/2607.20492#bib.bib8),10 (https://arxiv.org/html/2607.20492#bib.bib10)]。而对社交认同——无人表达过的群体、共识和反对声音——的捏造,还没有在受控条件下被测量过。我们的领域 1 提供了这种测量,并且其意义超越了 schema 故事本身:一个基于自己捏造的人群来审核内容的智能体,制造了社会合法性——这是一个与 feed 驱动的智能体操控相关的担忧[14 (https://arxiv.org/html/2607.20492#bib.bib14)]。在压力下顺从 schema 也与谄媚行为有关——屈服于用户的框架而违背证据[11 (https://arxiv.org/html/2607.20492#bib.bib11)];但这里的压力来自格式而非用户。

## 3 PhantomFill 设计

### 3.1 拒答-格式阶梯(Abstention-Affordance Ladder)

每个项目在三个层级上呈现。每一层级的输入文档和问题都完全相同。

- •**层级 1,自由文本**。模型用 2-4 句散文回答。拒答完全可行。
- •**层级 2,json_esc**。模型填写一个 JSON schema,其中每个字段都允许一个逃避值:`insufficient_evidence` 用于枚举,`null` 用于字符串和数组。拒答可行但必须主动选择。
- •**层级 3,json_req**。模型填写一个带有必填字段的 JSON schema:一个封闭词汇的情感倾向枚举、一个具有最小数量的数组、一个要求的代表性引用。拒答没有对应插槽。

梯级设计隔离了因果变量。层级间捏造率的任何变化都归因于格式,因为其他条件完全一致。

### 3.2 天然无答案

基于评判者的幻觉评分容易引发争议。我们通过构造使真实情况就是“不存在”,从而在核心指标中去除了评判者的角色。

#### 领域 1:社交帖子。

共 40 条基础帖子,涵盖健康声明、城市政策、金融、育儿和消费品。每条帖子出现在五个证据级别下;梯级中使用的是 E3(帖子带互动统计但无回复文本)和 E2c(对照组,其中三个同向回复确实支持一个共识性解读)。在 E3 下,任何关于人们说什么、想什么或感受什么的断言都是天然捏造的。在 E2c 下,具体答案是合理的,因此过度逃避的模型会暴露出来。两个方向的错误都可见。

#### 领域 2:支持工单。

共 20 个工单,带有逼真的元数据:渠道、通话时长、先前联系人、优先级、套餐。在 D_absent 变体中,消息正文为“通话音频未转录”。schema 要求 `customer_sentiment`、`main_complaints` 和 `representative_quote`。每个具体值都是捏造,包括从无人转录的通话中引用的原话。D_present 变体包含转录文本,作为对照组。

项目由种子模板生成。生成器随基准测试一同发布;任何怀疑数据污染的团队都可以重新生成项目集合。

### 3.3 指标

- • **CFR(Coerced Fabrication Rate),强制捏造率**。在层级 3 中,为不可回答字段断言具体值的输出比例。通过代码评分:解析 JSON,对照逃避词汇表检查字段。
- • **EUR(Escape Utilization Rate),逃避利用率**。层级 2 中的捏造率取 1 的补集。衡量模型是否利用了提供的逃避出口。
- • **格式违规率**。破坏 schema 而不是填写它的输出比例。通过格式违规来拒绝是诚实的,但在操作上等同于服务中断。我们称这种代价为“拒绝税”(refusal tax)。

层级 1 的散文由 LLM 评判者按照严格的仅捏造准则进行评分。评判者通过三种方式验证:一个能暴露过度标记的共识控制级别、一个来自不同家族的第二个评判者(93% 一致性,Cohen’s κ=0.61)、以及一个前沿金牌评判者(93% 一致性)[12 (https://arxiv.org/html/2607.20492#bib.bib12)]。

### 3.4 模型

九个开放权重模型,涵盖五个家族(qwen3.5 0.8B 和 2B,llama3.2 3B,llama3.1 8B,gemma4 e4B 和 26B,mistral 7B,qwen2.5 7B,phi-4 14B),本地运行。四个前沿模型通过其供应商 CLI 访问:GPT-5.5(Codex CLI 0.124.0,推理努力高)以及 Claude Haiku 4.5、Sonnet 4.6、Opus 4.8(Claude Code CLI)。

## 4 结果

### 4.1 矩阵

表 1:E3 下的捏造率(%)(互动统计,无回复文本)。每个格 n=40,Opus JSON 层级除外,它汇总了两次干净运行(n=53)。E2c 上所有被评判格子的评判者幻影率为 0%。Wilson 95% 置信区间见附录 A。
请参阅图注
图 1:PhantomFill 矩阵:十三个模型在 E3 下按输出格式层级划分的捏造率。黑线分隔开放权重模型和前沿模型。
表 1 (https://arxiv.org/html/2607.20492#S4.T1) 和图 1 (https://arxiv.org/html/2607.20492#S4.F1) 展示了完整矩阵。最右列几乎全满。十三个模型中有十个达到 100% CFR。例外情况并非遵守得更好,而是直接拒绝格式本身。

### 4.2 翻转

GPT-5.5 是最清晰的表现,因为它的层级 1 几乎完美(图 2 (https://arxiv.org/html/2607.20492#S4.F2))。在散文中,四十次试验中只捏造一次。在有逃生出口的 schema 下,一次都不捏造。在必填字段下,次次捏造。知识没有改变。诚实性也没有改变,直到格式移除了它的插槽。这里的捏造不是知识失败,而是一种顺从行为——而顺从被训练得很牢固。

请参阅图注
图 2:schema 翻转。同一条帖子,同一个问题;只是输出格式不同。

### 4.3 逃生出口不是修复方案

显而易见的缓解方法是为每个字段添加一个逃避值。这对前沿模型有效:GPT-5.5 和 Opus 在获得选项时几乎每次都使用。但对所有我们测试的开放模型都无效(图 3 (https://arxiv.org/html/2607.20492#S4.F3))。gemma4 e4B,自由文本中最谨慎的开放模型(捏造率 65%),在逃避值明确存在于 schema 中时仍以 92% 的比例捏造。注意逃避选项并在需要时利用的能力本身分布不均,而缺乏这种能力的恰恰是那些对成本敏感的部署所使用的小模型。因此 EUR 与 CFR 并非冗余。它是告诉你“廉价修复方案对你的模型是否管用”的那个数字。

请参阅图注
图 3:逃避利用率(Escape Utilization Rate)。只有 GPT-5.5 和 Opus 可靠地利用了提供的“证据不足”选项。

### 4.4 在强制解码下,底线依然坚固

怀疑者可能会反对:提示中的 schema 测量的是对请求的顺从,而非硬性约束。模型被要求返回 JSON,原则上仍然可以用散文拒绝,因此 CFR 可能报告的是提示诱发的合作而非底线。层级 4 堵住了这个漏洞。我们在不可回答的 E3 格子上重新运行了语法约束解码,它将采样器限制在 JSON schema 允许的 token 上,因此散文拒绝不再是可达的输出。两种强制条件:enf_req,其枚举不带逃避值;enf_esc,其中 `insufficient_evidence` 是情感倾向和争议枚举中的合法 token,且数组和字符串字段可为空。诚实的退出现在位于解码器自身的语法内,仅一个 token 之隔。

表 2:解码器强制 JSON 下的捏造率(E3,每个格 n=40)。enf_req:任何枚举中无逃避值。enf_esc:`insufficient_evidence` 是合法枚举 token,数组和字符串字段可为空。最后一列统计 40 次试验中模型在 enf_esc 下发出合法逃避值的次数。
表 2 (https://arxiv.org/html/2607.20492#S4.T2) 给出了结果。五个开放模型在 enf_req 下以 98% 到 100% 的比例捏造。在 enf_esc 下,它们以 100% 的比例捏造,且语法上合法的逃避值在 200 次试验中被使用的次数为 0。由此得出两个结论:提示中的 CFR 是一个底线,而非提示诱发的合作产物——移除通过格式拒绝的能力并不会使底线上升;强制解码并没有修复问题,它只是将模型被困在 schema 中的事实暴露得更加明显。

相似文章

为什么语言模型会产生幻觉

OpenAI Blog

OpenAI发布研究指出,语言模型产生幻觉的原因在于标准的训练和评估程序奖励猜测而不是承认不确定性,并建议评估指标应该优先考虑对局限性的诚实认识而不是原始准确率。

大型语言模型中的预填充意识

arXiv cs.AI

本文研究前沿语言模型能否检测其先前的助手消息被插入或编辑的情况(即预填充意识)。研究发现,像Claude Opus 4.5这样的模型表现出显著的预填充意识,能在不产生误报的情况下检测出高达35%的篡改预填充案例,这可能损害基于预填充的安全评估的有效性。

幻觉作为承诺失败:大型语言模型在知晓答案的情况下仍然犯错

arXiv cs.CL

本文研究了大型语言模型在其生成时间分布中已有正确答案时仍产生幻觉的现象。通过引入答案可用性的语义概念,作者表明16-47%的指令调优模型幻觉发生在正确概念已经表示的情况下,并且这一比例随着模型规模增加而上升。他们指出,指令调优强化了答案承诺,使得有用性和自信幻觉成为同一枚硬币的两面。