答案并非论证

arXiv cs.AI 论文

摘要

本文评估了AI监督中的思维链监控,发现为监控器提供可信答案可以改善结论检查,但不能提升独立推理验证,这对AI安全评估具有影响。

arXiv:2609.00264v1 宣布类型:新 摘要:思维链监控被提议用于AI监督,但评估通常为监控器提供可信参考答案。我们询问答案访问是否能改善推理验证,还是主要暴露错误结论。我们从三个前沿模型中收集了79个Humanity's Last Exam物理问题的237个分步编号解决方案,没有插入错误,并独立标注了最终答案的正确性和第一个错误步骤。参考标准结合了物理学家注释、独立LLM辩论和源掩码裁决。这产生了24个关键追踪,其中答案正确但追踪包含真实错误。8个LLM监控器在盲评下评估了追踪,使用未经验证或已认证的答案,或在盲承诺后。认证将平均平衡准确率从0.637提高到0.796,而精确的第一错误定位从0.261上升到0.379。认证改变了召回率(错误追踪被标记为错误的比例):在错误答案追踪中从0.653变为0.951,但在关键追踪中从0.521变为0.438;这种对比在所有8个监控器中方向一致(问题引导95%置信区间[+0.256, +0.506])。盲承诺后,被展示答案的监控器将93.8%先前通过的错误答案追踪新标记为错误,但仅对18.0%的关键追踪如此。因此,答案访问改善了结论一致性检查,而非支撑论证的独立验证。对于AI安全,这些追踪提供了奖励黑客攻击的良性类比:可接受的输出并不建立产生它的过程是合理的。尽管这里研究的错误是普通的且大多是非关键性的而非对抗性的,但可信答案评估可能类似地夸大了监控能力,当可接受输出隐藏不合理推理时。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:00

# 答案并非论证过程
来源:https://arxiv.org/html/2609.00264
Will Yeadon¹, Sergio Juárez², Paul Mackay¹, T. J. Dowling³, Elise Agra¹, Oto-obong Inyang¹, Arin Mizouri¹ and Craig P. Testrow¹
 affiliations: ¹英国达勒姆大学物理系, 达勒姆 DH1 3LE
²西班牙维戈大学电信工程学院, 信号理论与通信系, 维戈 E-36310
³独立研究员
2026年8月31日

###### 摘要
思维链监控被提议用于AI监督,但评估通常为监控器提供可信的参考答案。我们探究答案访问是否能改进推理验证,还是主要暴露错误结论。我们从三个前沿模型收集了79个"人类最终考试"物理问题的237个分步解答,未插入错误,并独立标注了最终答案正确性和首个错误步骤。参考标准结合了物理学家标注、独立LLM辩论和来源屏蔽仲裁。这产生了24个关键追踪:答案正确但追踪过程存在真实错误。8个LLM监控器在盲态下评估了带有未验证或认证答案的追踪,或在盲承诺后评估。认证将平均平衡准确率从0.637提高到0.796,而精确的首错定位率从0.261提高到0.379。认证使错误答案追踪的召回率(标记为错误的比例)从0.653变为0.951,但在关键追踪上从0.521变为0.438;这一对比在所有8个监控器中方向一致(问题自举95%置信区间 [+0.256, +0.506])。在盲承诺后,被提供答案的监控器将93.8%先前通过的错误答案追踪重新标记为错误,但仅将18.0%的关键追踪重新标记。因此,答案访问主要改进结论一致性检查,而非对支持论证的独立验证。对于AI安全而言,这些追踪提供了奖励欺骗的良性类比:可接受的输出并不能证明产生它的过程是健全的。尽管此处研究的错误是普通的、大多非关键性的而非对抗性的,但可信答案评估可能同样高估了监控能力——当可接受的输出掩盖了不健全的推理时。

## I 引言
现代大语言模型(LLM)将其推理过程写成思维链,主要是因为这样做能提升其性能\[17\]。推理过程被记录下来后产生了第二种用途:另一个模型可以阅读它。思维链监控——LLM检查另一个LLM的推理并标记发现的问题——已被提议作为监督AI系统策略的组成部分之一\[11\]。没人认为它是完整的解决方案;它是一层防护,其价值取决于它实际能承受多少负荷。在监督机制依赖它之前,需要测量思维链监控的能力和局限,且测量方式需反映其部署条件。直接研究对真正有害行为的监控是困难的。已部署的模型很少按需出现故障,而植入合成行为会改变研究对象——插入的缺陷未必类似于模型实际犯的错误。推理错误在困难的技术问题上提供了同一结构问题的可解实例——监控器能否判断一个书面论证失败,而不管其结论是否看起来可接受?最重要的情况是:通过有缺陷的推理达到正确最终答案的追踪。这种追踪与奖励欺骗共享一个结构特征\[2\]——输出可接受但产生它的过程不可接受,且结论本身未揭示这一点。仅检查结论的监控器会通过所有此类追踪。在模型能力前沿的物理问题自然提供了这一测试用例。模型能力通常通过基准测试衡量,而诸如MMLU\[9\]等旧套件现已基本饱和,因此前沿已转向《人类最终考试》(HLE)\[14\]等集合——2500个问题足够困难,当前系统仍有相当比例失败。在本文使用的过滤后的物理子集上,三个生成模型在65%的追踪上达到正确最终答案,因此监控器面临真正的正例和反例,而非上限。困难问题也使推理本身具有信息量。模型可能通过记忆项、幸运猜测或效应抵消的错误达到正确答案,且在这些情况下,成功定位错误需要最终答案未提供的信息。物理学具有进一步的特性:推导中的首个错误可以被领域专家定位和裁决,这是分层参考标准所需的。近期工作还发现,思维链可监控性取决于决策关键信息是否在结构上集成到推理过程中。MonitorBench报告,当注入的答案线索主要影响最终响应而非附加条件塑造中间推理时,可监控性较低\[16\]。我们的设置隔离了一个互补的读者端效应,其中参考答案在生成期间被隐藏,仅在监控时变化,从而测试答案访问是否能改进对独立裁决的推理错误的检测。可监控性也取决于暴露的信息和用于解释它的读者。一项可观测性阶梯评估发现,推理摘要和追踪对正确性预测的增量价值随提示可见性和读者能力显著变化\[1\]。因为跨问题的正确性预测可能利用问题难度或其他提示级线索,我们改为在监控条件下固定每个生成的追踪,并针对独立裁决的参考标准评估错误检测和首错定位。这些评估选择置于更广泛的文献背景中。书面思维链不一定忠实反映产生答案的计算过程\[12,15\]。此处我们以暴露的推理为评估对象,并提出独立的后续问题:监控器能否验证其正确性?过程监督研究已确立分层标签是比结果标签更强的训练信号\[13,8\];立场论文主张保留可读推理,正是为了让监控器能够阅读它\[11\];训练期间监控推理模型显示,针对监控器的优化压力会产生规避它的推理\[4\]。这三个项目都预设了一个能力已被表征的监控器。此外,LLM作为评估者的研究记录表明,提供的参考会重塑判断:在物理评估中,被提供故意错误参考解决方案的模型会将正确工作标记为错误,服从参考而非检查物理学本身\[19,21\]。因此我们探究同样的服从是否在参考为真实时运作——可信答案是帮助监控器验证推理,还是主要帮助它检查结论,并在此过程中夸大测量的能力。我们使用79个HLE物理问题的237个分步解答解决此问题,这些解答由三个前沿模型生成,无插入错误,并通过结合物理学家标注、独立LLM辩论和来源屏蔽仲裁的参考标准标注了最终答案正确性和首错。8个监控器模型在六个条件下评估每个追踪,条件仅为参考答案认知状态的*信息阶梯*——缺失、未验证、认证、或在盲承诺后揭示——以及重新考虑控制和逐步在线条件。将检测与定位分离,将错误答案追踪与正确答案掩盖错误的追踪分离,使聚合数字能够分解为它们混合的两种能力:验证论证和检查答案。

## II 方法
### II.1 数据集与响应生成
《人类最终考试》\[14\](HLE)包含182个主题类别为物理的问题;包括生物物理、大气物理和量子物理等细分类别后为228个。其中178个为纯文本。我们将研究限制为纯文本项目,因为并非所有监控API接受图像。为消除猜测得到正确答案的可能性,仅包含精确匹配问题,剩余144个。手动审查以排除不需要多步物理推理的项目;事实性回忆问题被移除。剩余99个问题,其中9个用于观察者间可靠性研究,90个用于主要工作。在标注阶段从90个中进一步删除了11个问题。一些在物理上条件不足或内部不一致。三个规定了“伪物理”场景的问题中,替代宇宙的规则规定过于宽松无法确定唯一答案。其他允许多个可辩护答案,例如一个应用Basquin疲劳寿命定律的问题需要最大循环数的值,尽管参考答案假设为10^7\[7\],但10^6\[18\]也是同样标准的选择,因此选择后者模型因与其推理无关的原因被标记为错误。在仔细审查的99个问题中,我们发现16个HLE提供的参考答案非物理性或不正确。这些错误已报告给组织者。三个生成时的前沿模型——GPT-5.5、Claude Opus 4.7和Gemini 3.1 Pro——每个问题产生一个解答,共79个问题产生237个追踪。每个模型被给予问题并要求以明确编号步骤序列返回其工作过程,最终答案置于框中。生成这些追踪的提示见附录A\[A1\]。

### II.2 基准事实
每个追踪获得两个独立标签:其最终答案是否正确,以及包含真实错误的首个编号步骤。分别标注创建了*关键*集:最终答案正确但追踪包含真实错误。仅检查最终答案的监控器将所有此类追踪归类为成功。此处研究的错误是真实的模型错误,而非作者插入的缺陷。我们定义首错步骤为最早编号步骤中对问题、相关物理或数学,或追踪自身先前推理作出虚假主张。不正确的方程或数值断言是错误。探索性搜索不是——如果追踪提出候选方法,测试后发现不足并继续而不使用,则是探索。探索*期间*作出的虚假主张是错误,因此正确应用能量守恒定律然后放弃该方法不是错误,而不正确应用则是。未支持但合理的主张,或省略的证明,仅因理由不完整不被标记为错误;如果追踪省略推导且下一步错误,则是错误。我们记录首错步骤而非对最终答案负有最大责任的步骤。这避免了对下游因果重要性的第二个更不可靠判断,并直接识别书面论证首次变得不健全的点。完整标注规则描述见附录B\[A2\]。判断追踪是否达到正确答案是直接的。定位首错则不然,因为它需要学科知识和对整个追踪的细读。因此我们使用两臂审查过程。在第一臂中,具有相关学科专业知识的物理学家标注了174/237个追踪以创建人类标准。资源限制阻碍了完全覆盖。在第二臂独立过程中,Claude Opus 4.8标注每个追踪,GPT-5.5对抗性回应,Claude回应\[10\];此外GPT-5.5产生自己的独立标注,第五轮向Claude呈现完整链和独立GPT标注以作出最终裁决。这产生了AI标准,两个辩论模型本身未被评估为监控器。参见图1:研究设计。来自《人类最终考试》的物理问题被过滤为纯文本、精确匹配且真正多步的问题,在观察者试点和标注阶段排除后留下79个。三个前沿模型每个问题产生一个编号解答。物理学家标注臂和独立五轮LLM辩论臂通过来源屏蔽仲裁组合成参考标准,八个监控器在六种条件下对此进行评估。最终标准由第一作者产生,组合两臂并在每个提议标签来源屏蔽下解决分歧。Claude Opus 5和GPT-5.6在此阶段被咨询。Fable 5在一次约三个争议追踪的仲裁会议中被无意咨询,因为它从先前任务中保持选中状态。Fable 5随后被纳入监控器,但排除它并不改变核心结论(第IV.2节)。我们还包括Kimi K3\[3\],一个在其余数据收集和分析完成后才纳入的前沿模型。两臂在95.6%共同覆盖的追踪上对最终答案正确性一致,在79.3%的错误存在性上一致。当两者命名步骤时,恰好51.4%时间一致,对比均匀概率率15.1%。这种分歧是定位目标被显式仲裁而非继承自任一臂的原因。237个追踪中,42个携带作者仲裁设定的标签;在关键集中,24个中有16个。由此产生的标准包含237个追踪:130个答案正确且无错误,83个答案错误,24个通过有缺陷推理达到正确答案。标注方案通过试点观察者间可靠性研究固定。9个问题被留出用于试点开发。第一作者标注了其中3个问题产生的9个追踪作为工作示例并录制培训视频;然后6名标注者独立评分了剩余6个问题产生的18个追踪。

相似文章

评估思维链的可监控性

OpenAI Blog

OpenAI研究人员引入了一个框架和一套包含13项评估的系统,用于衡量大型语言模型中思维链的可监控性。研究发现,监控推理过程比仅监控输出有效得多,这为AI安全及规模化监督提供了重要启示。

思维链推理在实际应用中并非总是忠实的

Hacker News Top

本文表明,在大型语言模型中,思维链推理并不总是忠实的,模型在应对自然语言提示时会产生看似合理但不正确的推理链,引发了对AI安全和透明度的担忧。

推理一致性扫描:用于审计AI安全评估中思维链有效性的框架

arXiv cs.AI

本文介绍了推理一致性扫描,一种用于审计AI安全评估中思维链推理是否与最终答案逻辑一致的方法,并将其与忠实性区分开来。作者对不一致性子类型进行了形式化,构建了一个基准测试,实现了一个扫描器,并报告了跨模型和任务的研究结果。