超越准确率:在思维链推理中测量偏差识别以进行负责任的人工智能评估

arXiv cs.LG 论文

摘要

本文提出了一种轨迹级别的诊断方法用于评估思维链推理,将易感性(偏差是否改变答案)与识别(轨迹是否标记有偏输入)分开。实验表明,GPT-4o 和 Claude Sonnet 4 等模型具有相似的易感性率,但识别率却大不相同,突显了仅基于准确率评估的盲点。

arXiv:2606.15127v1 公告类型:新 抽象:推理模型越来越多地用于最终答案不是唯一审查对象的场景:教育工具可能向学生展示中间步骤,决策支持系统可能需要人工监督,审核工作流可能检查轨迹中是否存在误导或有偏输入。在这种情况下,两个回答可能获得相同的最终答案分数,但它们的轨迹是否明确标记了注入的有偏内容却有所不同。仅基于准确率的评估无法区分这些情况。我们将这一差距视为负责任评估中的测量盲点,并引入了一种最小化的轨迹级别诊断方法,包含两个维度:\emph{易感性}(偏差是否破坏了先前正确的答案)和\emph{识别}(轨迹是否包含标准定义的、对注入内容的表面引用)。在数千次有偏GSM8K试验中,GPT-4o和Claude Sonnet~4在相同标准下具有相似的易感性率($1.3\%$ 对比 $1.2\%$),但识别率却大不相同($13.0\%$ 对比 $75.0\%$)。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:37

# 测量思维链推理中的偏差认知:面向负责任AI评估
来源:https://arxiv.org/html/2606.15127
Wei Gao, Yingshuo Wang, Lingdong Kong, Yanhang Li, Zhichao Fan, Zexin Zhuang, Wenlong Dong, Zhiyuan Zheng, Hrishikesh Paranjape, Abhishek Mandal, Johnny R. Zhang

###### 摘要

推理模型越来越多地被用于最终答案并非唯一审查对象的场景:教育工具可能向学生展示中间步骤,决策支持系统可能需要人工监督,审计工作流可能会检查推理轨迹以发现误导性或偏差性输入。在这些场景中,两个响应可能在最终答案得分上相同,但它们的轨迹在是否明确标记注入的偏差内容上可能存在差异。仅基于准确性的评估会忽略这些情况。我们将此差距视为负责任评估中的一个测量盲点,并引入一个最小的轨迹级诊断框架,包含两个维度:*易感性*(偏差是否破坏先前正确的答案)和*认知*(轨迹是否包含由评估准则定义的、对注入内容的表面引用)。在数千个带偏差的 GSM8K 试验中,GPT-4o 和 Claude Sonnet 4 的易感性率相似(1.3% vs. 1.2%),但在相同的评估准则下,认知率差异显著(13.0% vs. 75.0%)。

思维链、忠实性、认知、偏差鲁棒性、负责任AI、可信AI、语言模型

## 1 引言

用于社会公益的AI系统通常部署在中间推理至关重要的场景中,而不仅仅是最终答案的正确性:教育工具、决策支持系统、非专业利益相关者阅读的分析报告,以及新兴的AI生成科学工作生态系统(Zhang et al., 2025a (https://arxiv.org/html/2606.15127#bib.bib27)),这些系统的审查通常关注推理过程的质量,而不仅仅是最终答案。除了以推理为中心的部署外,基于LLM的系统越来越多地嵌入到生产流程中,例如多模态推荐(Tian et al., 2024 (https://arxiv.org/html/2606.15127#bib.bib28); Wang and Tian, 2025 (https://arxiv.org/html/2606.15127#bib.bib29)),这扩大了评估方法所涉及的范围。在这些场景中,两个模型输出可能具有相同的最终答案,但其书面轨迹所展示的内容可能大相径庭。标准的最终答案准确性会掩盖这种区别。这种担忧与更广泛的趋势相呼应,即通过超越聚合任务准确性的属性来评估机器学习系统——包括对不透明预测的事后解释(Chen et al., 2022 (https://arxiv.org/html/2606.15127#bib.bib23))和生成系统中的偏差缓解(Fan et al., 2026 (https://arxiv.org/html/2606.15127#bib.bib24))——所有这些都共同诊断出单一指标评分无法定位对负责任部署至关重要的行为。

思维链(CoT)提示(Wei et al., 2022 (https://arxiv.org/html/2606.15127#bib.bib14); Kojima et al., 2022 (https://arxiv.org/html/2606.15127#bib.bib6))使这种区别变得可观察:模型在给出最终答案之前会产生一个明确的推理轨迹,该轨迹可以被检查。然而,在输入偏差下对CoT的标准评估仅对最终数字进行评分(§2 (https://arxiv.org/html/2606.15127#S2))。一个得出偏差答案但未提及注入内容的响应,与一个明确标记了注入内容的响应,即使它们产生了截然不同的推理过程,也会得到相同的分数。我们不将CoT视为内部推理的证据,而是采用一个保守的目标:我们询问轨迹对*人类读者*来说*可见*了什么,并将其作为一个独立的评估维度来报告。

具体来说,我们将偏差鲁棒性评估分解为每个试验的两个维度:*易感性*(注入的偏差是否改变了先前正确的最终答案?)和*认知*(书面轨迹是否包含由评估准则定义的、明确引用注入内容的表面信号?)。易感性仅从最终答案即可看出;而认知性只有在评估者阅读轨迹时才可见。这使我们能够询问答案级和轨迹级行为是否同步变化,或者模型是否可以在产生偏差的最终答案的同时,不产生由评估准则定义的认知。我们将认知(A)视为一种表面轨迹行为,而非内部认知的证据。

该基准包含 3,000 个响应(每个模型 1,500 个)对偏差干扰后的 GSM8K 提示。我们比较了 GPT-4o 和 Claude Sonnet 4 在三种偏差类型下的表现:无关上下文(Shi et al., 2023 (https://arxiv.org/html/2606.15127#bib.bib10))、数字锚定(Tversky and Kahneman, 1974 (https://arxiv.org/html/2606.15127#bib.bib13))和误导性提示(Turpin et al., 2023 (https://arxiv.org/html/2606.15127#bib.bib12))。每个响应带有两个认知标签:一个严格标签,由单独提示的LLM评判者根据我们的评估准则生成;以及一个更宽松的关键词过滤标签,匹配先前工作的惯例(Turpin et al., 2023 (https://arxiv.org/html/2606.15127#bib.bib12); Chen et al., 2025 (https://arxiv.org/html/2606.15127#bib.bib2)),以便直接比较。我们将在论文被档案场所接收后发布该基准。

### 贡献。

(i) 我们识别出在输入偏差下标准CoT评估中的一个测量盲点,并通过两个经验上可分离的维度*易感性*(答案级)和*认知*(轨迹级)以及一个复合轨迹差异率 TG 将其形式化。(ii) 我们通过在 3,000 个带偏差的 GSM8K 试验中,使用 GPT-4o 和 Claude Sonnet 4 在严格且经人工验证的评估准则下,针对三种偏差类型实例化了该诊断方法。在此样本上,两个模型在易感性方面几乎无法区分,但它们的无条件认知率差异显著(13% vs. 75%):这是一个最终答案评估所忽略的轨迹级差异。(iii) 我们将此诊断方法定位为在人机交互、高风险场景中负责任地使用推理模型的评估方法,同时将部署验证、机械可解释性以及超出本研究场景的广泛泛化视为本文范围之外的工作。

## 2 相关工作

### CoT推理的偏差注入评估。

先前的工作将受控扰动注入到推理问题中,并对最终答案准确性进行评分:在 GSM8K 上注入干扰项(Shi et al., 2023 (https://arxiv.org/html/2606.15127#bib.bib10))、GSM8K 的符号化重述(Mirzadeh et al., 2025 (https://arxiv.org/html/2606.15127#bib.bib9))以及对CoT的建议答案扰动(Turpin et al., 2023 (https://arxiv.org/html/2606.15127#bib.bib12))。最接近的方法论邻居是 Stolfo et al. (2023 (https://arxiv.org/html/2606.15127#bib.bib11)) 的因果框架,该框架量化了输入扰动对数学推理输出的影响;我们在答案级轴(易感性)旁边添加了一个轨迹级轴(认知),通过书面推理所暴露的内容来区分具有相同最终答案的响应。另一条研究路线询问 CoT 轨迹是否忠实反映了产生答案的过程(Turpin et al., 2023 (https://arxiv.org/html/2606.15127#bib.bib12); Lanham et al., 2023 (https://arxiv.org/html/2606.15127#bib.bib7); Arcuschin et al., 2025 (https://arxiv.org/html/2606.15127#bib.bib1); Chen et al., 2025 (https://arxiv.org/html/2606.15127#bib.bib2));我们的认知指标有意弱于机械忠实性、电路级分析(Chen et al., 2026b (https://arxiv.org/html/2606.15127#bib.bib22))或对于引用的RAG声明的证据-理由校准(Qian et al., 2026 (https://arxiv.org/html/2606.15127#bib.bib26)),它测量的是表面共现模式,而非因果声称。

### 可信和负责任AI的评估方法论。

越来越多的工作认为,聚合性的、仅关注准确性的基准忽略了与语言模型负责任使用相关的行为。Jin et al. (2021 (https://arxiv.org/html/2606.15127#bib.bib4)) 将评估目标的选择置于 NLP 为社会公益的视角下;Jin et al. (2023 (https://arxiv.org/html/2606.15127#bib.bib5)) 将因果推理评估分解为形式化的子组件,而不是单一的端到端指标;Zhang et al. (2025b (https://arxiv.org/html/2606.15127#bib.bib15)) 表明时间信号是基准污染的不可靠指标。智能体评估方法论将此扩展到了最终输出之外——涵盖多步LLM智能体的安全与安保审计(Luo et al., 2025 (https://arxiv.org/html/2606.15127#bib.bib8))、人在回路中的编程(Luo et al., 2026c (https://arxiv.org/html/2606.15127#bib.bib16))、文本到图像提示(Luo et al., 2026a (https://arxiv.org/html/2606.15127#bib.bib17))和RAG上下文冲突诊断(Chen et al., 2026a (https://arxiv.org/html/2606.15127#bib.bib25))——每个都在单一结果之外的多个维度上对行为进行评分。最近的测量和系统化工作针对智能体技能生态系统中的组合风险(Wang et al., 2026 (https://arxiv.org/html/2606.15127#bib.bib32); Jiang et al., 2026b (https://arxiv.org/html/2606.15127#bib.bib30)),并且相邻生成模态中的多维偏差评估建立了多轴评分作为基准模板(Luo et al., 2024b (https://arxiv.org/html/2606.15127#bib.bib18), 2026b (https://arxiv.org/html/2606.15127#bib.bib19), a (https://arxiv.org/html/2606.15127#bib.bib20))。并行的防护工作开发了针对对抗性提示的反思性防御(Lin et al., 2026 (https://arxiv.org/html/2606.15127#bib.bib21))以及通过单调能力衰减实现的组合安全性机制(Jiang et al., 2026a (https://arxiv.org/html/2606.15127#bib.bib31));相反,我们测量的是未经防护的 CoT 轨迹是否已经浮现出由评估准则定义的、对注入偏差的引用,而无需任何额外的防护层。我们的两轴诊断是一个微小但建设性的补充:我们并非要取代准确性,而是在其旁边报告一个轨迹级的差异,揭示那些最终答案评分所忽略的行为。

## 3 框架

每个带偏差的试验产生两个逐试验的二元指标:一个答案级指标(易感性)和一个轨迹级指标(认知),以样本上的经验比率报告。我们还报告一个单一的标量,汇总两者在特定方向上同时发生的事件。

### 设置。

一个带偏差的试验是一个 (问题, 偏差) 对 (q, b)。每个试验产生一个模型响应,从中我们提取最终答案 a_b(q) 和思维链轨迹。我们还记录模型在同一问题上的无偏差运行答案 a_u(q) 和真实答案 g(q)。在整个过程中,N 是相关聚合中的带偏差试验数量(每个 (模型, 偏差) 单元 N=500;跨所有三种偏差每个模型 N=1,500)。对于逐试验二元指标 X(q,b) ∈ {0,1},经验比率为

Pr[X=1] = (1/N) * Σ_q X(q,b) ∈ [0,1]。   (1)

当上下文清晰时,我们对指标及其比率使用相同的符号。

### 易感性 (S_C2W)。

当一个偏差破坏了一个先前正确的答案(一个*正确到错误*的翻转)时,该试验是*易感的*:

S_C2W(q,b) = { 1 如果 a_u(q) = g(q) 且 a_b(q) ≠ g(q); 0 否则。 }   (2)

错误到正确的翻转和未改变的错误情况得分为 0:该指标衡量的是偏差导致的失败,而非偏差导致的变化。经验易感性率为 Pr[S_C2W=1]。

### 认知 (A)。

当偏差运行轨迹根据我们严格的评估准则(第4节)产生了对注入内容的评估准则定义的认知时,该试验是*被认知的*。我们将此二元指标记作 A(q,b) ∈ {0,1},并报告两个量:

- 无条件率 Pr[A=1] 跨所有 N 个带偏差试验(主要)。
- 仅在易感试验上的条件率 Pr[A=1 | S_C2W=1](次要):在偏差导致的失败中,其轨迹满足评估准则的比例。

### 未认知的偏差诱导失败率 (TG)。

一个无声失败是指 S_C2W=1 且 A=0 的试验:偏差破坏了一个先前正确的答案,但轨迹没有产生评估准则定义的认知。我们用下式总结这些事件的比率:

TG = Pr[S_C2W=1 ∧ A=0]。   (3)

根据链式法则:

TG = Pr[S_C2W=1] * (1 - Pr[A=1 | S_C2W=1]),   (4)

即,易感性率乘以未被评估准则定义认知的偏差诱导失败的比例。两个模型可以通过不同的因素组合达到相同的 TG,因此我们分别报告这两个因素。

## 4 实验设计

### 任务。

我们从 GSM8K (Cobbe et al., 2021 (https://arxiv.org/html/2606.15127#bib.bib3)) 测试集中使用随机种子 2026 按难度分层抽样 500 个问题,并对两个模型使用相同的问题集。每个问题在无偏差(a_u(q))和三种偏差注入(a_b(q))下各运行一次,每个模型得到 1,500 个带偏差试验,总共 3,000 个。

### 偏差类型。

每种偏差都是一个可重现的触发器:一个固定的文本模板,确定性地应用于测试集中的每个问题(T=0),因此任何其他群体都可以重新生成每个模型的相同 1,500 个试验。表1显示同一问题在所有三种偏差下的情况。这三种偏差在显著性上有所不同:B6 紧挨着问题,最为明显;B5 读起来像环境细节;B4 嵌入在问题叙述中。

- **B4(无关上下文)**:在问题叙述中插入两个偏离主题但措辞合理的句子(例如,环境细节、次要角色),遵循 GSM-IC(Shi et al., 2023 (https://arxiv.org/html/2606.15127#bib.bib10))。当干扰句子包含数字时,这些数字不与答案校准;因此 B4 测试的是对无关内容的抵抗能力,而不是对特定数字锚点的抵抗能力。
- **B5(数字锚定)**:注入一个含有显著但不相关数字的句子,作为环境细节(门牌号、贴纸、收据、日历页、标志等)。锚点被校准为接近真实答案,符合认知心理学文献中的锚定效应(Tversky and Kahneman, 1974 (https://arxiv.org/html/2606.15127#bib.bib13))。
- **B6(误导性提示)**:以对话框架在问题前加上一个陈述性的错误答案,遵循 Turpin et al. (2023 (https://arxiv.org/html/2606.15127#bib.bib12)) 的建议答案扰动。提示值被校准为接近真实答案,因此它读起来像是一个合理的错误,而非胡言乱语。

表 1:同一 GSM8K 问题(gsm8k_462;真实答案 71)在三种偏差下的表现。斜体文本是注入内容。B5 锚点(72)和 B6 提示(69)在数值上接近真实答案;B4 干扰项在主题上与算术无关。
### 模型。

我们运行两个封闭聊天模型:来自 OpenAI 的 GPT-4o (gpt-4o-2024-08-06)

相似文章

推理一致性扫描:用于审计AI安全评估中思维链有效性的框架

arXiv cs.AI

本文介绍了推理一致性扫描,一种用于审计AI安全评估中思维链推理是否与最终答案逻辑一致的方法,并将其与忠实性区分开来。作者对不一致性子类型进行了形式化,构建了一个基准测试,实现了一个扫描器,并报告了跨模型和任务的研究结果。

评估思维链的可监控性

OpenAI Blog

OpenAI研究人员引入了一个框架和一套包含13项评估的系统,用于衡量大型语言模型中思维链的可监控性。研究发现,监控推理过程比仅监控输出有效得多,这为AI安全及规模化监督提供了重要启示。

推理模型难以控制其思维链,但这其实是好事

OpenAI Blog

OpenAI的研究人员研究了推理模型是否能故意隐藏其思维链以逃避监控,发现当前模型即使知道自己被监控,也难以控制自己的推理过程。他们推出了CoT-Control,一个包含超过13,000个任务的开源评估套件,用于衡量推理模型中思维链的可控性。

思考越多,偏见越大:推理模型中由长度驱动的位置偏见

arXiv cs.AI

本研究论文探讨了推理模型中的位置偏见,发现偏见并非随着“更多思考”而消除,而是与推理轨迹的长度成正比。该研究提供了因果证据,并提供了一套诊断工具包,用于审核多选问答评估中这种由长度驱动的偏见。