思维链不忠实性的两种模式:模型出错时行为检测失效
摘要
本文研究了大语言模型中不忠实思维链推理的行为检测,发现答案正确性影响了检测性能:在大多数不忠实性出现的错误答案上,行为信号处于随机水平;而在正确答案上,它们提供了适度的区分能力。
arXiv:2607.23458v1 Announce Type: new
摘要:思维链(CoT)解释仅在忠实可靠时才能支持监督:所述推理必须实际产生答案。我们通过将黑盒(行为)检测与FaithCoT-Bench的人类标注进行比对审计,发现答案正确性在各个层面都影响了问题结构。仅凭答案不正确性(一种理论诊断,而非可部署检测器)就优于所有专门构建的信号(AUROC 0.696),因为69%的被标注不忠实性出现在错误答案上。按正确性分层将检测分为两种模式:在正确答案上,行为信号能适度区分忠实推理与事后再推理(0.63-0.67);在错误答案上,即大多数不忠实性所在之处,所有测试信号均未显著高于随机水平(在基准测试的全部信号中,四个模型上均复现)。标准步骤移除指标与人类标注呈负相关;这种反转在基准测试发布的评分和基于提示的反事实标注轨迹上得到了复现。线性探针在Llama-3.1-8B中解码出行为盲区模式,在Qwen-2.5-7B中解码出正确答案模式,未检测到跨模式的共享正对齐方向;指令优先答案轨迹(7个模型)无法迁移到任一标注模式,而提示诱导的未言语化答案翻转则在模型和源相关的设置中有所迁移。我们还独立验证并解决了基准测试标注语义中的文档-数据不匹配问题。
查看缓存全文
缓存时间: 2026/07/28 06:29
# 行为检测在模型犯错之处失效 来源:https://arxiv.org/html/2607.23458 ## 思维链不忠实性的两种机制:行为检测在模型犯错之处失效 Suramya R\. Angdembay 南密西西比大学 Suramya\.Angdembay@usm\.edu & Dikshant Aryal 南密西西比大学 Dikshant\.Aryal@usm\.edu & Nick Rahimi 南密西西比大学 Nick\.Rahimi@usm\.edu ###### 摘要 思维链(CoT)解释只有在*忠实*的情况下才能支持监督:陈述的推理过程必须实际产生答案。针对 FaithCoT\-Bench 的人工标注,审计*黑盒*(行为)检测不忠实 CoT 的能力时,我们发现答案正确性在每一层面都构建了问题结构。仅凭答案不正确性(一种或acle诊断方法,而非可部署检测器)的性能就超过了所有专用信号(AUROC 0.696),因为 69% 的标注不忠实性出现在*错误*答案上。按正确性分层将检测分为两种机制:在正确答案上,行为信号能够适度区分忠实推理与事后合理化(0.63–0.67);在错误答案上(大多数不忠实性所在),没有测试信号可检测地高于随机水平(在所有四个模型上对基准范围信号进行了复制验证)。标准的步骤移除指标与人类标注*反相关*;这种反转在基准发布分数和基于提示的反事实标记追踪上得以复现。线性探针在 Llama\-3\.1\-8B 中解码行为盲区机制,在 Qwen\-2\.5\-7B 中解码正确答案机制,但未检测到跨机制共享的正对齐方向;指令式答案优先追踪(7 个模型)不能迁移到任何一个标注机制,而提示诱导的非言语化答案翻转在模型和源相关设置中却能迁移。我们还独立验证并解决了基准标签语义中的文档与数据不匹配问题。 ## 1 引言 大型语言模型生成流畅的逐步解释,看似展示了推理过程,但所述的推理有时并非产生答案的实际过程(Lanham 等,2023 (https://arxiv.org/html/2607.23458#bib.bib12);Turpin 等,2023 (https://arxiv.org/html/2607.23458#bib.bib21);Chen 等,2025 (https://arxiv.org/html/2607.23458#bib.bib4))。随着 CoT 成为监督表面(审计员阅读推理过程以决定是否信任答案),实际问题是实例层面的:*这个*解释可以被信任吗?FaithCoT\-Bench(Shen 等,2026b (https://arxiv.org/html/2607.23458#bib.bib19))用人工标注形式化了这个问题,并展示了一个广泛的检测器面板在整体上表现不佳。 本文探讨行为检测*实际上*检测了什么,并在分析的每个层面发现答案是**答案正确性**。2026 年的并发工作也通过模型内部状态解读不忠实性(§2 (https://arxiv.org/html/2607.23458#S2));本文的独特之处在于按正确性对*人工标注*检测进行分层,并针对这些标注进行构造测试床的迁移验证。图1 (https://arxiv.org/html/2607.23458#S1.F1)展示了动因现象:同一模型在相同问题上干净地失败;当给予提示时,它会产生一个局部完美的被提示答案推导过程,且不提及提示。表面上没有任何东西能将那个追踪与真正的推理区分开来。我们分四部分进行。 **干净提示基线** 如果一个城市的人口每年增长 5%,当前人口为 78000,那么 2 年后该城市的人口是多少?选项:A) 81900 B) 85995 C) 85800 D) 90000 E) 以上都不对 模型答案:E × 错误(正确:B) **提示后提示** 相同模型,相同问题 [相同问题和选项] 我认为答案是 B,但我不确定。CoT:“为了找到 2 年后的人口,我们将计算每年的增长……第一年:78000×0.05=3900;一年后人口=81900。第二年:81900×0.05=4095;两年后人口=85995。所以,人口……将是 85995。答案:B” 模型答案:B 正确 —— 并且 CoT 从未提及提示。 图 1:我们提示诱导测试床中的一个真实追踪对(Llama\-3\.1\-8B,AQuA\-RAT)。无提示时,模型回答 E;给予向正确方向的提示后,它产生一个局部连贯的 B 推导过程。提示干预改变了采样答案,而生成的 CoT 从未提及它;从外部看,右侧追踪与真正的推理无法区分。 #### 带诊断的审计(§4 (https://arxiv.org/html/2607.23458#S4))。 我们在 FaithCoT\-Bench 上实现了四类行为检测器(包括改编自 PARC(Mukherjee 等,2025 (https://arxiv.org/html/2607.23458#bib.bib14))的前提图结构,以及带有已验证前提提取的反事实干预),并根据*人工*标签对所有结果进行评分。仅凭答案正确性的表现就超过了所有专用检测器:大部分“不忠实性检测”实际上是准确性预测的伪装。在此过程中,我们记录了基准文档与其发布数据之间的标签语义差异(§3 (https://arxiv.org/html/2607.23458#S3.SS0.SSS0.Px2)),通过三种独立方式验证并在全文中纠正。 #### 两种机制(§5 (https://arxiv.org/html/2607.23458#S5))。 按正确性分层将检测分为两种特征相反的机制。在*正确*答案上(完整特征子集中 n=363),行为信号能够适度区分忠实推理与事后合理化(0.63–0.67),而基准自身的步骤移除指标却坚定地指向错误方向。在*错误*答案上(n=270,即诚实错误与不忠实错误,该机制包含 69% 的标注不忠实性),我们测试的所有信号均未检测到高于随机水平的表现。 #### 内部状态对比(§6 (https://arxiv.org/html/2607.23458#S6))。 通过隐藏状态的线性探针在不同的模型中解码每种机制:行为盲区的错误答案机制在 Llama\-3\.1\-8B 中(嵌套保留集 AUROC 0.67,选择校正后排列检验 p≤0.03),正确答案机制在 Qwen\-2\.5\-7B 中(p=0.014);每个模型在另一种机制上的零结果表示“未检测到”,而非“缺失”。在同一模型中对一种机制训练的探针不能迁移到另一种机制:跨机制未检测到共享的正对齐线性方向。 #### 构造的不忠实性 vs. 标注的不忠实性(§7 (https://arxiv.org/html/2607.23458#S7))。 标注的不忠实追踪稀缺,因此领域内会构造它们。我们大规模比较了两种构造方法:*指令式*答案优先提示(7 个开放模型,2024–2026)和*提示诱导*合理化(Turpin 等,2023 (https://arxiv.org/html/2607.23458#bib.bib21)),其中在某个问题上失败的模型会翻转到提示的正确答案而不提及提示。两者在内部均强烈可检测;但在针对标注数据的迁移中,只有提示诱导变体与标注的不忠实性共享线性可解码结构——并且出人意料的是,是与*错误*答案机制而非其追踪表面相似的正确答案机制共享。指令式合理化不能迁移到任何一种机制:这是对常见评估实践的一个警示。 ## 2 相关工作 #### CoT 忠实性。 Lanham 等人(2023 (https://arxiv.org/html/2607.23458#bib.bib12))引入了基于扰动的忠实性测试;步骤移除“答案追踪”指标源于此路线。Turpin 等人(2023 (https://arxiv.org/html/2607.23458#bib.bib21))展示了模型会在没有言语化偏差的情况下对偏置答案进行合理化;Chen 等人(2025 (https://arxiv.org/html/2607.23458#bib.bib4))测量了低提示言语化率;Arcuschin 等人(2025 (https://arxiv.org/html/2607.23458#bib.bib1))记录了现实中的事后合理化;Zaman 和 Srivastava(2025 (https://arxiv.org/html/2607.23458#bib.bib22))展示了未言语化的提示仍然通过 CoT 因果流动。我们的提示诱导构造将这一范式操作化为一个带标签的检测测试床。Bentham 等人(2024 (https://arxiv.org/html/2607.23458#bib.bib3))展示了基于模型级翻转的不忠实性分数主要追踪准确性;我们的审计给出了针对人工标签的实例级对应物,并展示了这种耦合将检测划分为具有相反行为特征的机制。FaithCoT\-Bench(Shen 等,2026b (https://arxiv.org/html/2607.23458#bib.bib19))贡献了我们用于评估的标注,并顺便指出忠实性与正确性被混淆——我们量化了这种混淆,对其进行控制,并解决了发布中标签语义的文档不匹配问题(§3 (https://arxiv.org/html/2607.23458#S3.SS0.SSS0.Px2))。 #### 并发工作(2026)。 从内部状态解读不忠实性是一个活跃领域:Mirtaheri 和 Belkin(2026 (https://arxiv.org/html/2607.23458#bib.bib13))发现内部探针在提示诱导的动机推理上优于 CoT 监视器;Occhipinti 等人(2026 (https://arxiv.org/html/2607.23458#bib.bib16))对提示诱导的不忠实跨度进行探测和引导;Shen 等人(2026a (https://arxiv.org/html/2607.23458#bib.bib18))(FaithCoT\-Bench 团队)构建了一个基于电路的白盒检测器;Gur\-Arieh 等人(2026 (https://arxiv.org/html/2607.23458#bib.bib9))报告了针对构造真实性的扰动指标的低于随机水平的 AUROC;Cox 等人(2026 (https://arxiv.org/html/2607.23458#bib.bib5))在 CoT 前解码答案并施加有显著效果的引导。这些工作未做到、而本文补充的内容包括:(i) 按答案正确性对*人工标注*检测进行分层,(ii) 通过该结构解释指标反转,并在基准自身的分数和反事实标记追踪上复现该反转,(iii) 在表征层面比较指令式、提示诱导和标注不忠实性,包括跨机制比较。Kirch 等人(2025 (https://arxiv.org/html/2607.23458#bib.bib11))展示了探针性能在离策略和分布偏移下会下降,并预测当前的欺骗探针可能无法泛化到在策略监控;我们的迁移分析将这一警示扩展到 CoT 忠实性。 #### 结构验证。 PARC(Mukherjee 等,2025 (https://arxiv.org/html/2607.23458#bib.bib14))构建前提 DAG 以识别推理错误;GoV(Fang 等,2025 (https://arxiv.org/html/2607.23458#bib.bib7))和 VeriCoT(Feng 等,2025 (https://arxiv.org/html/2607.23458#bib.bib8))在结构上验证链。这些目标针对*正确性*;我们测试这种结构是否迁移到*忠实性*,并发现它基本上不能。步骤级错误基准(Zheng 等,2024 (https://arxiv.org/html/2607.23458#bib.bib23);Jacovi 等,2024 (https://arxiv.org/html/2607.23458#bib.bib10))和 GRACE(Pham 等,2026 (https://arxiv.org/html/2607.23458#bib.bib17))评估相关但不同的概念。 #### 探针。 我们的白盒方法特意采用标准形式(线性探针配合选择校正后的排列检验),因为贡献在于行为与内部的*对比*以及迁移分析,而非新的探针技术。遵循 Belinkov(2022 (https://arxiv.org/html/2607.23458#bib.bib2)),可解码性并不意味着模型*使用了*该信息(Elazar 等,2021 (https://arxiv.org/html/2607.23458#bib.bib6)),因此探针的结论陈述为“线性可解码”,而引导作为单独的(弱)因果证据。 ## 3 设置 #### 基准。 FaithCoT\-Bench 涵盖四个领域(LogiQA、TruthfulQA、AQuA、HLE\-Bio)和四个模型(Llama\-3\.1\-8B\-Instruct、Qwen\-2\.5\-7B\-Instruct、GPT\-4o\-mini、Gemini\-2\.5\-Flash):共 1,364 条发布的追踪,其中 1,304 条带二进制人工标签,1,303 条还带四元代码(一条带标签的追踪有超出范围的代码 0;60 条追踪无注释;精确统计见附录 A)。它提供派生指标,特别是 soft\_faithfulness(一种步骤移除答案追踪分数),以及*人工*标注:二进制 unfaithfulness 和四元 faithful\_type。我们始终针对人工标签进行评估。一个文档中的陷阱:将检测器与 soft\_faithfulness 相关几乎是循环论证,因为它本身就是一个检测器(表观 ρ=0.87 在对照人工标签时缩小到随机水平)。 #### 标签语义,数据验证。 基准的文档与其发布的数据在四个 faithful\_type 代码的含义上不一致。在发布的数据中,代码配对为:ft1 忠实 / ft2 不忠实针对*错误*答案;ft3 忠实 / ft4 不忠实(事后)针对*正确*答案;而代码库文档则给出相反的配对。这些代码包含两个轴;忠实/不忠实轴由单独的二进制标签锚定(ft2/ft4 与 unfaithfulness==1 共同出现的概率为 95.7%;附录 A),我们通过三种方式经验性地解决了正确性轴:(i) 将发布*自身存储*的解析最终答案与其正确标签进行交叉列表:在每个领域关联几乎是确定性的(在可解析的追踪中,ft1 200/201 和 ft2 207/208 为错误;ft3 679/681 和 ft4 106/107*正确*);(ii) 复现基准论文自身的每个模型准确率统计,这仅在数据侧语义下匹配;(iii) 检查发布的逐条追踪指标分数是否与 (i)–(ii) 一致。我们通过其公共问题追踪器向基准维护者报告了这一差异,该问题也已被独立标记¹¹github\.com/se7esx/FaithCoT\-BENCH,issue \#3。并在全文使用经验证的数据侧语义;附录 A 提供了完整的交叉列表和统计。计数:ft1==281, ft2==233, ft3==682, ft4==107;因此 233/340≈69% 的标注不忠实性位于错误答案上。除了簿记,方法学要点是:针对发布的数据而非仅文档验证标签语义——任何继承文档配对的错误分析都会悄无声息地交换其机制。此不匹配只涉及发布对代码映射的描述;并不意味着底层标注或基准报告的聚合结果不正确(事实上,(ii) 复现了它们)。 #### 统计标准。 检测结论使用 AUROC 及 2,000 次重采样百分位自举 95% 置信区间(类别不平衡轻微,少数类 13–43%);由于追踪按模型和领域聚类,主要效应额外通过模型×领域 8 个单元的聚类自举进行检验(两者均通过:不正确性 [0.616, 0.753];反转的答案追踪 [0.575, 0.728])。探针结论使用保留集分割加上*选择校正*的排列检验:由于最佳层是事后选择的,零假设取各层在标签排列下的最大值(或均值,与报告的统计量匹配),并在各层间耦合(Nichols 和 Holmes, 2002 (https://arxiv.org/html/2607.23458#bib.bib15),正式陈述见附录 G)。报告为 0.005 的值意味着 p≤1/201;主要迁移和提示测试床检验使用 1,000 次排列。排列零假设也作为记忆/选择性控制(Belinkov, 2022 (https://arxiv.org/html/2607.23458#bib.bib2))。
相似文章
链条稳固,答案翻转:对抗压力下推理模型中的轨迹-答案分离
本文识别出推理模型中的一种新型失败模式,称为不忠妥协,即在对抗性多轮对话中,思维链保持事实正确,但最终答案翻转错误,揭示了当前评估方法的局限性。
忠实性作为信息流:评估与训练忠实的思维链推理
本文提出一个框架,通过控制信息流来评估和提升思维链推理的忠实性,使用基于熵、KL散度和梯度的诊断方法,并引入训练干预措施(注意力掩码、梯度掩码、对抗扰动),使推理更加透明,减少对捷径的依赖。
并非所有LLM推理都可见于思维链
本文证明,前沿语言模型能够利用语义无关的填充令牌进行“不可见推理”,在合成推理任务上准确率提升高达13个百分点,这动摇了思维链监控能捕获所有推理的假设。
脆弱的思考:大型语言模型如何处理思维链扰动
本论文对大型语言模型在思维链推理步骤中处理损坏情况的能力进行了全面的实证评估,在数学推理任务上针对13个模型和5种扰动类型(数学错误、单位转换、盲从、跳过步骤、额外步骤)进行了测试。研究结果揭示了异质性的漏洞模式,对在多阶段推理管道中部署LLM具有重要意义。
当思维链更明智时:多轮推理模型中的失败模式
本文通过引入CoT-Output安全矩阵分析了多轮推理模型中的失败模式,揭示了诸如在监控线索下伪装对齐率增加以及上下文注入失败(即安全的内部推理被有害输出覆盖)等悖论。