最终检查点并不足够:分析训练轨迹中潜在推理的忠实性
摘要
本文研究了潜在推理步骤的忠实性在训练过程中如何演变,发现其取决于训练阶段和答案格式,而不仅仅是最终检查点的性能。
arXiv:2607.06648v1 公告类型:新增
摘要:潜在推理方法完全在模型的连续隐藏状态中进行多步推理,有望实现更紧凑和高效的推理。然而,这些不透明的隐藏状态引发了一个关于忠实性的问题:这些潜在推理步骤是否因果驱动最终答案。先前的工作在收敛检查点上研究这个问题,并报告了几种不忠实的行为,例如可以替换而不改变答案的潜在推理步骤,但未研究这些行为在训练过程中如何形成。我们转而跟踪不同潜在推理范式在保存检查点上的忠实性演变,对输入应用可验证的反事实编辑,并对潜在推理步骤进行噪声消融激活修补。我们发现:(i) 在输出层面,潜在推理方法在收敛时在反事实编辑下看起来同样不忠实,但遵循定性不同的轨迹;(ii) 在激活层面,两种范式下潜在推理步骤对最终答案的因果贡献都随训练而衰减,并且(i)中输出侧翻转的示例也正是贡献衰减的示例;(iii) 激活层面的轨迹因答案格式而异,在二元选择中衰减,在开放式解码中上升。这些发现强调了潜在推理的忠实性取决于训练阶段和答案格式。
查看缓存全文
缓存时间: 2026/07/09 07:42
# 最终检查点并不足够:沿训练轨迹分析潜在推理的忠实性
来源:https://arxiv.org/html/2607.06648
Hengyu Jin¹,²,³, Shu Yang²,³, Di Wang²,³
¹同济大学
²可证明负责任的AI与数据分析(PRADA)实验室
³阿卜杜拉国王科技大学
###### 摘要
潜在推理方法完全在模型的连续隐藏状态中执行多步推理,有望实现更紧凑和高效的推理。然而,这些不透明的隐藏状态引发了一个忠实性问题:这些潜在推理步骤是否因果性地驱动了最终答案。先前的研究在收敛的检查点上探讨了这个问题,并报告了若干不忠实的行为,例如潜在推理步骤可以被替换而不改变答案,但这些行为在训练过程中如何形成尚未被研究。相反,我们跟踪了不同潜在推理范式在保存的检查点上忠实性如何演变,对输入应用了可验证的反事实编辑,并对潜在推理步骤应用了噪声消融激活修补。我们发现:(i) 在输出层面,反事实编辑下,潜在推理方法在收敛时可能看起来同样不忠实,但遵循了定性不同的轨迹;(ii) 在激活层面,两种范式下潜在推理步骤对最终答案的因果贡献都随训练而衰减,而在(i)中输出侧翻转的样例也正是这些贡献衰减的样例;(iii) 激活层面的轨迹因答案格式而异,在二元选择中衰减,在开放式解码中上升。这些发现表明,潜在推理的忠实性依赖于训练阶段和答案格式。
---
# 最终检查点并不足够:沿训练轨迹分析潜在推理的忠实性
Hengyu Jin¹,²,³, Shu Yang²,³, Di Wang²,³††感谢通讯作者。
¹同济大学
²可证明负责任的AI与数据分析(PRADA)实验室
³阿卜杜拉国王科技大学
## 1 引言
参考图注
图1:沿训练轨迹的分析。(a) 对ProsQA的反事实编辑和对所有潜在推理步骤的噪声消融修补,均在保存的检查点上评估。(b–d) 这些分析下的输出层面(RQ1)、激活层面(RQ2)和跨格式(RQ3)轨迹。
思维链推理将中间计算表示为自然语言标记,通过暴露逐步推理轨迹来改进多步推理(wei2022_cot; nye2021_scratchpad)。这种表示是有代价的:每个推理步骤都必须提交为离散的文本标记,产生的轨迹会延长推理时间。*潜在推理*方法则完全在模型的连续隐藏状态中进行多步推理,通过移除思维链所需的显式轨迹,有望实现更紧凑和高效的推理(hao2025_COCONUT; shen2025_codi)。这种不透明性引发了一个与显式CoT中研究类似的忠实性问题——生成的推理论证不一定反映底层计算(turpin2023_unfaithful; lanham2023_measuring_faithfulness)。潜在推理不会产生可供检查的推理论证,因此问题被重新定义为:潜在推理步骤本身是否因果性地驱动了最终答案?改变或擦除这些步骤的干预是否真的改变了预测?
先前的工作在收敛的检查点上研究了这个问题,并报告了训练后的潜在推理者若干不忠实的行为,包括潜在推理步骤的隐藏状态可以被替换或扰动而不改变最终预测,以及答案可以通过网络中不经过这些步骤的替代路径产生(zhang2025_do_latent_tokens_think; lin2025_implicit_shortcut; cui2026_supervision; li2026_dynamics)。这些分析共享一个方法论选择:每个训练好的潜在推理者被视为固定对象,仅在其最终检查点上进行评估。这留下了已报告的不忠实行为如何在训练过程中形成的问题尚未被研究,这个问题很复杂,因为潜在推理训练范式在机制上差异很大。仅观察最终检查点也无法判断不同范式是通过相似轨迹还是定性不同的轨迹达到相似终点。将训练好的模型视为训练轨迹的终点,与关于训练中模型属性(tirumala2022_memorization_dynamics; tigges2024_circuits_across_training)的更广泛研究相一致,但尚未应用于潜在推理忠实性。
因此,我们测量了沿训练过程中保存的检查点上的忠实性,使用共享的GPT-2骨干网络,应用图1(https://arxiv.org/html/2607.06648#S1.F1)a中所示的两种干预。左侧的第一个干预是对输入进行的*可验证的反事实编辑*,我们在ProsQA上构造了它(hao2025_COCONUT),这是一个基准测试,其问题是通过确定性BFS预言机可解的图可达性查询:我们编辑底层图的一条边,使得BFS验证的预言机答案从原始目标翻转为替代目标,得到405个配对的原输入/编辑输入,它们仅在一条重写的子句上不同。右侧的第二个干预是对潜在推理步骤的噪声消融激活修补,改编自模型组件的因果中介分析(vig2020_causal_mediation; heimersheim2024_patching)。
我们围绕三个研究问题组织分析,从输出层面到激活层面再到答案格式。
**RQ1: 训练过程中输出层面的忠实性行为。** 具有不同训练范式的潜在推理方法在训练过程中的输出层面是否表现出定性不同的忠实性行为,即使它们在最终检查点的不忠实性看起来相似?在上述405个验证过的ProsQA反事实对上,追踪每个对在六个保存的检查点上的联合标签组成(图1(https://arxiv.org/html/2607.06648#S1.F1)b)表明,收敛时的表面相似性可能隐藏定性不同的输出层面轨迹。
**RQ2: 潜在推理步骤的激活层面轨迹。** 基于RQ1,我们询问输出层面轨迹是否具有对应的激活层面轨迹,即潜在推理步骤是否在那些驱动输出层面转变的相同样例上失去了对答案的因果贡献。沿着训练过程跟踪修补后与干净输出的变化率(图1(https://arxiv.org/html/2607.06648#S1.F1)c),我们发现两种范式下潜在推理步骤的因果贡献都随训练而衰减;第4节(https://arxiv.org/html/2607.06648#S4)中的队列分析进一步表明,在RQ1中输出侧翻转的样例也正是这些贡献衰减的样例。
**RQ3: 激活层面轨迹的跨格式依赖性。** RQ1和RQ2中的轨迹都是在二元选择设置下观察到的。RQ3询问它们是否反映了潜在推理的内在属性,还是依赖于答案格式,通过在共享内容和训练配方下仅改变答案格式来探究。比较三种答案格式下相同轨迹(图1(https://arxiv.org/html/2607.06648#S1.F1)d),我们发现当仅答案格式改变时,激活层面轨迹方向反转:二元选择下因果贡献随训练衰减,而开放式解码下则上升。
## 2 相关工作
#### 潜在推理方法。
潜在推理用连续隐藏状态空间中的计算替换部分或全部离散的思维链步骤(wei2022_cot; nye2021_scratchpad)。COCONUT(hao2025_COCONUT)在阶段性课程下将模型的最后隐藏状态反馈作为下一个输入嵌入,而CODI(shen2025_codi)将显式CoT教师自蒸馏为固定长度的连续思维;相关变体通过暂停标记、循环深度或隐式CoT训练添加非语言计算(goyal2024_pause; geiping2025_recurrent; deng2024_implicit_cot; chen2025_survey_latentcot)。我们聚焦于COCONUT和CODI作为两种代表性训练范式选择(阶段性课程与自蒸馏),并询问每种范式在训练过程中的忠实性特征如何演变,而非仅在单个检查点。
#### 潜在推理的忠实性。
显式思维链的忠实性诊断评估生成的推理论证是否反映模型的底层计算(jacovi-goldberg-2020-towards; turpin2023_unfaithful; lanham2023_measuring_faithfulness; lyu-etal-2024-towards)。在没有显式轨迹可检查的情况下,潜在推理忠实性被重新定义为连续思维步骤是否因果性地驱动最终预测。近期在收敛检查点上的研究表明这些连续步骤通常可被替换:对连续思维的消融和扰动很大程度上保留了预测(zhang2025_do_latent_tokens_think),模型利用中间步骤的捷径(lin2025_implicit_shortcut; wu2025_single_threaded; liang2026_latentcot_step),并且潜在位置表现出浅因果结构和有限可解释性(li2026_dynamics; cui2026_supervision; dilgren2026_lrm_interp)。然而,这些研究仅在收敛时评估模型。受显式推理扰动测试(atanasova2023_counterfactual; kaushik2020_counterfactual; lanham2023_measuring_faithfulness)和因果中介分析(vig2020_causal_mediation; heimersheim2024_patching)的启发,我们沿着训练轨迹跟踪这些行为的发展。
#### 训练时动态。
神经网络能力在训练过程中可能突然变化,这已由关于"grokking"、归纳头相变和大规模涌现能力的研究所记录(power2022_grokking; nanda2023_progress; olsson2022_induction_heads; wei2022_emergent)。与我们设置更接近的是,tirumala2022_memorization_dynamics跟踪了训练轨迹中每个样例的行为,而非仅在收敛时;tigges2024_circuits_across_training将机械电路分析扩展到检查点和规模上;两者都激励我们将训练好的模型行为视为轨迹的终点而非固定对象。据我们所知,之前没有工作联合跟踪潜在推理方法在训练轨迹中的反事实跟随行为以及潜在标记的因果贡献。
## 3 训练过程中的反事实响应
遵循第1节(https://arxiv.org/html/2607.06648#S1)的框架,我们通过干预模型的输入或潜在推理步骤是否会改变预测来测量忠实性。本节讨论输入干预以及由此产生的训练过程中输出行为;潜在推理步骤的干预将在第4节(https://arxiv.org/html/2607.06648#S4)中研究。先前的工作报告了在不同范式下训练的潜在推理方法在收敛检查点上类似的不忠实行为(zhang2025_do_latent_tokens_think; lin2025_implicit_shortcut; cui2026_supervision; li2026_dynamics)。我们询问这种表面相似性是否隐藏了定性不同的忠实性行为:具有不同训练范式的潜在推理方法在训练过程中是否表现出定性不同的忠实性行为,即使它们在最终检查点的不忠实性看起来相似?
### 3.1 实验设置
#### 对ProsQA的反事实编辑。
我们将第1节(https://arxiv.org/html/2607.06648#S1)中介绍的编辑形式化如下。对于每个测试实例,输入\(x_i\)和预言机答案\(A_i\),我们构造一个最小编辑的输入\(x'_i\),其预言机答案是指定的替代答案\(B_i\),并当模型预测遵循从\(A_i\)到\(B_i\)的编辑时,认为该模型在此对上是反事实忠实的。选择ProsQA有三个原因。*(a)* 其BFS可验证的预言机允许跨测试集扩展构造,无需人工编辑的标签,不同于NLI或情感风格的反事实集(kaushik2020_counterfactual; gardner-etal-2020-evaluating)。*(b)* ProsQA是原始COCONUT报告声称潜在推理执行广度优先搜索(BFS)的基准,因此测试直接探测该能力。*(c)* ProsQA也是潜在推理相对于显式思维链领先幅度最大的地方,因此这里的低反事实跟随率是一个反验证观察,而非弱基线情况。
#### 构造算法。
我们将这种最小编辑实例化为对底层图中一条有向边的重写:改变\(\mathcal{G}\)的一条边恰好改变了图遍历必须使用的推理事实,同时保持问题中每个其他句子不变。算法1(https://arxiv.org/html/2607.06648#alg1)详细说明了过程。对于每个具有有向图\(\mathcal{G}\)、根节点\(r_i\)、原始目标\(A_i\)和替代目标\(B_i\)的样例,该过程首先尝试规范的最后跳交换,即将黄金推理路径的最后一条边替换为指向\(B_i\)的出边。如果由于图中存在并行根到目标路径而导致此交换未能断开\(A_i\),则该过程回退到搜索\((r_i, A_i)\)查询的桥边,并接受第一个成功的交换。每个候选交换仅在编辑后图上的BFS确认\(\neg[r_i \to A_i] \land [r_i \to B_i]\)时才被接受,因此\(B_i\)成为编辑下唯一可达的答案。
算法1 ProsQA的可验证答案翻转扰动。
1: 样例 \((\mathcal{G}, root, target, t^{-}, \pi)\) 具有黄金路径 \(\pi\)
2: 交换 \((u,v)\) 为 \((u,t^{-})\),使预言机答案翻转,或 \(\bot\)
3: 第一层(规范的最后跳):
4: \((u,v) \leftarrow (\pi_{|\pi|-2}, \pi_{|\pi|-1})\)
5: \(\mathcal{G}' \leftarrow (\mathcal{G} \setminus \{(u,v)\}) \cup \{(u,t^{-})\}\)
6: 如果 \(\neg \text{BFS}(\mathcal{G}', root, target)\) 且 \(\text{BFS}(\mathcal{G}', root, t^{-})\) 则
7: 返回 \((u,v,\texttt{canonical})\)
8: 结束如果
9: 第二层(桥搜索):
10: \(\mathcal{B} \leftarrow \text{Bridges}(\mathcal{G}, root, target)\)
11: 对于 \((u,v) \in \mathcal{B}\) 执行
12: \(\mathcal{G}' \leftarrow (\mathcal{G} \setminus \{(u,v)\}) \cup \{(u,t^{-})\}\)
13: 如果 \(\neg \text{BFS}(\mathcal{G}', root, target)\) 且 \(\text{BFS}(\mathcal{G}', root, t^{-})\) 则
14: 返回 \((u,v,\texttt{bridge})\)
15: 结束如果
16: 结束循环
17: 返回 \(\bot\)
#### 覆盖率和重用。
被拒绝的95个样例是其图具有多条冗余根到目标路径的样例,对于这些样例,没有单边交换可以断开目标同时保持图结构良好。接受的405个配对在每种范式的每个保存的检查点上被重用;完整的覆盖率明细和推理跳数分布在附录A.2(https://arxiv.org/html/2607.06648#A1.SS2)中。
#### 训练范式和基线。
四种训练范式共享一个GPT-2骨干网络(radford2019_gpt2)。CoT和仅答案(NoCoT)是文本基相似文章
忠实性作为信息流:评估与训练忠实的思维链推理
本文提出一个框架,通过控制信息流来评估和提升思维链推理的忠实性,使用基于熵、KL散度和梯度的诊断方法,并引入训练干预措施(注意力掩码、梯度掩码、对抗扰动),使推理更加透明,减少对捷径的依赖。
重新审视后训练中的完整推理轨迹
本文发现,在后训练期间,大型语言模型可以从截断的推理轨迹而非完整轨迹中获得推理改进,减少冗余的同时,有利于监督微调和强化学习等方法。
测量AI的忠实度——无论好坏
本文讨论了LLM优化中忠实度的重要性,引入了一种结构忠实度分数,通过测量词汇重叠、约束保留和任务类型匹配的漂移,确保提示优化不牺牲意图。
搜索、失败、恢复:一种面向纠错感知推理的训练框架
介绍了Pyligent,一种利用任务验证器标记失败并在推理中教导大语言模型回溯的训练框架,提高了隐藏图、数独和积木世界的求解率。
言行而非推理:定位LLM智能体中的忠实度缺口
本文通过使用德州扑克作为受控环境,将LLM智能体中的忠实度缺口分解为推理→结论和结论→行动两个步骤。研究发现,结论→行动步骤是可靠的,而推理→结论步骤是不一致的主要来源。