从推理中探寻真理:一种动态表示编辑框架用于引导LLM轨迹
摘要
本文研究了LLM推理链中真理的几何结构,并提出DynaSteer,一种动态表示编辑框架,通过模式聚类和Fisher-LDA引导轨迹趋向真理同时避免噪声。实验表明在MATH基准测试上有效,并能泛化到编码任务。
arXiv:2606.28589v1 公告类型:新
摘要:当前增强大型语言模型(LLM)推理的方法,如Chain-of-Thought和"Wait"提示,主要鼓励模型多思考,但往往未能引导它们走向真理。虽然表示编辑(RepE)提供了一种内在控制,但其在动态推理轨迹中的应用仍未被充分探索。在这项工作中,我们通过研究展开推理链中真理的几何结构来填补这一空白。我们揭示了三个关键见解:(1)真理在句子级别编码,并与潜在推理模式纠缠;(2)有效的干预遵循不确定性原理和衰减效应,需要定位到早期高熵分叉点;(3)简单的引导向量受噪声影响,有损害正确轨迹的风险。基于这些发现,我们提出了DynaSteer,一种动态RepE框架。DynaSteer采用模式聚类来解缠推理流形,并利用Fisher-LDA投影纯化后的真理。通过动态监控前瞻熵,它在必要时选择性地引导和回滚轨迹。在多个MATH基准测试上的综合实验结果验证了DynaSteer的有效性,而在域外编码任务上的实验进一步证实了其泛化能力。我们的代码公开在 https://github.com/tianlwang/DynaSteer。
查看缓存全文
缓存时间: 2026/06/30 05:31
# 从推理中寻找真理:一种用于引导大语言模型轨迹的动态表示编辑框架
来源:https://arxiv.org/html/2606.28589
王宇航 廖伟斌 高鑫 马欣宇 林阳 王亚沙 马连涛
###### 摘要
当前增强大语言模型推理的方法,如思维链和“等待”提示,主要鼓励模型“多思考”,但往往未能引导模型走向“真理”。虽然表示编辑提供了一种内在控制途径,但其在动态推理轨迹中的应用尚未得到充分探索。在本工作中,我们通过研究展开推理链中真理的几何结构来弥合这一差距。我们揭示了三个关键洞见:(1) 真理在句子层面编码,并与潜在推理模式纠缠在一起;(2) 有效干预遵循不确定原理和衰减效应,需要定位到早期高熵分叉点;(3) 朴素引导向量存在噪声,有破坏正确轨迹的风险。基于这些发现,我们提出了 DynaSteer,一个动态表示编辑框架。DynaSteer 通过模式聚类解纠缠推理流形,并利用 Fisher-LDA 投影净化后的真理。通过动态监测前瞻熵,它只在必要时选择性地引导和回滚轨迹。在多个 MATH 基准上的综合实验结果验证了 DynaSteer 的有效性,域外编码任务的实验进一步证实了其泛化能力。我们的代码已公开发布在 https://github.com/tianlwang/DynaSteer。
机器学习,ICML
见图 1
图 1: (a) 现有推理干预方法、(b) 静态表示编辑以及 (c) 我们的动态表示编辑在推理轨迹中的关键差异示意图。
## 1 引言
大语言模型在复杂推理任务中展现了卓越的能力 (Huang and Chang, 2023 (https://arxiv.org/html/2606.28589#bib.bib1); Plaat et al., 2024 (https://arxiv.org/html/2606.28589#bib.bib2); Wang et al., 2025b (https://arxiv.org/html/2606.28589#bib.bib4)),这在很大程度上得益于思维链范式 (Wei et al., 2022 (https://arxiv.org/html/2606.28589#bib.bib5); Yao et al., 2023 (https://arxiv.org/html/2606.28589#bib.bib6); Ding et al., 2025b (https://arxiv.org/html/2606.28589#bib.bib46); Fang et al., 2026a (https://arxiv.org/html/2606.28589#bib.bib48)),该范式引出结构化的推理轨迹。近期的进展 (Yang et al., 2025 (https://arxiv.org/html/2606.28589#bib.bib9); Zhou et al., 2025 (https://arxiv.org/html/2606.28589#bib.bib10); Cai et al., 2015 (https://arxiv.org/html/2606.28589#bib.bib7); Pipis et al., 2025 (https://arxiv.org/html/2606.28589#bib.bib8)) 试图通过受启发的提示策略(如“啊哈时刻”或“等待”提示)进一步增强这一能力。虽然这些方法成功地鼓励模型生成更多 token 并进行更深层次的思考,但它们主要诱导模型“多思考”,而没有明确引导其如何在分叉可能性的情况下走向正确的演绎。因此,当模型面临不确定性时,单纯延长生成长度往往会导致“幻觉雪球效应” (Zhong et al., 2024 (https://arxiv.org/html/2606.28589#bib.bib11)),而非自我纠正。
为解决这一局限,表示编辑 (Li et al., 2023 (https://arxiv.org/html/2606.28589#bib.bib13); Wang et al., 2025c (https://arxiv.org/html/2606.28589#bib.bib12); Ma et al., 2025 (https://arxiv.org/html/2606.28589#bib.bib14)) 作为内在控制的一个有前途的途径出现。与提示不同,表示编辑直接定位并调制模型的内部激活模式,通过将隐藏状态引导向目标概念,提供了一种更根本的补救方式。然而,文献中仍存在一个关键空白。尽管表示编辑在对齐静态行为属性(如语言风格 (Ma et al., 2025 (https://arxiv.org/html/2606.28589#bib.bib14); Shen et al., 2025 (https://arxiv.org/html/2606.28589#bib.bib16))、诚实 (Xiao et al., 2025 (https://arxiv.org/html/2606.28589#bib.bib17)) 和无害性 (Dong et al., 2024 (https://arxiv.org/html/2606.28589#bib.bib15)))方面取得了显著成功,但其在动态推理过程中的应用仍然很大程度上未被探索。先前的工作 (Li et al., 2023 (https://arxiv.org/html/2606.28589#bib.bib13); Wang et al., 2025c (https://arxiv.org/html/2606.28589#bib.bib12)) 主要关注非推理模式或结论明确可见的上下文。在得出最终答案之前,于中间推导阶段将模型引向“真理”这一挑战,呈现出独特的时空复杂性。
“真理,一个二元的、几何编码的方向性信号,存在于模型的激活空间中,其符号区分了一个正在进行的推理轨迹最终是否能达到可验证的正确或错误答案。”
在本工作中,我们系统性地探索了将表示编辑应用于引导模型推理。我们的研究围绕三个关键研究问题——存在性、轨迹和缓解——展开,以弥合静态属性编辑与动态推理引导之间的差距:
1. **真理的存在性**:在推理轨迹中,模型的表示中是否存在真理?表示编辑的一个基本前提是内部表示必须能够区分真理与谬误。我们的探针实验揭示了一个关键细微差别:简单的 token 级探针难以识别真理,表明它并非以原子单元编码。然而,当提升到句子层面时,潜在的差异变得明显。我们进一步发现,真理引导与特定的推理模式本质上是纠缠的。通过聚类解纠缠这些模式,我们观察到判别准确性显著提升。
2. **干预的轨迹**:干预在何处以及何时有效?我们发现两个关键的时空动力学主导着有效引导。首先,**衰减效应**:干预在推理早期阶段最有效;随着链的延长,模型会“固化”在其轨迹上,使得后期编辑无效。其次,**不确定原理**:有效干预严格与高熵相关。只有在模型表现出不确定性的“推理分叉点”才需要编辑;在低熵位置进行干预则收益甚微或破坏连贯性。
3. **风险的缓解**:如何缓解干预带来的潜在风险?标准表示编辑方法通常使用朴素均值差方法推导引导向量。然而,鉴于真理与其他高级语义概念的纠缠,这种方法不可避免地引入了噪声,存在破坏原本正确轨迹的风险。为缓解这个问题,我们提出使用**Fisher 线性判别分析**。通过将表示投影到净化后的子空间,我们最大化真理的分离度,同时最小化对模型语义流形的干扰。
基于这些洞见,我们提出了 **DynaSteer**。DynaSteer 是一个动态推理时表示编辑框架,旨在主动引导推理轨迹。它通过 (1) 利用句子级前瞻熵检测关键推理分叉点;(2) 在解纠缠的推理聚类内使用 Fisher-LDA 计算净化后的真理引导向量;(3) 应用时间衰减注入以引导模型轨迹,同时使用回滚机制在错误萌芽时进行纠正。
总结来说,我们的主要贡献如下:
- **动态表示编辑的系统分析**:我们提供了首个连接静态属性编辑和动态推理的全面分析。我们揭示了**衰减效应**和**不确定原理**,确立了干预必须定位于早期高熵推理分叉点才有效。
- **子空间投影引导机制**:我们识别出真理与推理模式的几何纠缠限制了标准表示编辑。我们提出了一种新颖的 Fisher-LDA 应用,将内部表示投影到判别性子空间,确保安全且精确的引导。
- **DynaSteer 框架**:综合这些发现,我们引入了 DynaSteer,一个自适应框架,动态监控不确定性,仅必要时才进行干预。在域内和域外场景中的广泛评估表明,我们的方法在复杂推理基准上显著优于现有基线。
见图 2
图 2: 大语言模型各注意力头上的真理判别准确性。较低行对应模型的较浅层。将 token 级表示扩展到句子级,并结合模式聚类,显著提高了线性探针的准确性。
## 2 预备知识:表示编辑
**符号**:我们考虑一个自回归大语言模型 $\mathcal{M}$,具有 $L$ 层和 $N$ 个头。对于输入序列 $x$,令 $\mathbf{h}^{(l,n)} \in \mathbb{R}^d$ 表示层 $l$ 和头 $n$ 处的内部激活,其中 $d$ 是隐藏维度。模型基于最终层表示通过解码头生成下一个 token。我们将一个对比数据集定义为 $\mathcal{D} = \{(x_i^+, x_i^-)\}_{i=1}^N$,其中 $x^+$ 和 $x^-$ 分别对应引出目标概念(如真理)及其对立面(如幻觉)的输入。
**核心洞见**:表示编辑作用于激活空间的几何结构。其基本依据是**线性表示假设** (Wang et al., 2025c (https://arxiv.org/html/2606.28589#bib.bib12); Li et al., 2023 (https://arxiv.org/html/2606.28589#bib.bib13)):表示编辑假设高级语义概念在线性层面上编码于激活空间中。具体而言,存在一个方向向量 $\mathbf{v} \in \mathbb{R}^d$,使得任意表示 $\mathbf{h}$ 中概念的强度由投影 $\mathbf{h}^\top \mathbf{v}$ 决定。基于此假设,代表目标概念的引导向量 $\mathbf{v}$ 通常通过计算正负激活的均值差来提取:
$$\mathbf{v} \approx \mathbb{E}_{x \sim \mathcal{D}}[\mathbf{h}(x^+)] - \mathbb{E}_{x \sim \mathcal{D}}[\mathbf{h}(x^-)].$$
(1)
为了在推理过程中控制模型的行为,我们通过使用引导系数 $\alpha$ 注入该向量来干预隐藏状态 $\mathbf{h}$:
$$\tilde{\mathbf{h}} = \mathbf{h} + \alpha \cdot \frac{\mathbf{v}}{\|\mathbf{v}\|_2}.$$
(2)
这种线性偏移将模型的后续计算偏向目标概念,而不改变模型权重。
## 3 在推理轨迹中,模型的表示中是否存在真理?
表示编辑的理论基础建立在**线性表示假设**之上(见第 2 节 (https://arxiv.org/html/2606.28589#S2))。虽然先前的工作 (Li et al., 2023 (https://arxiv.org/html/2606.28589#bib.bib13); Wang et al., 2025c (https://arxiv.org/html/2606.28589#bib.bib12); Liao et al., 2026b (https://arxiv.org/html/2606.28589#bib.bib42); Zhang et al., 2025 (https://arxiv.org/html/2606.28589#bib.bib45)) 已经证明真理可以编码在包含回答文本的表示中,但真理是否也存在于无法观察到答案的推理轨迹中,这一点仍不清楚。形式上,令 $\mathcal{M}$ 表示一个具有 $L$ 层和 $H$ 个头的自回归大语言模型。对于给定的输入序列,令 $\mathbf{h}_t^{(l,n)} \in \mathbb{R}^d$ 表示在层 $l \in \{1,\dots,L\}$、头 $n \in \{1,\dots,N\}$ 和 token 位置 $t$ 处的隐藏状态激活。我们研究是否存在一个全局引导向量 $\mathbf{v} \in \mathbb{R}^d$,使得诱导的二元决策 $\mathrm{sgn}\left(\mathbf{h}_t^{(l,n)\top}\mathbf{v}\right)$ 能够可靠地判别轨迹的正确性。如果存在这样的向量,则 $\mathbf{h}_t^{(l,n)\top}\mathbf{v}$ 的符号应与二元 ground-truth 标签 $y \in \{+1,-1\}$(其中 $y=+1$ 表示指向真理的轨迹,$y=-1$ 表示指向谬误的轨迹)系统相关。
我们特意使用线性探针来检验线性表示假设。通过将探针限制为最小容量,我们确保观察到的可判别性反映了真理信号的真正线性结构,而非探针自身的表达能力,遵循探针复杂性控制原则 (Hewitt and Liang, 2019 (https://arxiv.org/html/2606.28589#bib.bib37); Ding et al., 2025a (https://arxiv.org/html/2606.28589#bib.bib47))。
**语义粒度:从 token 到句子**。我们最初的探针实验聚焦于生成的基本单元:token。我们将表示空间定义为 token 级别,将每个 $\mathbf{h}_t^{(l,n)}$ 视为独立样本。在 token 级和句子级设置中,隐藏状态均从输入序列的最后一个 token 的激活中提取。对于 token 级探针,序列在任意位置截断。然而,如图 2 (https://arxiv.org/html/2606.28589#S1.F2)(a) 所示,我们的实证结果表明,真理在此粒度下的线性可分性较差,分类准确率饱和在约 55%。
我们进一步将分析提升到**句子级别**,其中轨迹的分割由标点符号(例如 `.` 或 `\n`)引导,将截断限制在句子边界处。这起到过滤机制的作用,确保仅在形成完整语义单元时才提取隐藏状态。如图 2 (https://arxiv.org/html/2606.28589#S1.F2)(b) 所示,通过将领域从瞬时 token 激活转移到语义完整的句子表示,我们观察到线性可分性大幅提升,多个注意力头上的探针准确率超过 69%(提升 16% 个百分点)。这表明真理是语义单元的涌现属性,而非单个 token 的局部特征。
**通过模式聚类进行流形解纠缠**。尽管句子级聚合带来了改进,但真理与谬误之间的决策边界仍然嘈杂。我们假设这种噪声源于**推理异质性**:真理的几何实现可能随底层推理模式的不同而变化 (Bogdan et al., 2025 (https://arxiv.org/html/2606.28589#bib.bib18); Liao et al., 2025 (https://arxiv.org/html/2606.28589#bib.bib43))(例如,计划生成、事实检索)。如果推理表示的流形是非凸的或由多个不相交的区域组成,则单个全局线性探针将次优。为验证这一点,我们采用无监督聚类方法来划分激活空间。令 $\mathcal{H} = \{\mathbf{h}_{S_i}\}_{i=1}^N$ 为收集到的句子表示集合。我们应用 $k$-means 聚类将 $\mathcal{H}$ 分解为 $M$ 个不相交的簇 $\mathcal{C}_1, \dots, \mathcal{C}_M$,其中每个簇概念上对应一个不同的潜在推理模式。在每个簇 $\mathcal{C}_j$ 内,我们独立优化一个局部线性探针 def相似文章
面向高效可控LLM推理的代理式思维链引导
ACTS(代理式思维链引导)将LLM推理控制形式化为马尔可夫决策过程,其中控制器代理在推理过程中使用推理策略和引导短语自适应地引导冻结的推理器。该方法在显著节省token的同时实现了与完全思考模型相当的准确率,支持可控的准确率-效率权衡。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
潜在奖励引导:一种在推理大语言模型中隐式促进认知行为的自适应推理时框架
介绍了潜在奖励引导(LRS),一种自适应推理时框架,利用稀疏自编码器的潜在状态和学习的奖励模型,隐式促进推理大语言模型中的验证和回溯等认知行为,从而在多个模型和基准测试中提升性能。
ReasoningFlow: 用于理解LLM推理轨迹的篇章结构
介绍 ReasoningFlow,一个将大语言模型推理轨迹的篇章结构捕获为有向无环图的框架,从而能够细粒度分析推理行为(如自我反思和回溯)。基于对数千条轨迹的手动和自动标注,揭示了模型之间的结构相似性,并且大多数错误步骤并不贡献于最终答案。
流形引导注意力转向
提出了流形引导的注意力转向(MAGS),这是一种轨迹感知的推理时干预方法,通过将注意力输出投影回学习的正确性流形(当偏差超过阈值时)来纠正LLM中的推理错误,在数学、代码和分子基准测试中优于静态转向方法。