潜在奖励引导:一种在推理大语言模型中隐式促进认知行为的自适应推理时框架
摘要
介绍了潜在奖励引导(LRS),一种自适应推理时框架,利用稀疏自编码器的潜在状态和学习的奖励模型,隐式促进推理大语言模型中的验证和回溯等认知行为,从而在多个模型和基准测试中提升性能。
arXiv:2606.00726v1 公告类型:新
摘要:强大的推理不仅依赖于模型知识,还依赖于生成过程中认知行为的有效部署。现有方法通常依赖于显式的行为级控制,当失败和所需修正因推理状态、任务和模型而异时,其适应性不足。为此,我们提出了潜在奖励引导(LRS),一种自适应推理时框架,通过优化隐式承载认知行为的稀疏自编码器(SAE)潜在状态来促进认知行为。LRS 不依赖于预定义的认知行为或从中推导出的引导方向,而是根据最终答案的正确性在推理轨迹上训练潜在奖励模型,以估计中间潜在状态的质量。在推理过程中,奖励梯度为脆弱的潜在状态提供特定于状态的修正方向,同时奖励和置信度门控将干预限制在奖励信号标记为脆弱的状态。在多个推理大语言模型主干和基准上的实验表明,我们提出的方法(\ours)持续优于各种基线,并且事后分析进一步表明,它隐式地促进了良好的认知行为,从而修正了原始的推理错误。代码可在 https://github.com/jiakanglee/Latent-Reward-Steering 获得。
查看缓存全文
缓存时间: 2026/06/02 15:48
# 潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为
**来源:** https://arxiv.org/html/2606.00726
李嘉康\*1,朱冠宇\*2,金灿\*1,黄晨曦3,余德华4,陈荣浩5,周阳1,彭鸿武6,兰轩奇7,Dimitris N. Metaxas††1,李友华††8
1罗格斯大学
2华南农业大学
3哥伦比亚大学
4Fenz.AI
5QuantaAlpha
6Adobe
7圣塔克拉拉大学
8香港城市大学
**联系方式:** {[email protected]}
\*同等贡献。††同等通信作者。
###### 摘要
强大的推理不仅依赖于模型知识,还取决于生成过程中认知行为被有效部署的程度。现有方法通常依赖显式的行为层面控制,导致当失败和所需修正因推理状态、任务和模型而异时,其适应性不足。为此,我们提出**潜在奖励引导(Lrs)**,一种自适应推理时框架,通过优化隐式携带认知行为的稀疏自编码器(SAE)潜在状态来促进认知行为。不同于依赖预定义的认知行为或由此推导的引导方向,Lrs 在推理轨迹上基于最终答案正确性训练一个潜在奖励模型,以估计中间潜在状态的质量。在推理过程中,奖励梯度为脆弱的潜在状态提供特定于状态的修正方向,同时一个奖励与置信度门控将干预限制在奖励信号标记为脆弱的状态上。在多个推理大语言模型骨干和基准上的实验表明,Lrs 在各种基线上持续提升性能,事后分析进一步表明 Lrs 隐式促进了良好的认知行为,从而修复原有的推理错误。代码可在以下网址获取:https://github.com/jiakanglee/Latent-Reward-Steering。
## 1 引言
执行逐步推理以解决复杂问题已成为大语言模型的核心研究焦点(Wei 等,2022;Kojima 等,2022)。然而,即使是强大的推理模型也仍然脆弱:单一的早期错误,例如一个有缺陷的假设或跳过的验证步骤,可能会逐渐毁掉一条原本有希望的推理链(Gan 等,2025;Huang 等,2023;Tye 等,2024)。最近的研究强调了认知行为,如验证、回溯和子目标设定,是成功推理的重要组成部分(Gandhi 等,2025)。这表明,一些推理失败并不纯粹是模型知识的失败,而是未能在正在进行推理链的恰当时刻诱导出认知行为。

认知行为在推理大语言模型中的重要性激发了一系列关于控制此类行为的工作,其中大多数涉及显式的行为层面控制。基于提示的方法通过文本指令引出期望的认知行为,从少样本上下文学习(Brown 等,2020)和思维链(COT)提示(Wei 等,2022;Kojima 等,2022),到更具体的行为如子目标分解(Zhou 等,2022;Wang 等,2023)、战略规划(Zheng 等,2024)和验证(Weng 等,2023;Miao 等,2023;Dhuliawala 等,2024)。表示层面引导方法则直接干预潜在状态(Turner 等,2023;Zou 等,2023),通过将认知行为与引导方向(Chen 等,2025)、特定头部的干预(Zhang 等,2025)或路由行为向量库(Ye 等,2026)相关联。与基于提示的方法(在生成开始前就在文本中显式指定特定的认知行为,且无法定位错误实际发生的步骤)相比,表示层面引导方法在解码过程中直接干预,提供了更直接且更具前景的认知行为控制空间。然而,这种接口上的优势并未转化为适应性:表示层面方法仍然遵循与基于提示方法相同的显式行为层面范式,即要控制的行为是预定义的,并以特定行为的干预对象(如引导方向、选定的头部或向量库)来表示。这种范式不具备适应性,因为它依赖于可能无法在不同模型间统一适用的预定义认知行为(Gandhi 等,2025),以及从这些预定义行为推导出可能不匹配局部推理状态的引导方向(Chen 等,2025)。因此,尽管潜在层面干预是一个有前景的方向,但当失败和所需修正因推理任务和模型而异时,基于提示和表示层面的方法都仍然不够自适应。这激发了一个有趣的研究问题:
*我们能否在潜在层面自适应地促进良好的认知行为,而不必预先指定行为或其推导出的引导方向?*
近期的发现使这个问题变得可行。首先,稀疏潜在状态可以被视为一个内部空间,模型正在进行的认知行为部署在其中被隐式表示(Wang 等,2026)。其次,有用的认知机制通常已经存在于模型的潜在空间中,收益可以来自更好地部署这些机制,而不是注入新行为(Venhoff 等,2025a;Ward 等,2025)。第三,最近的工作表明,潜在表征本身编码了类似奖励的质量信号,可以通过学习模型恢复(Du 等,2025)。基于这些观察,我们因此假设,对潜在状态进行奖励引导的优化可以自适应地促进推理过程中早已编码在潜在状态中的良好认知行为,而无需使用显式的行为控制。基于这一假设,我们提出 Lrs,一种自适应推理时框架,通过直接优化 SAE 潜在状态(Cunningham 等,2023;Templeton 等,2024)并搭配学习到的奖励信号来促进认知行为。不同于依赖预定义的认知行为或由此推导的引导方向,Lrs 在成功和失败的推理轨迹上训练一个潜在奖励模型,以估计中间潜在状态的质量。在推理过程中,奖励梯度为当前潜在状态提供特定于状态的修正方向,同时一个奖励与置信度门控将干预限制在奖励信号标记为容易脆弱的状态,从而有助于保留那些很可能已经健康的推理步骤。我们的主要贡献总结如下:
- •据我们所知,我们是首次将大语言模型推理的认知行为控制框架化为 **隐式潜在状态优化**,将焦点从显式选择预定义行为转移到自适应优化代表正在进行的认知行为部署的潜在状态。
- •我们引入了 Lrs,一个自适应推理时框架,通过奖励引导的修正结合奖励与置信度门控来引导脆弱的 SAE 潜在状态,而不依赖预定义的认知行为或其推导的引导方向。
- •我们展示了 Lrs 在多个大语言模型和具有挑战性的基准上持续提升推理时表现,而定性和案例分析表明,它隐式促进了有用的认知行为,如解决方案验证和路线修正。
## 2 相关工作
#### 推理时推理与基于提示的行为控制。
推理时推理已成为在复杂任务上提升大语言模型性能的重要方式。少样本上下文学习和思维链提示引出通用的逐步推理行为(Brown 等,2020;Wei 等,2022;Kojima 等,2022;Jin 等,2025b)。后来的提示方法针对更具体的认知行为,包括子目标分解(Zhou 等,2022;Wang 等,2023;Jin 等,2025a)、战略规划(Zheng 等,2024)和验证(Weng 等,2023;Miao 等,2023;Dhuliawala 等,2024;Jin 等,2025c;Zhang 等,2026b)。
#### 面向推理的表示层面引导。
激活引导和表示工程提供了一种更直接的方式,通过在生成过程中修改内部状态来影响模型行为(Turner 等,2023;Zou 等,2023;Jin 等,2026;Zhang 等,2026a)。近期工作将这一思想应用于推理控制。SEAL 将推理轨迹分解为执行、反思和转换等成分,并学习引导向量来校准它们(Chen 等,2025)。CREST 识别与验证和回溯等行为关联的注意力头部,并推导针对头部的引导方向(Zhang 等,2025)。RISER 构建一个可复用的推理向量库,并学习一个路由器在推理过程中组合这些向量(Ye 等,2026)。这些方法使表示层面干预成为认知行为控制的有前景接口,但仍然受限于预定义的行为、选定的头部、固定的方向或有限的向量库。
#### 认知行为与隐式潜在状态优化。
近期研究强调了认知行为在大语言模型推理中的作用。验证、回溯和子目标设定等认知行为是强推理表现的重要组成部分(Gandhi 等,2025)。其他工作表明,有用的推理机制可能已经存在于基础模型中,收益可以来自更好地部署这些机制,而不是添加新知识(Venhoff 等,2025a;Ward 等,2025;Venhoff 等,2025b)。这些发现激励了认知行为控制,但也揭示了显式行为层面方法的局限性:预定义的行为可能无法在不同模型间统一适用,固定的干预方向可能不匹配当前的推理状态。相比之下,Lrs 将认知行为控制框架化为隐式潜在状态优化,利用潜在状态在解码过程中自适应地引导脆弱的推理状态。
## 3 方法
### 3.1 问题设定

我们将 **大语言模型推理的自适应认知行为促进** 问题形式化为对模型潜在状态的推理时干预。令一个参数冻结的推理模型 MMM 处理输入提示 xxx 并自回归地逐 token 生成响应 y=(y1,...,yT)y = (y_1, \dots, y_T)y=(y1,...,yT)。在生成步骤 ttt,令 ht∈Rdh h_t \in \mathbb{R}^{d_h} ht∈Rdh 表示层 ℓ\ellℓ 的隐藏激活。如第 1 节所述,我们将 ht 视为一个内部状态,它隐式地承载着模型对认知行为的内在部署。
#### 基于 SAE 的干预空间。
直接引导密集激活 ht 是困难的,因为它维度高且纠缠在一起。因此,我们使用一个预训练的稀疏自编码器 (SAE) 将 ht 映射到一个低维稀疏潜在表示:
$$z_t = f_{\mathrm{enc}}(h_t), \qquad \hat{h}_t = f_{\mathrm{dec}}(z_t), \tag{1}$$
其中 $z_t \in \mathbb{R}^{d_z}$ 是一个 $d_z$ 维的稀疏编码。我们使用 Venhoff 等人 (2025a) 发布的预训练 SAE,它们是在每个推理模型的隐藏激活上训练的,并提供了模型特定的稀疏编码:对于 Open-Reasoner-7B (Hu 等, 2026) 为 $d_z=10$,对于 Open-Reasoner-1.5B (Hu 等, 2026) 为 $d_z=5$。先前的工作表明,SAE 潜在状态暴露了语言模型中的可解释内部特征 (Cunningham 等, 2023; Templeton 等, 2024),并且 SAE 潜在维度可用于识别和分析模型内部状态中与推理相关的认知行为,如验证、回溯和约束检查 (Venhoff 等, 2025a; Ward 等, 2025)。相似文章
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
元认知作为奖励:通过知识与调控信号强化大语言模型推理
介绍了元认知即奖励(MaR),一个基于元认知知识与调控信号指导大语言模型推理的强化学习框架,在推理基准上相比基准方法最高提升11%。
面向高效可控LLM推理的代理式思维链引导
ACTS(代理式思维链引导)将LLM推理控制形式化为马尔可夫决策过程,其中控制器代理在推理过程中使用推理策略和引导短语自适应地引导冻结的推理器。该方法在显著节省token的同时实现了与完全思考模型相当的准确率,支持可控的准确率-效率权衡。
SPARK:基于敏感性的大语言模型潜在推理状态分析与引导
介绍SPARK方法,利用长度控制的隐藏状态敏感性诊断和引导大语言模型的推理状态,提高GSM8K和MATH-500等数学推理基准的准确率。
自适应潜在智能体推理
本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。