深度熵引导采样实现无需训练的大语言模型推理
摘要
介绍深度熵引导采样(DEGS),一种无需训练、测试时的方法,利用大语言模型中逐层熵崩塌来改善推理能力,无需强化学习训练,达到与RL后训练模型相竞争的结果。
arXiv:2607.09693v1 公告类型:新
摘要:强化学习(RL)已成为提升大语言模型推理能力的主导范式,但需要昂贵的训练、精心策划的数据和奖励信号。近期研究表明,在测试时从锐化后的基模型分布中采样可以恢复大部分RL增益,然而现有方法仅依赖输出层似然,忽略了Transformer内部的前向传播动态。我们引入深度熵引导采样(DEGS),一种无需训练、测试时的方法,利用逐层熵崩塌作为内在质量信号。我们观察到更强的推理器(包括RL后训练变体)表现出独特的“晚期崩塌”现象:logit透镜解码的熵在收敛之前一直保持在较高水平直至更深层。我们定义了每序列的崩塌深度$D(\mathbf{x})$以及一个联合目标$\pi(\mathbf{x}) \propto p(\mathbf{x})^\alpha \exp(\beta D(\mathbf{x}))$,将序列似然与这种深度熵结构相结合,并在MCMC功率采样框架(DEGS-MCMC)中实例化。在三个权重开放模型和四个推理基准上,这种近乎随机的每候选信号在采样轨迹上累积成最先进的无需训练准确率,在域外和更困难的分支上增益最大——这些正是似然本身不足的地方——而壁钟开销仅为个位数百分比。DEGS在数学分支上略逊于我们内部专门为其训练的GRPO参考,但在GPQA的域外测试上三者均超越GRPO,且无需任何训练、奖励模型或标注数据。
查看缓存全文
缓存时间: 2026/07/14 04:13
# 深度熵引导采样:无需训练的大语言模型推理方法
来源:https://arxiv.org/html/2607.09693
**作者**:Zibin Meng¹, Peng Xie¹, Kani Chen¹
\{zmengal, pxieaf\}@connect.ust.hk
[email protected]
¹香港科技大学
###### 摘要
强化学习(RL)已成为提升大语言模型推理能力的主流范式,但它需要昂贵的训练成本、精心整理的数据以及奖励信号。近期研究表明,在测试时从强化后的基础模型分布中采样可以恢复大部分RL带来的增益,但现有方法仅依赖输出层的似然,忽略了Transformer前向传播中的内部动态。我们提出**深度熵引导采样(DEGS)**,一种无需训练、仅在测试时使用的方法,它利用*逐层熵坍缩*作为内在质量信号。我们观察到,更强的推理模型(包括RL后训练变体)表现出独特的“晚期坍缩”现象:通过对数几率透镜解码的熵在较深的层之前保持较高水平,然后才收敛。我们定义了每个序列的*坍缩深度* \(D(\mathbf{x})\) 以及一个联合目标 \(\pi(\mathbf{x}) \propto p(\mathbf{x})^\alpha \exp\bigl(\beta\,D(\mathbf{x})\bigr)\),该目标将序列似然与这种深度熵结构相结合,并在MCMC功率采样框架(DEGS-MCMC)中实例化。在三个开源模型和四个推理基准上,这个近乎随机水平的单候选信号在采样轨迹中累积,达到了最先进的无需训练准确率,且在域外和较难的数据子集上增益最大——这正是仅靠似然无法奏效的地方——而额外时间开销仅为个位数百分比。DEGS在数学子集(GRPO专门训练的)上略逊于我们内部的GRPO参考模型,但在GPQA的域外测试中,所有三个模型均超越了GRPO,且无需任何训练、奖励模型或标注数据。
## 1 引言
带有可验证奖励的强化学习(如 Group Relative Policy Optimization (GRPO) (Shao et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib32)))已成为提升大语言模型(LLM)推理能力的主流范式,通过对前沿模型进行后训练,在数学、科学和编程基准上取得显著提升 (Guo et al., 2025 (https://arxiv.org/html/2607.09693#bib.bib11))。然而,这些提升代价高昂:RL后训练需要精心整理的数据、广泛的调参,最关键的是需要一个可靠的奖励信号,这在许多实际应用领域中是无法获得的 (Prabhudesai et al., 2025 (https://arxiv.org/html/2607.09693#bib.bib26))。越来越多的证据进一步表明,这些提升可能并未反映根本性的新能力:RL后训练模型将概率质量集中在基础模型*本就具有*高似然的轨迹上 (He et al., 2025 (https://arxiv.org/html/2607.09693#bib.bib12); Yue et al., 2025 (https://arxiv.org/html/2607.09693#bib.bib43)),并且由于多样性下降,基础模型甚至在多次采样场景中能超越它们 (Song et al., 2025 (https://arxiv.org/html/2607.09693#bib.bib35))。这种*分布锐化*假说 (Shao et al., 2025 (https://arxiv.org/html/2607.09693#bib.bib33)) 将RL主要视为一种过滤器,将 pass@k 能力重新分配为单次性能,而非教授全新的推理能力。
这激发了在推理时锐化基础分布的*无需训练*方法,这是扩展测试时计算的更广泛趋势的一部分 (Snell et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib34); Welleck et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib40); Brown et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib3))。Karan and Du (2025 (https://arxiv.org/html/2607.09693#bib.bib17)) 通过 Metropolis–Hastings (MH) 采样针对的*幂分布* \(p(\mathbf{x})^\alpha\) (\(\alpha>1\)) 将其形式化,从而无需训练、数据或奖励模型即可匹配 GRPO;可扩展功率采样 (Ji et al., 2026 (https://arxiv.org/html/2607.09693#bib.bib15)) 和 Power-SMC (Azizi et al., 2026 (https://arxiv.org/html/2607.09693#bib.bib1)) 通过 token 级近似和批量并行 SMC 方案提高了效率。这些方法共同表明,基础模型在单次推理中的能力远比标准采样所揭示的要强大。
尽管取得了成功,所有现有的无需训练方法都完全依赖于*输出层似然* \(p(\mathbf{x})\),忽略了前向传播中结构化的中间表示 (Nostalgebraist, 2020 (https://arxiv.org/html/2607.09693#bib.bib24); Belrose et al., 2023 (https://arxiv.org/html/2607.09693#bib.bib2); Wendler et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib41))。这是一个错失的机会:Wendler et al. (2024 (https://arxiv.org/html/2607.09693#bib.bib41)) 识别出前向传播的三个阶段(输入处理、中间的“概念空间”和输出映射),而 Tan et al. (2025 (https://arxiv.org/html/2607.09693#bib.bib36)) 发现熵从早期层的高熵探索演变为顶层的确定性精炼。我们贡献了一个将这些线索联系起来的实证观察:比较基础模型与其 RL 后训练对应版本的*逐层熵轨迹*,更强的推理者始终表现出更晚的熵坍缩(图 1 (https://arxiv.org/html/2607.09693#S4.F1))。基础模型在浅层就锁定预测,而 RL 后训练模型直到更深的层才保持升高的内部不确定性。这种延长的“思考阶段”与下游准确率相关(微小但一致的效果,在第 5 节 (https://arxiv.org/html/2607.09693#S5) 中量化),并为 RL 后训练在内部实现了什么提供了新的视角。
这激发了一个简单的想法:*如果晚期熵坍缩是强推理的特征,我们可以在测试时将其用作无需训练的质量信号*。我们通过一个标量*坍缩深度* \(D(\mathbf{x})\) 将其形式化,并构建一个联合目标 \(\pi(\mathbf{x}) \propto p(\mathbf{x})^\alpha \cdot \exp(\beta\,D(\mathbf{x}))\),该目标用此信号增强了幂分布。由此产生的方法,**深度熵引导采样(DEGS)**,集成到 MH 功率采样框架中(算法 1 (https://arxiv.org/html/2607.09693#alg1))——无需参数更新、奖励模型或标注数据。我们将两个相关的主张区分开来:*动机*(图 1 (https://arxiv.org/html/2607.09693#S4.F1))是一个跨阶段的对比——后训练推理者比其基础模型坍缩得更晚;而*操作性*主张——我们对基础模型样本的重新加权利用的是单个基础模型内部的特性:在其候选解中,正确的候选解比错误的坍缩得更晚,我们在第 5 节 (https://arxiv.org/html/2607.09693#S5)(图 2 (https://arxiv.org/html/2607.09693#S5.F2))中直接验证了这一点。
我们的贡献如下:
1. **我们识别出晚期熵坍缩作为强推理模型的经验特征**,并证明坍缩深度 \(D(\mathbf{x})\) 是跨模型和基准的解决方案正确性的统计显著预测因子(第 3 节 (https://arxiv.org/html/2607.09693#S3))。
2. **我们提出 DEGS**,基于联合似然-深度目标 \(\pi(\mathbf{x}) \propto p(\mathbf{x})^\alpha \exp(\beta D(\mathbf{x}))\)(第 4 节 (https://arxiv.org/html/2607.09693#S4)),有两种解码器:最终层重排序器 **Best-of-N-Entropy**,它在所有 12 个测试单元中以适度优势击败了对数似然 Best-of-N;以及我们的主要方法 **DEGS-MCMC**,它利用完整的深度剖面,在所有 12 个测试单元中以显著更大的优势(中位数约 4 个百分点;表 1 (https://arxiv.org/html/2607.09693#S5.T1))改进了仅似然的功率采样。
3. **我们刻画了弱单候选信号如何成为可靠的解码增益**:坍缩深度本身在孤立情况下几乎是一个随机水平的判别器(AUC ≈ 0.6;第 3 节 (https://arxiv.org/html/2607.09693#S3)),但根据命题 8 (https://arxiv.org/html/2607.09693#Thmproposition8),它只能重新排序近乎相等似然的候选,因此在 MCMC 轨迹上累积这种打破平局的效果,在所有 12 个测试单元中都带来了正增益,并且在似然最弱的较难、域外子集上增益最大。据我们所知,DEGS 是第一个利用*内部不确定性的深度方向演化*——而非仅输出层信号——作为推理的测试时选择标准的方法,表明中间表示携带了不能归结为序列级似然的质量信号。
## 2 相关工作
#### RL 后训练与分布锐化。
带有可验证奖励的强化学习(GRPO)(Shao et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib32); Guo et al., 2025 (https://arxiv.org/html/2607.09693#bib.bib11)),建立在基于人类反馈的 RL (Ouyang et al., 2022 (https://arxiv.org/html/2607.09693#bib.bib25)) 以及策略梯度方法如 PPO (Schulman et al., 2017 (https://arxiv.org/html/2607.09693#bib.bib30)) 之上,现已成为改进 LLM 推理的主流方法,但越来越多的证据将其增益主要归因于*分布锐化*而非新能力 (He et al., 2025 (https://arxiv.org/html/2607.09693#bib.bib12); Yue et al., 2025 (https://arxiv.org/html/2607.09693#bib.bib43); Song et al., 2025 (https://arxiv.org/html/2607.09693#bib.bib35)),从而激发了上述无需训练的功率采样路线 (Karan and Du, 2025 (https://arxiv.org/html/2607.09693#bib.bib17); Ji et al., 2026 (https://arxiv.org/html/2607.09693#bib.bib15); Azizi et al., 2026 (https://arxiv.org/html/2607.09693#bib.bib1));验证器重排序、过程/结果奖励模型、自洽性和纯重复采样 (Cobbe et al., 2021 (https://arxiv.org/html/2607.09693#bib.bib6); Uesato et al., 2022 (https://arxiv.org/html/2607.09693#bib.bib37); Lightman et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib21); Wang et al., 2023 (https://arxiv.org/html/2607.09693#bib.bib38); Brown et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib3)) 是更简单的替代方案。在 MH *内部*使用质量信号与 QuEST (Faria et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib8))、语言模型程序的 SMC 引导 (Lew et al., 2023 (https://arxiv.org/html/2607.09693#bib.bib20)) 以及带扭曲的序贯蒙特卡洛 (Zhao et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib45)) 相关联,但那些方法使用*外部的*、任务特定的估计器(学习的机器翻译指标、训练的扭曲)来引导链,而 DEGS 从基础模型自身的中间表示中读取信号——无需辅助模型、奖励或训练。所有这些方法都依赖*输出层*信号;DEGS 用*内部*深度熵动态补充了它们。
#### 内部表示与对数几率透镜。
对数几率透镜 (Nostalgebraist, 2020 (https://arxiv.org/html/2607.09693#bib.bib24))、调谐透镜 (Belrose et al., 2023 (https://arxiv.org/html/2607.09693#bib.bib2)) 以及统一框架如 Patchscopes (Ghandeharioun et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib10)) 将中间隐藏状态解码为 token 分布,揭示了不断演变的内部信念;Wendler et al. (2024 (https://arxiv.org/html/2607.09693#bib.bib41)) 表明这些信息与输出 token 正交,而 Tan et al. (2025 (https://arxiv.org/html/2607.09693#bib.bib36)) 发现早期层保持高熵,而顶层收敛。与我们对深度的使用最接近的是 DoLa (Chuang et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib5)),它对比后层和前层的对数几率透镜投影以减少幻觉;与 DoLa 的逐 token、双层对比不同,DEGS 保持 token 分布不变,而是将熵坍缩的完整深度剖面聚合为一个序列级重加权信号,用作*测试时选择信号*而非用于解释或 RL 优化。
#### 用于推理的熵信号。
Prabhudesai et al. (2025 (https://arxiv.org/html/2607.09693#bib.bib26)) 通过 RL 最大化基础模型置信度,Zhao et al. (2025 (https://arxiv.org/html/2607.09693#bib.bib44)) 使用自熵作为 RL 奖励,而 Cui et al. (2025 (https://arxiv.org/html/2607.09693#bib.bib7)) 分析了 RL 训练过程中*输出策略*熵的坍缩;所有这些都在训练框架内操作输出层熵,而 DEGS 完全在*测试时*利用*深度维度*上的熵。
#### 置信度、校准与自适应深度。
模型*自身*的不确定性也是一个可用信号:大模型通常校准良好,并能部分预测自身的正确性 (Kadavath et al., 2022 (https://arxiv.org/html/2607.09693#bib.bib16)),输出分布度量如语义熵可标记不可靠的生成 (Farquhar et al., 2024 (https://arxiv.org/html/2607.09693#bib.bib9))。与我们的逐 token 坍缩深度最相似的是*基于置信度的提前退出* (Schuster et al., 2022 (https://arxiv.org/html/2607.09693#bib.bib31)),它在浅层达到逐 token 置信度标准时停止计算;DEGS 反转了这一效率导向——它不是为了节省计算而提前退出,而是*读取*网络延迟承诺的深度,将其作为测试时质量信号,同时保留完整的前向传播。
#### 符号说明。
我们考虑一个自回归 LLM \(p(\mathbf{x}) = \prod_t p(x_t \mid \mathbf{x}_{<t})\)。令 \(L\) 为层数(例如,Qwen2.5-7B-Instruct 为 28 层),并选择一组索引子集 \(\mathcal{L}_{\mathrm{sub}} \subset \{1,\dots,L\}\) 用于深度分析,默认从每一层或每隔几层采样(附录 B (https://arxiv.org/html/2607.09693#A2))。
## 3 深度熵坍缩
我们首先建立层间熵轨迹与推理质量之间的联系。
#### 定义 1(逐 token 坍缩深度)。
令 \(H_l(t) = H\bigl( \text{logit-lens}(h_l^t) \bigr) \in [0, \log V]\) 为在层 \(l\) 处解码的 token 位置 \(t\) 的熵,其中 \(h_l^t\) 是第 \(l\) 层在位置 \(t\) 处的隐藏状态,\(\text{logit-lens}\) 将 \(h_l^t\) 投影到词汇表上的对数几率,熵的单位为纳特(nats)。给定阈值 \(\tau > 0\),token 位置 \(t\) 的*坍缩深度*为
\[
d_t = \min\bigl\{ l \in \mathcal{L}_{\mathrm{sub}} \;\big|\; H_l(t) \leq \tau \bigr\},
\tag{2}
\]
约定若 \(\mathcal{L}_{\mathrm{sub}}\) 中没有层满足该阈值,则 \(d_t = L\)。直观上,\(d_t\) 衡量网络在处理 token \(t\) 之前变为“自信”的深度:小的 \(d_t\) 表示(可能过早的)早期承诺,大的 \(d_t\) 表示持续的思考。
#### 序列级坍缩深度。
###### 定义 2(序列级坍缩深度)。
\(\mathbf{x} = (x_0, \dots, x_T)\) 的*归一化坍缩深度*为
\[
D(\mathbf{x}) = \frac{1}{T+1} \sum_{t=0}^T \frac{d_t}{L}.
\tag{3}
\]
由构造可知 \(D(\mathbf{x}) \in (0,1]\);值越大表示内部不确定性平均持续到更深层。我们的核心假设(在第 5 节 (https://arxiv.org/html/2607.09693#S5) 中验证)是*正确的解倾向于有更大的 \(D(\mathbf{x})\)*。阈值 \(\tau\)(默认 0.25 纳特)控制灵敏度;DEGS 在数值范围内很稳健(表 8 (https://arxiv.org/html/2607.09693#A5.T8))。
### 4.2 DEGS 目标
标准功率采样 (Karan and Du, 2025 (https://arxiv.org/html/2607.09693#bib.bib17)) 仅使用输出层似然来瞄准 \(p(\mathbf{x})^\alpha\)。我们通过 \(D(\mathbf{x})\) 捕获的深度熵结构来增强它。
###### 定义 3(DEGS 目标分布)。
序列上的 DEGS 目标分布为
\[
\pi(\mathbf{x}) \propto p(\mathbf{x})^\alpha \cdot \exp\bigl(\beta \cdot D(\mathbf{x})\bigr),
\tag{4}
\]
其中 \(\alpha \geq 1\) 是似然指数,\(\beta \geq 0\) 是深度权重。*似然项* \(p(\mathbf{x})^\alpha\) 偏好全局连贯的序列(如同在功率采样中);*深度熵项* \(\exp(\beta\,D(\mathbf{x}))\) 偏好内部处理方式类似于强推理者的序列——在承诺之前跨层保持升高的不确定性。当 \(\beta=0\) 时,它退化为功率采样。相似文章
面向LLM推理的统一数据选择
本文提出高熵总和(HES),这是一种无需训练的度量方法,用于为LLM训练选择高质量推理数据,并在SFT、RFT和RL等范式中得到验证。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
在策略自蒸馏中尊重自不确定性以实现高效LLM推理
本文提出了EGRSD和CL-EGRSD,这是在策略自蒸馏方法,通过教师熵对令牌级监督进行加权,以改善大语言模型推理准确性-长度的权衡,并在Qwen3-4B和Qwen3-8B上进行了评估。
重新思考大语言模型推理中的强化学习:关键在于稀疏策略选择,而非能力学习
本文挑战了强化学习(RL)能为大语言模型(LLM)教授新推理能力的假设,论证其作用实则是在高熵决策点进行稀疏策略选择。本文提出了 ReasonMaxxer,这是一种无需强化学习的方法,以显著更低的训练成本实现了与完整强化学习相当的性能。
@Kevin_GuoweiXu: 在训练后和推理阶段,对于直接 rollout 很少产生正确答案的困难推理问题,LLM 应如何采样?…
介绍了 BES(双向进化搜索),这是一种面向 LLM 的搜索框架,它将前向候选进化与后向目标分解相结合,以改进在训练后和推理阶段对困难推理问题的采样。