通过具有效率意识的变分后验引导实现高效的大语言模型推理
摘要
本文介绍了 VPG-EA 框架,该框架利用变分推断和后验引导,通过解决思维链生成中的“过度思考”现象,提高了大语言模型的推理效率。
arXiv:2605.11019v1 公告类型:新论文
摘要:尽管大语言模型依赖思维链进行复杂推理,但“过度思考”现象严重降低了推理效率。现有的强化学习方法通过设计复杂的奖励函数来压缩推理链,这导致探索空间中的高质量样本极其稀疏,从而为策略先验造成了采样瓶颈。受认知科学的启发,我们在理论上证明了由参考答案引导的后验分布比先验分布具有更高的期望效用,因此能够突破高质量样本的采样瓶颈。然而,在推理过程中后验分布是不可用的。为此,我们将高效推理形式化为变分推断问题,并引入效率意识证据下界作为理论基础。在此基础上,我们提出了 VPG-EA 框架。该框架采用参数共享的双流架构来实例化后验分布和策略先验;在通过交叉视图评估过滤掉伪高效路径后,它通过变分蒸馏将后验的高效模式单向转移到策略先验中。在 DeepSeek-R1-Distill-Qwen-1.5B 和 7B 规模模型上的实验表明,VPG-EA 将综合效率指标 epsilon cubed 分别提高了 8.73% 和 12.37%,优于各模型规模下最强的基线方法。
查看缓存全文
缓存时间: 2026/05/13 06:28
# 通过具备效率意识的变分后验引导实现高效 LLM 推理
来源: https://arxiv.org/html/2605.11019
陈子昭 李宇颖 林诗婷 王炼玺
广东外语外贸大学,中国广州。
{chenzizhao,wanglianxi}@gdufs.edu.cn
###### 摘要
虽然大型语言模型(LLM)在复杂推理中依赖思维链(Chain-of-Thought),但“过度思考”现象严重降低了推理效率。现有的强化学习方法通过设计精巧的奖励函数来压缩推理链,这导致探索空间中高质量样本极其稀疏,并为先验策略造成了采样瓶颈。受认知科学启发,我们在理论上证明了由参考答案引导的后验分布比先验分布具有更高的期望效用,从而能够突破高质量样本的采样瓶颈。然而,在推理阶段后验分布是不可见的。为此,我们将高效推理形式化为一个变分推断问题,并引入具备效率意识的证据下界(ELBO)作为理论基础。在此基础上,我们提出了 VPG-EA 框架。该框架采用参数共享的双流架构来实例化后验分布和先验策略;在通过交叉视图评估过滤掉伪高效路径后,它通过变分蒸馏将后验的高效模式单向迁移至先验策略。在 DeepSeek-R1-Distill-Qwen-1.5B 和 7B 规模模型上的实验表明,VPG-EA 分别将综合效率指标 $\varepsilon^{3}$ 提升了 8.73% 和 12.37%,优于各模型规模下的最强基线。
## 1 引言
随着大型语言模型(LLMs)进入系统 2 推理时代 [37],强化学习(RL)算法通过过程或结果监督信号显著提高了其数学和逻辑推理能力 [19, 35]。然而,现有的 RL 算法 [22, 34, 27] 通常鼓励详细的中间步骤以获得更高的准确率。这导致模型学习到一种隐式策略:它们倾向于依赖冗长的推理路径以最大化奖励 [29]。这种策略在推广到简单问题时会导致严重的过度思考 [6]。即使是对于简单的查询,模型也倾向于生成许多不必要的冗余步骤。这是以计算成本换取准确率。
为了缓解过度思考,现有研究主要设计长度惩罚奖励以压缩推理链 [22, 34, 27]。然而,这些方法面临严重的样本效率瓶颈:同时正确且简洁的轨迹占据了一个极其稀疏的高效流形。传统的 RL 算法,如 GRPO [26] 和 PPO [25],依赖于从先验策略进行随机探索,这很少能触及这一狭窄的流形。如果采样未能覆盖这些高效样本,无论奖励函数如何设计,梯度都无法有效更新,从而为传统 RL 在平衡准确率和效率方面造成了关键障碍。
近期研究引入了变分推断(VI)[18],利用参考答案引导的后验分布来克服极难任务上的采样障碍 [40, 20]。鉴于 VI 提供了一条突破采样瓶颈的原则性途径,我们通过变分推断的视角形式化了高效推理问题。利用该理论,我们推导出了新的数学边界,并建立了具备效率意识的证据下界(ELBO)作为启发式指导。基于这一结构基础,我们提出了 VPG-EA(Variational Posterior Guidance and Efficiency Awareness,变分后验引导与效率意识)框架,首次将 VI 理论应用于 LLM 推理效率优化。
具体而言,我们严格证明了参考引导后验的期望效用优势。为了实例化我们的 ELBO 启发式目标,VPG-EA 采用配备交叉视图评估的双流采样架构,以过滤出伪高效路径并减轻奖励黑客行为。通过动态优势门控和变分蒸馏,它将已验证的高效模式从后验平滑地迁移到先验策略。如图 1 所示,该机制彻底解决了传统 RL 的采样挑战,实现了 LLM 推理准确率和效率的双重提升。
本文的主要贡献包括:
- 我们从理论上证明了参考答案引导的后验分布相比先验分布具有期望效用优势。
- 我们提出了 VPG-EA。它通过后验引导定位高效流形。它利用变分蒸馏实现对先验策略的稳健知识迁移。
- 在 1.5B 和 7B 模型上的实验表明,VPG-EA 分别将综合效率指标 $\varepsilon^{3}$ 提高了 8.73% 和 12.37%。Token 消耗减少了 30% 以上。

## 2 相关工作
#### 通过奖励工程进行效率优化
随着长 CoT 推理中过度思考现象的出现,近期研究主要通过 RL 奖励工程来调节推理长度。一类方法在标准 RL 框架内设计精细的长度惩罚函数以指导缩短 [22, 34, 2]。另一类则探索难度自适应或多阶段剪枝,如难度预算校准 [27]、将推理模式与生成解耦 [11]、动态长度调度 [16, 30, 1] 以及自我意识边界适应 [5]。虽然这些方法有效地缩短了平均 CoT 长度,但严重的长度惩罚加剧了同时正确且简洁的样本的极端稀疏性。这导致依赖随机采样的传统 RL 算法在探索期间面临严重的样本效率瓶颈,极难到达并学习狭窄的高效推理流形。
#### 参考答案引导的探索
为了缓解高难度任务中的探索困难,新兴的研究路线引入了参考答案作为引导信号。早期方法利用正确答案通过迭代自训练(STaR)[36] 或在 RL 期间进行动态线索注入(Nudging)[3] 来构建正样本。近期研究将其形式化为概率推断:ExPO [39] 在信任区域内生成高可能性路径,而 RAVR [20] 和同期工作 [40] 在 VI 框架下对推理进行建模,将思维轨迹视为潜在变量进行优化。虽然这些参考答案引导的方法成功打破了高难度任务的采样障碍,但它们从根本上局限于能力增强。其核心归纳偏差假设任何得出正确答案的轨迹都是最优的,完全忽略了 LLM 以步骤换取准确率的内生倾向 [29]。与此形成鲜明对比的是,我们的工作明确针对推理效率,将其形式化为长度感知约束下的效用最大化问题。我们并非仅仅移植现有的变分目标,而是通过纳入效率感知项来适应标准的 ELBO 框架作为启发式方法。
## 3 预备知识与问题定义
### 3.1 问题形式化
给定一个可验证的推理任务数据集 $D=\{(x_i, y^*_i)\}_{i=1}^N$,其中 $N$ 个问题-答案对,$x$ 表示输入问题,$y^*$ 表示正确答案。LLM 通过思维链(潜在变量 $z$)从问题 $x$ 推理到答案 $y$。联合概率分布可分解为:
$$ P_\theta(y,z|x) = P_\theta(y|x,z) \cdot \pi_\theta(z|x), \quad (1) $$
这里,$\pi_\theta(z|x)$ 是先验分布,$P_\theta(y|x,z)$ 是答案似然。高效推理旨在学习最优策略 $\theta^*$。它确保推导出正确答案 $y^*$,同时保持推理路径简洁。因此,推理路径的综合效用 $S(z)$ 定义为:
$$ S(z) = P_\theta(y^*|x,z) \cdot \eta(z). \quad (2) $$
这结合了准确率似然和效率评估函数 $\eta(z)$。$\eta(z)$ 的值随着路径长度的增加而减小。核心优化目标是在先验分布下最大化期望效用:
$$ \theta^* = \arg\max_\theta \mathbb{E}_{z \sim \pi_\theta(\cdot|x)}[S(z)]. \quad (3) $$
然而,仅给定问题 $x$ 直接优化方程 (3) 会受到严重奖励稀疏性的影响。既准确又高效的高质量轨迹很少被采样,严重限制了训练的效率和效果。
### 3.2 理论动机:后验分布的效用优势
为了克服采样困难,我们采用了认知科学中的解释性重构概念。在解释答案时,人类会消除无效的步骤。他们反向构建一个高效的逻辑链以达到结果 [15]。在概率模型中,这一机制对应于以参考答案 $y^*$ 为条件的后验分布:
$$ q(z) = P_\theta(z|x,y^*) = \frac{P_\theta(y^*|x,z) \cdot \pi_\theta(z|x)}{P_\theta(y^*|x)} \propto P_\theta(y^*|x,z) \cdot \pi_\theta(z|x). \quad (4) $$
为了在数学上验证其作为引导信号的优越性,我们提出并证明了以下命题:
**命题 1:** 假设在先验分布 $\pi_\theta(z|x)$ 下,推理路径的正确率似然 $L(z)$ 与其综合效用分数 $S(z)$ 非负相关,即 $Cov_\pi(L,S) \geq 0$。由此可得,由参考答案引导的后验分布 $q(z)$ 生成的推理路径的期望效用不低于由先验分布生成的期望效用:
$$ \mathbb{E}_{z \sim q(z)}[S(z)] \geq \mathbb{E}_{z \sim \pi_\theta(\cdot|x)}[S(z)]. \quad (5) $$
有关详细证明及该条件的必要性分析,请参阅附录 A。
### 3.3 变分推断框架与目标转换
参考答案在推理阶段是不可见的。因此,不能直接使用后验分布。核心挑战是如何在训练期间引导先验分布。它必须内部化并复制命题 1 中建立的高效推断优势。因此,我们将高效推断的核心目标形式化为最大化先验分布下的期望效用。为了更易于优化,我们进一步转换此目标,即最大化该期望的对数:
$$ \log J(\theta) = \log \mathbb{E}_{z \sim \pi_\theta(\cdot|x)}[P_\theta(y^*|x,z) \cdot \eta(z)]. \quad (6) $$
我们使用 VI 框架作为优化基础。请注意,我们不对真实后验 $\pi_\theta(z|x,y^*)$ 进行贝叶斯推断。相反,我们将后验 $q(z)$ 视为一个可采样的辅助分布。我们利用变分下界的数学结构将后验采样与先验优化联系起来。可以推导出的以下下界:
$$ \log J(\theta) \geq \text{ELBO}. \quad (7) $$
该下界基于标准的詹森不等式推导(参见附录 B):
$$ \text{ELBO} = \mathbb{E}_{z \sim q(\cdot|x,y^*)}[\log P_\theta(y^*|x,z) + \log \eta(z)] - D_{\text{KL}}(q(z) \| \pi_\theta(z|x)). \quad (8) $$
其结构揭示了两个关键操作。首先,从后验中采样高效路径。其次,将后验能力迁移到先验中。
## 4 方法
基于上述第 3.3 节的 ELBO 结构,本文提出了一种高效推理框架 VPG-EA。如图 2 所示,VPG-EA 通过双流采样架构实例化分布。它使用交叉视图评估计算效用分数。最后,它通过变分蒸馏完成知识迁移。具体的训练算法流程详见附录 C。
### 4.1 后验和先验分布的生成与构建
传统的 VI 需要两个独立的模型来构建先验和变分分布。在 RL 中同时训练两个模型会产生不可接受的内存和计算开销。为了在单个模型内实例化双分布,VPG-EA 采用了条件分布的参数共享近似策略。它使用分化的系统提示在同一组参数 $\theta$ 上诱导两个不同的条件分布。
如图 2 所示,VPG-EA 在不同的系统提示下,在相同的参数 $\theta$ 上实例化两个并行条件分布采样流(提示模板见附录 D)。这两者分别是教师流(后验)和学生流(先验)。教师流的输入是 $x \oplus y^* \oplus \text{Prompt}_{\text{teacher}}$。由于参考答案 $y^*$ 可见,该流构建了以答案为条件的辅助分布 $q_\theta(z)$。这作为变分后验的工程近似。相似文章
基于大型语言模型的生成式推荐中的隐式推理
本文提出PauseRec,一种用于基于LLM的生成式推荐的轻量级隐式推理范式,其性能优于显式思维链方法,同时显著降低训练和推理成本。
HyperGuide:大型语言模型中高效多步推理的双曲引导方法
本文提出HyperGuide方法,将推理进展提炼为双曲几何信号,以指导LLMs的逐步生成,从而无需显式树搜索即可提高多步推理效率。
VLM是通过自适应测试时优化进行视频推理的优秀教师
本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。
大型学习模型中增强且高效的推理
本文提出了一种改进大型语言模型推理的方法,通过重新编码数据以显式表示关系,实现高效且原则性的推理,并具备关系规则的多项式时间可学习性,从而解决幻觉问题并支持跨多次调用的可靠推理。
LEAD:用于大型语言模型的长度高效自适应与动态推理
LEAD通过使用正确性-效率权衡的在线校准和自适应的问题特定长度目标,在训练过程中动态调整推理效率,提高了数学推理的准确性并减少了输出长度。