@VukRosic99: GRPO后训练使LLMs准确但冗长:在20道MATH-500问题上,一个蒸馏的1.5B模型和一位博士志愿者……
摘要
一种名为IAPO(Information-Aware Policy Optimization)的新后训练方法,根据每个token与最终答案的条件互信息为其分配优势,实现了推理长度缩短高达47%,同时提高了数学基准的准确性。
查看缓存全文
缓存时间: 2026/07/13 11:53
GRPO 后训练使 LLM 准确但冗长:在 20 个 MATH-500 问题上,一个蒸馏的 1.5B 模型和一位博士生志愿者都得了 100% 分——但模型花费了 1,658 个 token,而人类只需要 264。现有的修复方法是内容无关的:它们偏向于短输出或根据位置衰减信用,而不衡量每个 token 的实际贡献。IAPO(弗吉尼亚大学 + LinkedIn)根据每个 token 对最终答案不确定性降低的程度,结合已写内容,为每个 token 分配一个优势值。推动答案前进的 token 被放大;冗余的 token 被抑制。一个基于置信度的探索项确保正确的高置信度 token 得到强化,同时将错误的补全推向替代方案。所有三个信号直接融入 GRPO 的目标函数中,无需修改。估计器是巧妙的部分:一个早退提示从中间推理状态中引出答案分布,而 KV 缓存重用保持了实际的计算成本。结果:在 Qwen2.5-7B-Instruct 上,推理长度最多缩短 36%,同时在 GSM8K、MATH 和 MATH-500 上提高了准确性。制作了一个简短的视觉分解——每个技巧一张图。滑动查看。— 论文 - https://arxiv.org/abs/2602.19049 代码 - https://github.com/YinhanHe123/IAPO… 完整摘要 PDF - https://gist.github.com/vukrosic/f59a3c48b1a97761f90427a2b9b0885c… 每周日我举办一场动手操作的 AI 研究直播,并提供一对一帮助:https://skool.com/become-ai-researcher-2669/about… — # 面向 Token 高效推理的信息感知策略优化 来源:https://arxiv.org/html/2602.19049 Yaochen Zhu Mingjia Shi Wendy Zheng Lin Su Xiaoqing Wang Qi Guo Jundong Li ###### 摘要 大型语言模型越来越依赖长思维链来提高准确性,但这种提升伴随着显著的推理时间成本。我们重新审视 token 高效的后训练,并论证现有序列级奖励塑形方法在控制推理努力在 token 间分配方面能力有限。为弥补这一差距,我们提出IAPO,一个信息论后训练框架,基于每个 token 与最终答案的条件互信息 (MI) 为其分配 token 级优势。这提供了一种明确、有原则的机制来识别信息性推理步骤并抑制低效用探索。我们提供了理论分析,表明我们的IAPO可以在不损害正确性的情况下诱导推理冗长性的单调减少。实验上,IAPO在多个推理数据集上一致地提高了推理准确性,同时将推理长度减少了高达 47%,优于现有的 token 高效强化学习方法。我们的结果表明,信息感知优势塑形是 token 高效后训练的一个强大且通用的方向。代码可在 https://github.com/YinhanHe123/IAPO 获取。 ### 1 引言 参阅图标题 图 1:经过 RL 后训练的 LLM 的推理冗长性。(a) LLM(DeepSeekR1-Distilled-Qwen-1.5B (DeepSeek-AI, 2025))与人类志愿者在数学问题上的推理长度比较 (Lightman 等, 2024)。(b) 图示说明为什么 LLM 生成的推理不必要地冗长。 基于强化学习 (RL) 的后训练已成为增强大型语言模型 (LLM) 推理能力的最有效工具之一 (Kumar 等, 2025)。最近,组相对策略优化 (GRPO) (Shao 等, 2024) 及其变体已被证明特别强大:通过对比多个采样解决方案并显式奖励导致更好答案的推理链,这些方法激励更深入、更结构化的多步推理,从而在多种推理基准上带来显著提升。然而,GRPO 也伴随着一个常被忽视的成本。后训练的 LLM 倾向于产生比必要更多的推理。虽然额外的推理步骤利用了基础 LLM 的更多计算能力,但生成的内容可能是冗余、循环或非信息性的。如图 1 所示,DeepSeekR1-Distilled-Qwen-1.5B (DeepSeek-AI, 2025) 和一位博士级志愿者在 20 个 MATH-500 问题 (Lightman 等, 2024) 上都达到了完美准确率,但模型生成的推理明显更长(平均 1,658 vs. 264 个 token)。这种冗长性增加了推理延迟和计算成本(随序列长度呈二次方增长),同时在正确性方面收益递减。这种不匹配启发了一个核心问题:我们能否在保持 RL 后训练所达到的推理能力的同时,减少不必要的推理 token? 最近的一些方法试图通过在 GRPO (Shao 等, 2024) 中塑形优势以偏向简洁性来回答这个问题 (Tan 等, 2025; Shrivastava 等, 2025; Lee 和 Tong, 2025; Yu 等, 2025)。然而,生成推理的语义总体上被忽略了。通常,现有方法分为两大类。基于长度的方法 (Shrivastava 等, 2025; Yu 等, 2025) 通过向简洁输出的所有 token 统一分配更高的优势来偏爱较短的输出,无论这些 token 是否真正具有信息性。基于位置的方法 (Dai 等, 2025; Lee 和 Tong, 2025; Yu 等, 2025) 通过依赖于位置的优势衰减来惩罚后来的 token,即使某些后来的 token 对于产生正确答案可能是至关重要的。两种范式都有一个根本局限性:它们是内容无关的,即,它们根据补全长度或 token 位置来确定 token 的优势,而不是根据其对最终答案正确性所贡献的信息。因此,当前方法难以区分关键推理和冗余 token。 为克服这一局限,我们提出信息感知策略优化 (IAPO),一种新颖的后训练框架,将信息论感知引入到用于策略优化的补全内 token 级优势中。具体来说,IAPO 由两个模块组成。信息感知优势塑形模块通过每个 token 与最终答案的条件互信息 (MI)(以前置部分补全为条件)量化其对答案正确性的贡献,从而分配 token 级优势。该模块提供了一种有原则的机制来识别信息性推理步骤并减少低效用生成。高效条件 MI 估计模块利用基于早退的条件 MI 估计器,结合 KV 缓存预加载和分块前向传播技术,高效估计 token 级条件 MI 值,显著降低 MI 估计的计算开销,使我们的 IAPO 在规模上计算可行。 实验上,IAPO 在保持强大推理性能的同时,带来了显著的 token 效率提升。应用于 Qwen2.5-7B-Instruct (Yang 等, 2024; Team, 2024),IAPO 在 GSM8K (Cobbe 等, 2021) 上相对于基础模型实现了 47% 的推理长度缩减,相对于最佳现有 token 高效 RL 基线实现了 43% 的改进,且未牺牲准确性。 我们的贡献如下:(1) 问题形式化。我们将 token 高效后训练形式化为最大化期望任务准确率与补全长度之比,从而捕获以最少 token 消耗实现高推理性能的目标。(2) 理论框架。我们提出 IAPO,一个基于 token 与最终答案之间条件 MI 分配优势的 token 级优势塑形框架。我们提供了理论分析,展示了 IAPO 如何在保持模型准确性的同时减少期望补全长度。(3) 高效模块设计。我们引入了一个基于早退的条件 MI 估计器,以及 KV 缓存预加载和分块前向传播技术,使 token 级 MI 计算在现代 LLM 的大规模应用中变得可行。(4) 广泛实证验证。在多个推理数据集和模型规模上,IAPO 与现有用于 LLM 的 token 高效 RL 后训练基线相比,一致达到了最先进的 token 效率。 ###### 利益冲突披露。林苏、王晓庆和郭琦受雇于领英公司;其余作者隶属于弗吉尼亚大学。本工作不评估或依赖领英开发的任何产品、模型或服务,作者声明不存在财务利益冲突。 ### 2 预备知识与问题定义 预备知识。令 ( q \sim Q ) 表示输入查询(例如,一个数学问题),令 ( o ) 表示从 LLM 策略 ( \pi_{\theta} ) 采样的补全。后训练旨在优化 ( \pi_{\theta} ) 以最大化期望奖励 ( r )(量化 ( o ) 质量的数值),即 (\max_{\theta} \mathbb{E}{q \sim Q, o \sim \pi{\theta}(o|q)}[r(o)])。对于每个查询 ( q ),GRPO (Shao 等, 2024) 从冻结策略 ( \pi_{\theta_{\mathrm{old}}} ) 中采样一组 ( G ) 个补全 ( {o_i}{i=1}^G )。每个补全 ( o_i ) 从奖励模型获得一个奖励 ( r_i \in \mathbb{R} )。GRPO 将优势计算为组内归一化奖励 ( \tilde{A}i = \frac{r_i - \mathrm{mean}(\mathbf{r})}{\mathrm{std}(\mathbf{r})} ),其中 ( \mathbf{r} = {r_i}{i=1}^G )。归一化后的优势随后被均匀分配给 ( o_i ) 中的所有 token 位置 ( t ),作为 token 级优势 ( \tilde{A}{i,t} = \tilde{A}i, \forall t )。GRPO 目标函数最大化一个带 KL 正则化的裁剪策略梯度替代项 (Grondman 等, 2012): [ J{\mathrm{GRPO}}(\theta) = \mathbb{E}{q,{o_i}}\bigg[\frac{1}{G}\sum{i=1}^G\frac{1}{|o_i|}\sum_{t=1}^{|o_i|}\min\Big(\rho_{i,t}(\theta),\tilde{A}{i,t}, \mathrm{clip}(\rho{i,t}(\theta), 1-\varepsilon, 1+\varepsilon),\tilde{A}{i,t}\Big) - \beta, D{\mathrm{KL}}(\pi_{\theta},|,\pi_{\mathrm{ref}})\bigg], ] 其中 ( \rho_{i,t}(\theta) = \frac{\pi_{\theta}(o_{i,t} \mid q, o_{i,<t})}{\pi_{\theta_{\mathrm{old}}}(o_{i,t} \mid q, o_{i,<t})} )。
问题定义。我们形式化 token 高效后训练的目标为最大化期望任务准确率与期望补全长度之比,即 (\max_{\theta} \frac{\mathbb{E}{q \sim Q, o \sim \pi{\theta}(o|q)}[\mathbb{1}(o \text{ 正确})]}{\mathbb{E}{q \sim Q, o \sim \pi{\theta}(o|q)}[|o|]})。该定义明确将正确率作为分子,平均 token 长度作为分母,从而为 token 效率建立了一个直接、可验证的标准。它自然地扩展了标准的 RL 公式,后者仅关注预期奖励(如准确率),而不考虑成本。通过调整此比率,我们可以系统地测量并优化推理准确性与 token 效率之间的平衡。与之前基于长度或位置的方法不同,我们的公式要求模型必须从内容本身最小化冗余,从而防止无信息长度节省。此定义在 token 高效 RL 文献中尚未被形式化,并作为本文的基础。
3 方法
…(其余方法、实验、结论等部分原文未完整提供,但已根据提示翻译了引言、摘要及部分内容)
在 20 个 MATH-500 问题上,1.5B 模型和人类志愿者都得 100% 分——但模型花费 1,658 个 token,人类只需 264。现有修复内容无关:它们偏向短输出或按位置衰减信用,而不衡量每个 token 的实际贡献。IAPO(UVA + LinkedIn)根据每个 token 对最终答案不确定性降低的程度,结合已写内容,为每个 token 分配一个优势。推动答案前进的 token 被放大;冗余的 token 被抑制。一个基于置信度的探索项确保正确的高置信度 token 得到强化,同时将错误的补全推向替代方案。所有三个信号直接融入 GRPO 的目标,无需修改。估计器是巧妙的部分:一个早退提示从中间推理状态中引出答案分布,而 KV 缓存重用保持了实际的计算成本。结果:在 Qwen2.5-7B-Instruct 上,推理长度最多缩短 36%,同时在 GSM8K、MATH 和 MATH-500 上提高了准确性。制作了一个简短的视觉分解——每个技巧一张图。滑动查看。— 论文 - https://arxiv.org/abs/2602.19049 代码 - https://github.com/YinhanHe123/IAPO… 完整摘要 PDF - https://gist.github.com/vukrosic/f59a3c48b1a97761f90427a2b9b0885c… 每周日我举办一场动手操作的 AI 研究直播,并提供一对一帮助:https://skool.com/become-ai-researcher-2669/about…
相似文章
LambdaPO: 面向推理语言模型的Lambda风格策略优化
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。
超越轨迹模仿:面向大模型推理的Strategy-Guided Policy Optimization
介绍了针对大模型推理的Strategy-Guided Policy Optimization(SGPO),该方法用策略蒸馏替代轨迹模仿,提升了数学基准测试上的泛化能力。
TEMPO:通过模式分离策略优化实现时间强制,用于可信的大语言模型回测
提出TEMPO,一种策略优化方法,通过使用双模式奖励和基于GRPO的训练,训练大语言模型仅依据截止日期前的信息进行推理,将知识泄露降低2–13%,同时将任务性能提升6–13%。
@tom_doerr: 无需训练即可提升 LLM 推理准确性 https://github.com/codelion/optillm…
OptiLLM 是一款开源推理代理,采用先进技术无需重新训练即可将 LLM 推理准确性提升高达 10 倍,兼容各种 AI API。
最大化GRPO信号:针对困难推理问题的自适应轨迹前缀控制
本文介绍了AdaPrefix-GRPO,一种在GRPO训练期间自适应控制提供给模型的正确解决方案前缀长度的方法,保持50%的成功率以最大化梯度信号。它在显著提高困难数学推理问题准确率的同时降低了计算成本。