优化训练策略的幻象:单调推理策略作为LLM强化学习的真正目标
摘要
我们介绍了MIPI(单调推理策略改进)及其实例化MIPU,这是一个用于LLM的两步RL框架,通过将优化与推理策略改进明确对齐来解决训练-推理不匹配问题。在FP8量化展开下,MIPU在Qwen3-1.7B和Qwen3-4B模型上实现了改进的推理性能和训练稳定性。
查看缓存全文
缓存时间: 2026/07/06 06:36
论文页面 - 优化训练策略的幻象:单调推理策略才是大语言模型强化学习的真正目标
来源:https://huggingface.co/papers/2606.29526 我们提出了 MIPI(单调推理策略改进)及其实例化 MIPU,这是一个针对大语言模型在训练–推理不匹配下的两步强化学习框架。
fig1 (https://cdn-uploads.huggingface.co/production/uploads/6778da4a1788ddf1c1ef323b/1F82641-eadJBzriBD9ve.png)
如图所示,标准的大语言模型强化学习方法优化的是训练侧的替代目标,但由于引擎层面的持续不匹配(例如 FP8 量化或后端不一致),这些优化并不一定能转化为部署后推理策略的改进。
MIPU 通过明确将推理策略改进分解为 (i) 训练侧更新 和 (ii) 后同步推理差距 来解决这一问题。第 1 步构建基于采样器的参考策略更新,以提升候选质量;第 2 步进行推理差距感知的接受机制,过滤掉那些同步后无法产生一致改进的更新。
在 FP8 量化 rollout 条件下,MIPU 在 Qwen3-1.7B 和 Qwen3-4B 上均实现了推理性能的提升,并显著增强了训练稳定性。
该图总结了核心思想:MIPU 不再仅仅优化训练策略,而是直接使优化与真实部署不匹配下的推理策略改进对齐。
- 项目页面:https://anitaleungxx.github.io/MIPU/
- 论文:https://arxiv.org/pdf/2606.29526
相似文章
面向稀疏奖励强化学习的不确定性感知LLM引导策略塑形
提出ULPS,一种将校准的LLM集成到RL训练中的框架,通过不确定性调制的引导和基于A*的符号轨迹,在MiniGrid-UnlockPickup上实现了更高的成功率和样本效率。
从受训者到训练者:面向多智能体推理的强化学习的LLM设计训练环境
本文提出了LLM-as-Environment-Engineer框架,其中策略模型通过分析失败案例自动重新设计强化学习训练环境,并引入MAPF-FrozenLake作为可控测试平台。该框架使用Qwen3-4B模型,性能优于GPT和Gemini等更大规模模型,表明策略学习提升了模型诊断自身弱点的能力。
近未来策略优化
提出近未来策略优化(NPO),一种混合策略强化学习方法,通过在同一训练运行中利用更晚的 checkpoint 学习,加速收敛,将 Qwen3-VL-8B-Instruct 性能从 57.88 提升至 62.84。
面向长周期LLM代理的Meta-Cognitive Memory Policy Optimization
介绍了Belief Entropy和Metacognitive Memory Policy Optimization (MMPO),以提高长周期LLM代理的记忆质量,优于现有方法,并在长上下文中保持性能。
TEMPO:通过模式分离策略优化实现时间强制,用于可信的大语言模型回测
提出TEMPO,一种策略优化方法,通过使用双模式奖励和基于GRPO的训练,训练大语言模型仅依据截止日期前的信息进行推理,将知识泄露降低2–13%,同时将任务性能提升6–13%。