优化训练策略的幻象:单调推理策略作为LLM强化学习的真正目标

Hugging Face Daily Papers 论文

摘要

我们介绍了MIPI(单调推理策略改进)及其实例化MIPU,这是一个用于LLM的两步RL框架,通过将优化与推理策略改进明确对齐来解决训练-推理不匹配问题。在FP8量化展开下,MIPU在Qwen3-1.7B和Qwen3-4B模型上实现了改进的推理性能和训练稳定性。

强化学习(RL)在大语言模型(LLM)后训练中受到越来越多的关注,然而RL训练仍然脆弱,可能会出现不稳定甚至崩溃。一个关键原因是训练-推理不匹配:LLM采用独立的推理和训练引擎以提高生成效率和训练精度,这在实际中会导致训练侧和推理侧对相同轨迹的概率不一致,即使模型参数同步也是如此。这自然引入了一种特殊的离策略性(off-policyness),它始终存在并毒害训练过程。先前的工作已做出各种努力来解决离策略性,以在不匹配情况下稳定训练策略。在本文中,我们指出现有工作忽视的目标不一致问题:对训练引擎中策略的有效更新并不一定能保证推理策略(即部署中使用的策略)的改进。为此,我们为LLM RL提出了一种新的策略优化目标,称为单调推理策略改进(MIPI)。遵循这一原则,我们引入了单调推理策略更新(MIPU),这是一个两步式LLM RL框架,它构建采样器引用的候选更新,并使用推理侧差距代理选择性接受同步候选。在两个模型规模下进行的高不匹配实验表明,MIPU提高了平均推理性能和训练稳定性。
查看原文
查看缓存全文

缓存时间: 2026/07/06 06:36

论文页面 - 优化训练策略的幻象:单调推理策略才是大语言模型强化学习的真正目标

来源:https://huggingface.co/papers/2606.29526 我们提出了 MIPI(单调推理策略改进)及其实例化 MIPU,这是一个针对大语言模型在训练–推理不匹配下的两步强化学习框架。

fig1 (https://cdn-uploads.huggingface.co/production/uploads/6778da4a1788ddf1c1ef323b/1F82641-eadJBzriBD9ve.png)

如图所示,标准的大语言模型强化学习方法优化的是训练侧的替代目标,但由于引擎层面的持续不匹配(例如 FP8 量化或后端不一致),这些优化并不一定能转化为部署后推理策略的改进。

MIPU 通过明确将推理策略改进分解为 (i) 训练侧更新 和 (ii) 后同步推理差距 来解决这一问题。第 1 步构建基于采样器的参考策略更新,以提升候选质量;第 2 步进行推理差距感知的接受机制,过滤掉那些同步后无法产生一致改进的更新。

在 FP8 量化 rollout 条件下,MIPU 在 Qwen3-1.7B 和 Qwen3-4B 上均实现了推理性能的提升,并显著增强了训练稳定性。

该图总结了核心思想:MIPU 不再仅仅优化训练策略,而是直接使优化与真实部署不匹配下的推理策略改进对齐。

  • 项目页面:https://anitaleungxx.github.io/MIPU/
  • 论文:https://arxiv.org/pdf/2606.29526

相似文章

近未来策略优化

Hugging Face Daily Papers

提出近未来策略优化(NPO),一种混合策略强化学习方法,通过在同一训练运行中利用更晚的 checkpoint 学习,加速收敛,将 Qwen3-VL-8B-Instruct 性能从 57.88 提升至 62.84。