重新思考LLM强化学习中的训练-推理不匹配:产生原因与纠正方法

Hugging Face Daily Papers 论文

摘要

本文引入校准重要性采样(CIS)来解决大语言模型强化学习中的训练-推理不匹配问题,改进策略更新并在数学推理基准测试上提升性能。

我们研究大语言模型强化学习中具有可验证奖励(RLVR)的训练-推理不匹配问题,其中回放采样由推理引擎执行,而梯度计算由训练引擎完成,两个引擎对相同令牌分配不同的概率。为在策略更新中处理此差异,我们引入校准重要性采样(CIS)。CIS 受到一个经验支持的 logit 位移表征的启发,该表征将不匹配表达为 log-odds 中的附加位移 ε_t,由 softmax 前每个 logit 的扰动决定,其分布近似与令牌置信度无关。这种表征启发了一种置信度感知截断:大的正位移被截断在单个常数阈值处,该阈值映射回一个重要性比率上限,随着令牌置信度增加而收紧。理论上,我们证明了 CIS 用一个由常数界定的项替换了控制精确重要性采样误差的无界二阶矩,代价是由截断超出控制的偏差。在对三个混合专家模型和五个数学推理基准测试的评估中,CIS 在所有三个模型中均实现了被评估基线中最高的五基准平均值。诊断分析显示,CIS 在低置信度令牌上的截断偏差小于截断重要性采样,而向上裁剪小重要性权重会降低留出准确率。
查看原文
查看缓存全文

缓存时间: 2026/09/29 04:13

论文页面 - 重新思考LLM强化学习中的训练-推断不匹配问题:成因与纠正方法

来源:https://huggingface.co/papers/2609.32444

摘要

我们研究了在大型语言模型的可验证奖励强化学习(RLVR)中存在的训练-推断不匹配问题,其中采样轨迹由推断引擎完成,而梯度计算则由训练引擎执行,这两个引擎对相同令牌赋予不同的概率。为解决策略更新中的这一差异,我们引入了校准重要性采样(CIS)。CIS基于经验证的logit位移特性提出——该特性将不匹配表达为log-odds的加法位移εₜ,该位移由softmax前的per-logit扰动决定,且其分布近似与令牌置信度无关。这一特性启发了置信度感知截断机制:较大的正位移被截断在单一常数阈值内,该阈值对应一个重要性比率上限,该上限随令牌置信度的增加而收紧。理论上,我们证明CIS将精确重要性采样中控制误差的无界二阶矩替换为一个由常数限定的项,代价是引入受截断过剩控制的偏差。在三个混合专家模型和五个数学推理基准的评估中,CIS在所有模型上的五基准平均成绩均优于所评估的基线方法。诊断分析显示,CIS对低置信度令牌的截断偏差小于截断重要性采样,而小重要性权重的上界裁剪则会降低留出准确率。

查看arXiv页面 (https://arxiv.org/abs/2609.32444) 查看PDF (https://arxiv.org/pdf/2609.32444) 项目页面 (https://kzhao5.github.io/CIS-website/) GitHub (https://github.com/kzhao5/CIS-RL) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.32444)

在您的代理中获取此论文:

hf papers read 2609\.32444

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.32444以从本页面链接。

引用此论文的数据集

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.32444以从本页面链接。

引用此论文的Space

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2609.32444以从本页面链接。

包含此论文的收藏集

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

优化训练策略的幻象:单调推理策略作为LLM强化学习的真正目标

Hugging Face Daily Papers

我们介绍了MIPI(单调推理策略改进)及其实例化MIPU,这是一个用于LLM的两步RL框架,通过将优化与推理策略改进明确对齐来解决训练-推理不匹配问题。在FP8量化展开下,MIPU在Qwen3-1.7B和Qwen3-4B模型上实现了改进的推理性能和训练稳定性。