重新思考LLM强化学习中的训练-推理不匹配:产生原因与纠正方法
摘要
本文引入校准重要性采样(CIS)来解决大语言模型强化学习中的训练-推理不匹配问题,改进策略更新并在数学推理基准测试上提升性能。
查看缓存全文
缓存时间: 2026/09/29 04:13
论文页面 - 重新思考LLM强化学习中的训练-推断不匹配问题:成因与纠正方法
来源:https://huggingface.co/papers/2609.32444
摘要
我们研究了在大型语言模型的可验证奖励强化学习(RLVR)中存在的训练-推断不匹配问题,其中采样轨迹由推断引擎完成,而梯度计算则由训练引擎执行,这两个引擎对相同令牌赋予不同的概率。为解决策略更新中的这一差异,我们引入了校准重要性采样(CIS)。CIS基于经验证的logit位移特性提出——该特性将不匹配表达为log-odds的加法位移εₜ,该位移由softmax前的per-logit扰动决定,且其分布近似与令牌置信度无关。这一特性启发了置信度感知截断机制:较大的正位移被截断在单一常数阈值内,该阈值对应一个重要性比率上限,该上限随令牌置信度的增加而收紧。理论上,我们证明CIS将精确重要性采样中控制误差的无界二阶矩替换为一个由常数限定的项,代价是引入受截断过剩控制的偏差。在三个混合专家模型和五个数学推理基准的评估中,CIS在所有模型上的五基准平均成绩均优于所评估的基线方法。诊断分析显示,CIS对低置信度令牌的截断偏差小于截断重要性采样,而小重要性权重的上界裁剪则会降低留出准确率。
查看arXiv页面 (https://arxiv.org/abs/2609.32444) 查看PDF (https://arxiv.org/pdf/2609.32444) 项目页面 (https://kzhao5.github.io/CIS-website/) GitHub (https://github.com/kzhao5/CIS-RL) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.32444)
在您的代理中获取此论文:
hf papers read 2609\.32444
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.32444以从本页面链接。
引用此论文的数据集
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.32444以从本页面链接。
引用此论文的Space
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2609.32444以从本页面链接。
包含此论文的收藏集
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
诊断大语言模型强化学习中的训练-推理不匹配
本文诊断了大语言模型强化学习中的训练-推理不匹配(TIM),表明训练和推理阶段令牌概率之间的微小数值差异可能导致训练崩溃,并提出了补救措施。
基于元认知反馈的强化学习激发大语言模型中的忠实不确定性表达
本文介绍了基于元认知反馈的强化学习(RLMF)和元认知数据选择,以改进大语言模型的校准,实现内部不确定性的忠实表达,并比标准强化学习提升高达63%。
优化训练策略的幻象:单调推理策略作为LLM强化学习的真正目标
我们介绍了MIPI(单调推理策略改进)及其实例化MIPU,这是一个用于LLM的两步RL框架,通过将优化与推理策略改进明确对齐来解决训练-推理不匹配问题。在FP8量化展开下,MIPU在Qwen3-1.7B和Qwen3-4B模型上实现了改进的推理性能和训练稳定性。
大型语言模型中的稳定校准错误:高置信度错误的实用视角
本文探讨大型语言模型中的稳定校准错误现象,即高置信度错误在微小扰动下局部保持稳定。通过审计分数和探测等诊断方法评估校准程度和内部敏感性。
推理中的校准漂移:Chain-of-Thought 预算如何导致大型语言模型过度自信
本文识别了推理中的校准漂移(CDUR),即增加思维链推理预算会导致大型语言模型在错误答案上系统性地过度自信,并提出了一个假设锁定模型(Hypothesis Lock-In)和一个校准感知的停止规则(CABStop)来缓解该问题。