@ddkang:来自Bridgewater AIA Labs、UIUC和MIT的新研究:我们证明了我们认为的首个非平凡泛化…
摘要
来自Bridgewater AIA Labs、UIUC和MIT的研究人员证明了首个针对使用RLVR训练的推理LLM的非平凡泛化界,为未见数据提供可证明的准确率下界,以指导安全部署。
查看缓存全文
缓存时间: 2026/07/20 21:32
来自Bridgewater AIA Labs、UIUC和MIT的新研究:我们首次证明,针对推理大语言模型在真实世界问题上的非平凡泛化界限,我们相信这是首例。
RLVR(可验证奖励强化学习)驱动着前沿推理能力,但其对未见数据的泛化能力在理论上仍是悬而未决的问题,也成为从业者部署时的障碍。我们为RLVR推导的泛化界限,可为数十亿参数规模的RLVR模型在未见数据上的准确性提供可证明的高概率下界,从而为安全部署RLVR提供指导。
1/9
更多关于我们工作的细节可在此处查看:
论文:https://arxiv.org/abs/2607.14506 代码:https://github.com/uiuc-kang-lab/rlvr_generalization_bounds… Substack:https://ddkang.substack.com/p/provable-generalization-bounds-for… Medium:https://medium.com/@danieldkang/c3faa4d63967…
2/9
为了在理论上保障RLVR模型的泛化能力,我们将基于压缩的PAC-Bayes界应用于RLVR。然而,标准的PAC-Bayes界对RLVR无效,因为典型的RLVR训练目标是在随机令牌解码过程中定义的。
3/9
我们使用Gumbel-max技巧将随机解码过程重新参数化为一个随机噪声的确定性函数,从而得到以下PAC-Bayes界:
4/9
要使这个界限非平凡,我们需要极致的压缩。我们引入渐进式RLVR(Progressive RLVR)来在无明显性能退化的情况下实现这一目标:
- 在策略蒸馏
- TinyLoRA实现极致的参数效率
- 量化
5/9
我们在Qwen3.5-4B模型上评估了我们的框架,覆盖4个领域(数学、编程、通用知识、Text-to-SQL)。我们的界限很紧,与模型训练准确率的差距在8%到13%之间,且比基础模型准确率高出17%到51%。
6/9
我们进行了消融研究,表明渐进式RLVR的每个组成部分都是必要的:
- 去除蒸馏而直接使用TinyLoRA训练,会使界限宽松15%。
- 用标准LoRA替换TinyLoRA,会使界限完全平凡(在同样4B模型上)或失去意义(在2B模型上)。
7/9
这在实践中为什么重要?我们的框架使组织能够在专有数据上通过RLVR训练专用模型,并以高概率保证其在未见部署查询上的期望准确率。
除了我们推导的界限,未来还有几个开放方向,包括非平稳环境(实时工具API)以及无标签的分布外评估。欢迎联系我们讨论下一步!
8/9
特别感谢@johnschulman2的宝贵反馈,以及@tinkerapi提供的出色基础设施,使我们的工作成为可能。
与@maxYuxuanZhu和@rohanalur合作完成。
9/9
相似文章
@jiqizhixin:太棒了!关于推理型LLM的强化学习现状 https://aweers.de/blog/2026/rl-for-llms/…
一篇全面回顾推理型LLM强化学习现状的博文,涵盖从REINFORCE、PPO到GRPO乃至更多方法,并与InstructGPT、DeepSeek-R1等关键模型相联系。
超越推理:强化学习释放大型语言模型中的参数化知识
本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。
@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
通用推理的可迁移性:多领域RLVR的自动化课程设计
本文提出了一种迁移感知课程(TAC),这是一种基于多臂老虎机风格的多领域RLVR在线课程,通过梯度几何对齐优先选择其更新能惠及其他领域的领域。与固定课程和仅基于可学习性的课程相比,TAC在Qwen3-1.7B和Llama3.2-3B上提升了宏观平均准确率。
LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘
本文揭示了经过强化学习训练的多模态大型推理模型中的一个隐私漏洞:即使在最终答案中成功消除了敏感事实,模型仍可能在推理轨迹中重现这些事实。为此,本文提出LEMUR,一个无需训练、推理时运行的框架,利用熵动态来检测并抑制此类泄露。