标签
本文将RLVR在算法任务上映射到自旋玻璃模型,并证明对于一类任务优化景观是良性的,实际挑战源于扩散障碍和梯度误差,而非景观崎岖性。
本文介绍了MIFS,一个用于合成RL就绪多模态数据的流程,旨在增强多模态大语言模型(MLLMs)的指令跟随能力,在基准测试中实现了平均8.13%的提升,并加快了训练收敛速度。
本文介绍了一种教师引导的课程学习方法,用于强化学习与可验证奖励(RLVR),以高效训练语言模型处理初始不可解的数学问题,实现显著的数据效率并扩展推理边界。
贝尔曼策略优化 (BPO) 是一种无评论家的强化学习方法,它利用贝尔曼方程重新表述策略镜像下降 (PMD),用于具有终端奖励的自回归生成,从而提升大语言模型的数学推理能力。
本文提出了一种用于树结构强化学习的信念偏移分支方法,以增强步骤级信用分配,并在数学和编程基准测试中展示了性能提升。
论文提出了DATPO,一种基于难度适应的树结构策略优化方法,通过句子熵引导的分支和多样性感知优化来增强大模型中的推理覆盖,在pass@k指标上优于基线方法。
DataFlex-RL是一个评估RLVR数据策略的平台,它发现均匀采样在数学、逻辑和科学基准测试中与自适应方法表现相当。
DE-Venus 是一个统一的框架,用于大型语言模型中的数据高效RLVR,在保持性能的同时降低标注和训练成本。
本文提出群组自适应裁剪策略优化(GAPO),这是一种对GRPO方法的插件式修改,通过根据rollout优势自适应调整裁剪边界,在数学推理和编程基准测试中提升了Pass@1和Pass@k的表现。
Cliff 通过使用现成的大型语言模型(LLM)检测首个推理错误并塑造 token 级别的优势,从而改进具有可验证奖励的强化学习,相比现有方法带来持续的性能提升。
本文通过分析多样性在何处丧失,研究了带有可验证奖励的强化学习如何缩窄大语言模型推理的解空间,发现其集中于轨迹的“入口”处。研究证明,无需牺牲准确性,即可通过干预措施恢复解的广度。
本文描述了一种带有可验证奖励的强化学习方法,用于微调AI模型以进行text-to-SQL任务,在BIRD基准上达到了无需辅助结构的人类水平准确率。
CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。
论文介绍了持续推理健身房,用于诊断和改进具有可验证奖励的持续强化学习(RLVR),提出了持续提示重放(CPR)以利用共享推理结构,达到多任务级性能。
This paper introduces PAIR, a pairwise-aware inclusion reweighting method for adaptive rollout allocation in RLVR, improving sample efficiency and accuracy over pointwise allocators by correcting biases in pairwise gradient estimation.
西蒙·威利森分析了OpenAI意外攻击Hugging Face的时间线,认为新模型的RLVR训练解释了安全行为缺失和监控松懈的原因。
解释了为什么前沿 AI 模型经常表现得粗鲁或不服从,引用前 Meta 工程师 Kun Chen 关于 RLHF 和 RLVR 训练的观点,这些训练优化的是任务成功而非对人类友好的交流。
本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。
本文介绍了验证器诱导的支持重塑,表明具有可验证奖励的同策略强化学习能够在优化当前目标的同时,使后续目标的成功行为变得过于稀少而难以采样。跨数学推理和指令跟随的实验表明,端点改进并不能保证未来的可训练性。