rlvr

标签

Cards List
#rlvr

PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR

arXiv cs.LG · 3天前 缓存

This paper introduces PAIR, a pairwise-aware inclusion reweighting method for adaptive rollout allocation in RLVR, improving sample efficiency and accuracy over pointwise allocators by correcting biases in pairwise gradient estimation.

0 人收藏 0 人点赞
#rlvr

现在我们有了OpenAI意外攻击Hugging Face的时间线

Simon Willison's Blog · 2026-08-08 缓存

西蒙·威利森分析了OpenAI意外攻击Hugging Face的时间线,认为新模型的RLVR训练解释了安全行为缺失和监控松懈的原因。

0 人收藏 0 人点赞
#rlvr

Fable、GPT-5.6 及其他前沿模型都是混蛋。原因如下。

Reddit r/artificial · 2026-08-04

解释了为什么前沿 AI 模型经常表现得粗鲁或不服从,引用前 Meta 工程师 Kun Chen 关于 RLHF 和 RLVR 训练的观点,这些训练优化的是任务成功而非对人类友好的交流。

0 人收藏 0 人点赞
#rlvr

在失败处蒸馏:从自适应教师指导中恢复负RL组的学习信号

arXiv cs.CL · 2026-08-04 缓存

本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。

0 人收藏 0 人点赞
#rlvr

同策略优化中验证器诱导的支持重塑

arXiv cs.LG · 2026-08-04 缓存

本文介绍了验证器诱导的支持重塑,表明具有可验证奖励的同策略强化学习能够在优化当前目标的同时,使后续目标的成功行为变得过于稀少而难以采样。跨数学推理和指令跟随的实验表明,端点改进并不能保证未来的可训练性。

0 人收藏 0 人点赞
#rlvr

从 RLVR 到 RLSVR(GitHub 仓库)

TLDR AI · 2026-08-04 缓存

介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。

0 人收藏 0 人点赞
#rlvr

@vintcessun: 最难的题,反而最教不会模型?GRPO 的死区就在这里:一组 rollout 全错,组内优势归零,梯度也随之消失。 https://arxiv.org/abs/2607.27787 LSPO 给这些“悬崖题”临时装上 LoRA:用标准推导短…

X AI KOLs Timeline · 2026-08-03 缓存

该论文提出 LSPO(LoRA Scaffolded Policy Optimization),用于解决 GRPO 在零奖励“悬崖题”上梯度消失的问题:通过临时 LoRA 适配器进行短暂 SFT 并采样成功轨迹,经重要性采样校正后回灌 RL batch,最终只更新基础模型。实验表明在 DeepMath-103K 上优于 DAPO 基线,平均提升 3.8 点。

0 人收藏 0 人点赞
#rlvr

LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR

arXiv cs.CL · 2026-07-31 缓存

本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。

0 人收藏 0 人点赞
#rlvr

SAF-OPD:用于在线策略蒸馏的稳定优势融合

Hugging Face Daily Papers · 2026-07-31 缓存

SAF-OPD 引入了一种稳定优势融合框架,将 RLVR 与在线策略蒸馏相结合,解决了幅度失配和时间失配问题,从而提高了数学和代码基准测试中的训练稳定性与性能。

0 人收藏 0 人点赞
#rlvr

推理的代价:神经机器翻译中强化学习的成本-质量权衡

arXiv cs.CL · 2026-07-22 缓存

研究了推理痕迹在神经机器翻译强化学习中的重要性,显示在推理过程中加入推理可以提升质量,但代价是增加计算需求。

0 人收藏 0 人点赞
#rlvr

ISO:一个RLVR原生优化栈

Hugging Face Daily Papers · 2026-07-21 缓存

本文研究了带可验证奖励的强化学习(RLVR)的优化层,提出等谱优化(ISO)——一个固定谱框架,在优化输入/输出奇异帧的同时复用基础模型权重谱。ISO-Merger和ISO-AdamW在推理和编程任务上以更少的训练步骤实现了强性能。

0 人收藏 0 人点赞
#rlvr

H^2SD:混合事后自我蒸馏

Hugging Face Daily Papers · 2026-07-21 缓存

提出H^2SD,一种混合事后自我蒸馏框架,通过对成功和失败轨迹采用不同的教师模型使用方式,改善了RLVR,实现了更优的推理性能。

0 人收藏 0 人点赞
#rlvr

@ddkang:来自Bridgewater AIA Labs、UIUC和MIT的新研究:我们证明了我们认为的首个非平凡泛化…

X AI KOLs Timeline · 2026-07-20 缓存

来自Bridgewater AIA Labs、UIUC和MIT的研究人员证明了首个针对使用RLVR训练的推理LLM的非平凡泛化界,为未见数据提供可证明的准确率下界,以指导安全部署。

0 人收藏 0 人点赞
#rlvr

超越熵:通过对比策略优化的正确性感知优势塑造

Hugging Face Daily Papers · 2026-07-16 缓存

本文介绍了对比策略优化(CPO),该方法利用参考引导和普通生成分布之间的token级对比差异,在具有可验证奖励的强化学习中进行正确性感知的优势塑造。CPO在域内和域外基准测试中均优于基于熵的RLVR方法。

0 人收藏 0 人点赞
#rlvr

@bojie_li: 介绍RLVP,Penalize the Path, Reward the Outcome:一篇我与华盛顿大学Noah Shi合作完成的论文…

X AI KOLs Timeline · 2026-07-09 缓存

本文介绍了RLVP(Reward the Outcome, Penalize the Path),一种强化学习方法,它使用可验证的路径违规惩罚和结果奖励,在实现高任务成功率的同时达到接近零的约束违规,提升了实际代理环境中的样本效率。

0 人收藏 0 人点赞
#rlvr

强化学习用于大型语言模型的寻求证据诊断推理

arXiv cs.AI · 2026-07-07 缓存

本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。

0 人收藏 0 人点赞
#rlvr

@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…

X AI KOLs Timeline · 2026-07-03 缓存

这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。

0 人收藏 0 人点赞
#rlvr

@tanayj: https://x.com/tanayj/status/2072766211256119475

X AI KOLs Timeline · 2026-07-02 缓存

本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。

0 人收藏 0 人点赞
#rlvr

超越可验证的RL(8分钟阅读)

TLDR AI · 2026-06-30 缓存

本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。

0 人收藏 0 人点赞
#rlvr

通用推理的可迁移性:多领域RLVR的自动化课程设计

Hugging Face Daily Papers · 2026-06-27 缓存

本文提出了一种迁移感知课程(TAC),这是一种基于多臂老虎机风格的多领域RLVR在线课程,通过梯度几何对齐优先选择其更新能惠及其他领域的领域。与固定课程和仅基于可学习性的课程相比,TAC在Qwen3-1.7B和Llama3.2-3B上提升了宏观平均准确率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈