rlvr

标签

Cards List
#rlvr

RLVR在迭代乘法中的优化景观可以是良性的:来自自旋玻璃理论的洞见

arXiv cs.LG ↗ · 7小时前 缓存

本文将RLVR在算法任务上映射到自旋玻璃模型,并证明对于一类任务优化景观是良性的,实际挑战源于扩散障碍和梯度误差,而非景观崎岖性。

0 人收藏 0 人点赞
#rlvr

迈向可扩展的RLVR:多模态指令跟随数据合成与提炼

arXiv cs.CL ↗ · 2026-09-16 缓存

本文介绍了MIFS,一个用于合成RL就绪多模态数据的流程,旨在增强多模态大语言模型(MLLMs)的指令跟随能力,在基准测试中实现了平均8.13%的提升,并加快了训练收敛速度。

0 人收藏 0 人点赞
#rlvr

解锁不可解难题:教师引导的课程学习实现数据高效RLVR

arXiv cs.CL ↗ · 2026-09-15 缓存

本文介绍了一种教师引导的课程学习方法,用于强化学习与可验证奖励(RLVR),以高效训练语言模型处理初始不可解的数学问题,实现显著的数据效率并扩展推理边界。

0 人收藏 0 人点赞
#rlvr

MInTRL: 离策略干预能够提升在线策略强化学习

arXiv cs.LG ↗ · 2026-09-14 缓存

MInTRL在在线策略强化学习中提出最小干预,以扩展探索并提升在数学和代码基准测试上的性能,超越标准基线。

0 人收藏 0 人点赞
#rlvr

贝尔曼策略优化 (BPO)

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

贝尔曼策略优化 (BPO) 是一种无评论家的强化学习方法,它利用贝尔曼方程重新表述策略镜像下降 (PMD),用于具有终端奖励的自回归生成,从而提升大语言模型的数学推理能力。

0 人收藏 0 人点赞
#rlvr

在模型改变主意之处分叉:树结构强化学习中的信念偏移分支

arXiv cs.AI ↗ · 2026-09-12 缓存

本文提出了一种用于树结构强化学习的信念偏移分支方法,以增强步骤级信用分配,并在数学和编程基准测试中展示了性能提升。

0 人收藏 0 人点赞
#rlvr

基于难度适应的树结构策略优化以扩展RLVR中的推理覆盖

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

论文提出了DATPO,一种基于难度适应的树结构策略优化方法,通过句子熵引导的分支和多样性感知优化来增强大模型中的推理覆盖,在pass@k指标上优于基线方法。

0 人收藏 0 人点赞
#rlvr

DataFlex-RL:一个针对RLVR数据策略的评估平台

Hugging Face Daily Papers ↗ · 2026-09-05 缓存

DataFlex-RL是一个评估RLVR数据策略的平台,它发现均匀采样在数学、逻辑和科学基准测试中与自适应方法表现相当。

0 人收藏 0 人点赞
#rlvr

DE-Venus:面向大型语言模型的数据高效RLVR框架

arXiv cs.LG ↗ · 2026-09-04 缓存

DE-Venus 是一个统一的框架,用于大型语言模型中的数据高效RLVR,在保持性能的同时降低标注和训练成本。

0 人收藏 0 人点赞
#rlvr

群组自适应裁剪策略优化

arXiv cs.LG ↗ · 2026-09-02 缓存

本文提出群组自适应裁剪策略优化(GAPO),这是一种对GRPO方法的插件式修改,通过根据rollout优势自适应调整裁剪边界,在数学推理和编程基准测试中提升了Pass@1和Pass@k的表现。

0 人收藏 0 人点赞
#rlvr

Cliff:从首个错误中学习过程奖励

Hugging Face Daily Papers ↗ · 2026-09-02 缓存

Cliff 通过使用现成的大型语言模型(LLM)检测首个推理错误并塑造 token 级别的优势,从而改进具有可验证奖励的强化学习,相比现有方法带来持续的性能提升。

0 人收藏 0 人点赞
#rlvr

锁入口,内开阔:RLVR 如何缩窄解空间

arXiv cs.LG ↗ · 2026-09-01 缓存

本文通过分析多样性在何处丧失,研究了带有可验证奖励的强化学习如何缩窄大语言模型推理的解空间,发现其集中于轨迹的“入口”处。研究证明,无需牺牲准确性,即可通过干预措施恢复解的广度。

0 人收藏 0 人点赞
#rlvr

将任务专业知识融入强化学习,实现在text-to-SQL上的最佳性能(18分钟阅读)

TLDR AI ↗ · 2026-08-28 缓存

本文描述了一种带有可验证奖励的强化学习方法,用于微调AI模型以进行text-to-SQL任务,在BIRD基准上达到了无需辅助结构的人类水平准确率。

0 人收藏 0 人点赞
#rlvr

Contrastive Branch Policy Optimization

arXiv cs.LG ↗ · 2026-08-26 缓存

CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。

0 人收藏 0 人点赞
#rlvr

Continual Reasoning Gym: 诊断与利用持续 RLVR 中的共享推理

arXiv cs.LG ↗ · 2026-08-20 缓存

论文介绍了持续推理健身房,用于诊断和改进具有可验证奖励的持续强化学习(RLVR),提出了持续提示重放(CPR)以利用共享推理结构,达到多任务级性能。

0 人收藏 0 人点赞
#rlvr

PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR

arXiv cs.LG ↗ · 2026-08-13 缓存

This paper introduces PAIR, a pairwise-aware inclusion reweighting method for adaptive rollout allocation in RLVR, improving sample efficiency and accuracy over pointwise allocators by correcting biases in pairwise gradient estimation.

0 人收藏 0 人点赞
#rlvr

现在我们有了OpenAI意外攻击Hugging Face的时间线

Simon Willison's Blog ↗ · 2026-08-08 缓存

西蒙·威利森分析了OpenAI意外攻击Hugging Face的时间线,认为新模型的RLVR训练解释了安全行为缺失和监控松懈的原因。

0 人收藏 0 人点赞
#rlvr

Fable、GPT-5.6 及其他前沿模型都是混蛋。原因如下。

Reddit r/artificial ↗ · 2026-08-04

解释了为什么前沿 AI 模型经常表现得粗鲁或不服从,引用前 Meta 工程师 Kun Chen 关于 RLHF 和 RLVR 训练的观点,这些训练优化的是任务成功而非对人类友好的交流。

0 人收藏 0 人点赞
#rlvr

在失败处蒸馏:从自适应教师指导中恢复负RL组的学习信号

arXiv cs.CL ↗ · 2026-08-04 缓存

本文介绍了RSTG,一种在LLM后训练期间选择性地应用同策略蒸馏(on-policy distillation)来从零方差GRPO组中恢复学习信号的方法,在数学和代码推理基准上取得了显著提升。

0 人收藏 0 人点赞
#rlvr

同策略优化中验证器诱导的支持重塑

arXiv cs.LG ↗ · 2026-08-04 缓存

本文介绍了验证器诱导的支持重塑,表明具有可验证奖励的同策略强化学习能够在优化当前目标的同时,使后续目标的成功行为变得过于稀少而难以采样。跨数学推理和指令跟随的实验表明,端点改进并不能保证未来的可训练性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈