verifiable-rewards

标签

Cards List
#verifiable-rewards

VERPO:验证证据正则化策略优化

arXiv cs.LG · 6天前 缓存

VERPO 引入了一个框架,用于在语言模型中进行验证证据正则化策略优化,通过将证据视为策略修正的提议,同时保持目标结果,以提高在科学推理和工具使用任务上的性能。

0 人收藏 0 人点赞
#verifiable-rewards

VBVR-Pro: 一个用于原生视觉推理的可扩展且可验证的套件

Hugging Face Daily Papers · 2026-08-26 缓存

VBVR-Pro 引入了一个闭环测试平台,用于通过生成实现可扩展且可验证的原生视觉推理,其特点包括任务扩展、可验证奖励以及跨多样视觉基底的机制研究。

0 人收藏 0 人点赞
#verifiable-rewards

@mervenoyann:@willcb的有趣演讲

X AI KOLs Timeline · 2026-08-20 缓存

Primordial AI的Will Brown在此次演讲中探讨了如何将强化学习扩展至奖励难以验证的复杂现实任务,涉及锚定法、大语言模型评判与仿真模拟等技术。

0 人收藏 0 人点赞
#verifiable-rewards

早期判决,更优预算:面向计算高效RLVR的顺序自适应rollout分配

arXiv cs.LG · 2026-07-30 缓存

本文提出SARA,一种面向RLVR的顺序自适应rollout分配方法,该方法提前放弃饱和组并重新分配预算,相比动态采样,在rollout数量减少22%的情况下达到相当精度,若与之结合则可节省高达67%。

0 人收藏 0 人点赞
#verifiable-rewards

从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励

Hugging Face Daily Papers · 2026-07-26 缓存

本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。

0 人收藏 0 人点赞
#verifiable-rewards

当RLVR缩小推理边界:诊断Pass@k反转

arXiv cs.LG · 2026-07-24 缓存

本文诊断了可验证奖励强化学习(RLVR)中的“pass@k反转”现象:训练提高了单次准确率,但在重复采样下降低了性能,尤其是在正确轨迹稀少的边界提示上。提出了一种基于每个问题的基础锚定(PBA)方法来缓解这一问题。

0 人收藏 0 人点赞
#verifiable-rewards

SLPO:通过代理策略扩展潜在推理

Hugging Face Daily Papers · 2026-07-22 缓存

介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。

0 人收藏 0 人点赞
#verifiable-rewards

多买家市场中的策略性议价:基于可验证奖励的强化学习用于大语言模型谈判

arXiv cs.LG · 2026-07-08 缓存

本文提出一个框架,利用基于可验证奖励的强化学习来训练大语言模型,用于多买家市场中的策略性议价,解决并发谈判中的私有信息和剩余抽取问题。

0 人收藏 0 人点赞
#verifiable-rewards

RLVR中的奖励粒度:比较小语言模型数学推理中的过程奖励与结果奖励结构

arXiv cs.LG · 2026-07-07 缓存

本文系统比较了小语言模型在数学推理中用于可验证奖励强化学习(RLVR)的过程奖励与结果奖励结构。研究发现,仅过程监督相比仅结果监督显著提高了准确性和推理轨迹保真度,并分析了失败模式。

0 人收藏 0 人点赞
#verifiable-rewards

超越下一个词元预测:面向Atlassian工作流程中工具使用智能体的RLVR概念验证

arXiv cs.AI · 2026-07-03 缓存

本文提出了一项概念验证,使用基于可验证奖励的强化学习(RLVR)来训练小型语言模型,使其能够在Jira和Confluence等企业SaaS工作流程中使用工具。该方法利用合成环境和GRPO训练来提高工具调用准确率,相较于基线取得了显著的奖励增益。

0 人收藏 0 人点赞
#verifiable-rewards

用于校准概率预测的可验证奖励

arXiv cs.LG · 2026-07-02 缓存

该论文提出了一种可验证的无标签奖励,用于通过强化学习训练校准的概率预测器,避免了因奖励单个结果而导致的校准退化。应用于NFL胜率预测,使用该奖励训练的7B模型达到了与博彩市场相当的校准水平。

0 人收藏 0 人点赞
#verifiable-rewards

BV-Blend: 不确定性加权历史基线用于可验证奖励下稳定无评论家强化学习

arXiv cs.AI · 2026-06-30 缓存

BV-Blend是一种无评论家的强化学习框架,它将提示本地在线策略统计与来自语义聚类的历史矩相结合,以稳定优势估计,从而提高使用可验证奖励对齐大型语言模型的训练稳定性和性能。

0 人收藏 0 人点赞
#verifiable-rewards

Tandem Reinforcement Learning with Verifiable Rewards

arXiv cs.AI · 2026-06-29 缓存

提出了串联强化学习(Tandem Reinforcement Learning, TRL),将串联训练范式扩展到基于可验证奖励的强化学习(RLVR),以提升推理在较弱模型和人类中的兼容性与可读性。结果表明,TRL在保持单模型性能的同时,增强了交接鲁棒性并减少了分布偏移。

0 人收藏 0 人点赞
#verifiable-rewards

Reasoning Arena: 当可验证奖励不足时的追踪锦标赛

Hugging Face Daily Papers · 2026-06-08 缓存

Reasoning Arena 通过使用追踪锦标赛和Bradley-Terry模型,从非多样化奖励组中生成有意义的梯度,从而改进了基于可验证奖励的强化学习,实现了更快的训练和更好的推理性能。

0 人收藏 0 人点赞
#verifiable-rewards

面向长程语言智能体可验证强化学习的策略条件化反事实信用

arXiv cs.LG · 2026-06-05 缓存

提出了CVT-RL,一种带有策略条件化反事实贡献估计和可验证奖励的约束策略梯度算法,提高了长程语言智能体的可靠性并减少了奖励篡改。

0 人收藏 0 人点赞
#verifiable-rewards

组合合成:通过原子分解与重组扩展代码RLVR

Hugging Face Daily Papers · 2026-05-29 缓存

介绍原子分解与重组(ADR),一种通过分解和重组原子元素来生成新颖且具有挑战性的可验证代码任务的框架,从而为大型语言模型实现可扩展的基于可验证奖励的强化学习。

0 人收藏 0 人点赞
#verifiable-rewards

CUA-Gym: 为计算机使用代理扩展可验证的训练环境与任务

Hugging Face Daily Papers · 2026-05-25 缓存

CUA-Gym 引入了一个可扩展的流水线,用于为计算机使用代理生成可验证的训练环境和任务,从而解决数据稀缺问题。由此产生的数据集和模型在OSWorld-Verified和WebArena等基准测试上取得了强劲的性能。

0 人收藏 0 人点赞
#verifiable-rewards

DelTA:面向可验证奖励强化学习的判别性Token信用分配

Hugging Face Daily Papers · 2026-05-20 缓存

介绍DelTA,一种用于可验证奖励强化学习(RLVR)的判别性Token信用分配方法,该方法放大独特的Token梯度方向,减少共享模式的噪声,在数学和代码生成基准上取得了显著改进。

0 人收藏 0 人点赞
#verifiable-rewards

@adithya_s_k: https://x.com/adithya_s_k/status/2054961319179420035

X AI KOLs Timeline · 2026-05-14 缓存

分析为什么强化学习在编程任务中因可验证奖励而受到青睐,以及新兴框架Harbor如何解决RL训练中环境复杂度的瓶颈。

0 人收藏 0 人点赞
#verifiable-rewards

视频模型可通过可验证奖励进行推理

Hugging Face Daily Papers · 2026-05-14 缓存

VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈