组合合成:通过原子分解与重组扩展代码RLVR
摘要
介绍原子分解与重组(ADR),一种通过分解和重组原子元素来生成新颖且具有挑战性的可验证代码任务的框架,从而为大型语言模型实现可扩展的基于可验证奖励的强化学习。
查看缓存全文
缓存时间: 2026/06/05 06:07
论文页面 - 组合合成:通过原子分解与重组实现代码RLVR的规模化扩展
来源:https://huggingface.co/papers/2605.31058
摘要
原子分解与重组 (Atomic Decomposition and Recombination, ADR) 框架能够生成新颖且富有挑战性的可验证代码任务,用于大语言模型中基于可验证奖励的可扩展强化学习。
带可验证奖励的强化学习 (https://huggingface.co/papers?q=Reinforcement%20Learning%20with%20Verifiable%20Rewards) (RLVR) 近期已成为塑造大语言模型 (https://huggingface.co/papers?q=Large%20Language%20Models) (LLMs) 卓越编程能力的基石。然而,RLVR 的可扩展性 (https://huggingface.co/papers?q=scalability) 受到严重制约,原因在于缺乏足够具有挑战性且接近模型能力边界的可验证代码任务 (https://huggingface.co/papers?q=verifiable%20code%20tasks)。先前的研究通常依赖启发式种子扩展 (https://huggingface.co/papers?q=heuristic%20seed%20expansion) 进行数据合成,这严重限制了任务的新颖性与难度。因此,此类数据的训练价值无法随合成规模的扩大而按比例提升。为此,我们提出原子分解 (https://huggingface.co/papers?q=Atomic%20Decomposition) 与重组 (https://huggingface.co/papers?q=Recombination) (ADR),这是一种新颖框架,通过将可验证代码任务 (https://huggingface.co/papers?q=verifiable%20code%20tasks) 分解为原子元素并进行受控重组 (https://huggingface.co/papers?q=recombination),从而生成真正新颖且具有挑战性的可验证代码任务 (https://huggingface.co/papers?q=verifiable%20code%20tasks)。实验与分析表明,与现有基线相比,ADR 在原创性、难度、多样性和测试质量方面均表现更优,并在包括算法编程 (https://huggingface.co/papers?q=algorithmic%20programming)、工具使用 (https://huggingface.co/papers?q=tool%20usage) 和 数据科学 (https://huggingface.co/papers?q=data%20science) 在内的多个下游领域的 RLVR 训练中持续带来更大的编程能力提升。我们的工作为新颖代码任务合成 (https://huggingface.co/papers?q=code%20task%20synthesis) 和可扩展的 RLVR 训练开辟了新范式。
查看 arXiv 页面 (https://arxiv.org/abs/2605.31058)查看 PDF (https://arxiv.org/pdf/2605.31058)GitHub3 (https://github.com/icip-cas/ADR)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.31058)
在你的 agent 中获取这篇论文:
hf papers read 2605.31058
没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
无模型链接本论文
在模型 README.md 中引用 arxiv.org/abs/2605.31058 即可从本页链接。
引用本论文的数据集0
无数据集链接本论文
在数据集 README.md 中引用 arxiv.org/abs/2605.31058 即可从本页链接。
引用本论文的 Space0
无 Space 链接本论文
在 Space README.md 中引用 arxiv.org/abs/2605.31058 即可从本页链接。
包含本论文的合集0
无合集包含本论文
将本论文添加到一个合集 (https://huggingface.co/new-collection) 中即可从本页链接。
相似文章
@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
@adithya_s_k: https://x.com/adithya_s_k/status/2054961319179420035
分析为什么强化学习在编程任务中因可验证奖励而受到青睐,以及新兴框架Harbor如何解决RL训练中环境复杂度的瓶颈。
超越可验证的RL(8分钟阅读)
本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。
AgentV-RL:用智能体验证器扩展奖励建模
AgentV-RL引入了智能体验证器框架,通过具有工具增强的前向和后向智能体进行双向验证来增强奖励建模,相比最先进的ORM实现了25.2%的性能提升。该方法通过将多轮深思熟虑过程与强化学习相结合,解决了验证器在复杂推理任务中的误差传播和基础性不足等问题。
REVES: REVES:修订与验证增强的测试时扩展训练
提出REVES,一种两阶段迭代框架,交替进行数据增强与策略优化,通过利用中间修正步骤提升LLM推理能力,在编程基准测试和约束满足问题上取得更优性能。