组合合成:通过原子分解与重组扩展代码RLVR

Hugging Face Daily Papers 论文

摘要

介绍原子分解与重组(ADR),一种通过分解和重组原子元素来生成新颖且具有挑战性的可验证代码任务的框架,从而为大型语言模型实现可扩展的基于可验证奖励的强化学习。

基于可验证奖励的强化学习(RLVR)近来已成为塑造大型语言模型(LLMs)卓越编码能力的基石。然而,RLVR的可扩展性受到严重限制,原因是缺乏足够具有挑战性且针对模型能力边界附近的可验证代码任务。先前的研究通常依赖启发式的种子扩展来进行数据合成,这严重限制了数据的新颖性和难度。因此,这类数据的训练价值无法与其合成规模成比例地扩展。为此,我们提出了原子分解与重组(ADR),一种新颖的框架,通过将任务分解为原子元素并进行可控重组来生成可验证代码任务,从而能够产生真正新颖且具有挑战性的可验证代码任务。实验和分析表明,与现有基线相比,ADR在原创性、难度、多样性和测试质量方面均表现更优,并且在包括算法编程、工具使用和数据科学在内的多个下游领域的RLVR中,持续带来更大的编码能力提升。我们的工作为新颖代码任务合成和可扩展的RLVR训练揭示了一种新范式。
查看原文
查看缓存全文

缓存时间: 2026/06/05 06:07

论文页面 - 组合合成:通过原子分解与重组实现代码RLVR的规模化扩展

来源:https://huggingface.co/papers/2605.31058

摘要

原子分解与重组 (Atomic Decomposition and Recombination, ADR) 框架能够生成新颖且富有挑战性的可验证代码任务,用于大语言模型中基于可验证奖励的可扩展强化学习。

带可验证奖励的强化学习 (https://huggingface.co/papers?q=Reinforcement%20Learning%20with%20Verifiable%20Rewards) (RLVR) 近期已成为塑造大语言模型 (https://huggingface.co/papers?q=Large%20Language%20Models) (LLMs) 卓越编程能力的基石。然而,RLVR 的可扩展性 (https://huggingface.co/papers?q=scalability) 受到严重制约,原因在于缺乏足够具有挑战性且接近模型能力边界的可验证代码任务 (https://huggingface.co/papers?q=verifiable%20code%20tasks)。先前的研究通常依赖启发式种子扩展 (https://huggingface.co/papers?q=heuristic%20seed%20expansion) 进行数据合成,这严重限制了任务的新颖性与难度。因此,此类数据的训练价值无法随合成规模的扩大而按比例提升。为此,我们提出原子分解 (https://huggingface.co/papers?q=Atomic%20Decomposition) 与重组 (https://huggingface.co/papers?q=Recombination) (ADR),这是一种新颖框架,通过将可验证代码任务 (https://huggingface.co/papers?q=verifiable%20code%20tasks) 分解为原子元素并进行受控重组 (https://huggingface.co/papers?q=recombination),从而生成真正新颖且具有挑战性的可验证代码任务 (https://huggingface.co/papers?q=verifiable%20code%20tasks)。实验与分析表明,与现有基线相比,ADR 在原创性、难度、多样性和测试质量方面均表现更优,并在包括算法编程 (https://huggingface.co/papers?q=algorithmic%20programming)、工具使用 (https://huggingface.co/papers?q=tool%20usage) 和 数据科学 (https://huggingface.co/papers?q=data%20science) 在内的多个下游领域的 RLVR 训练中持续带来更大的编程能力提升。我们的工作为新颖代码任务合成 (https://huggingface.co/papers?q=code%20task%20synthesis) 和可扩展的 RLVR 训练开辟了新范式。

查看 arXiv 页面 (https://arxiv.org/abs/2605.31058)查看 PDF (https://arxiv.org/pdf/2605.31058)GitHub3 (https://github.com/icip-cas/ADR)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.31058)

在你的 agent 中获取这篇论文:

hf papers read 2605.31058

没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

无模型链接本论文

在模型 README.md 中引用 arxiv.org/abs/2605.31058 即可从本页链接。

引用本论文的数据集0

无数据集链接本论文

在数据集 README.md 中引用 arxiv.org/abs/2605.31058 即可从本页链接。

引用本论文的 Space0

无 Space 链接本论文

在 Space README.md 中引用 arxiv.org/abs/2605.31058 即可从本页链接。

包含本论文的合集0

无合集包含本论文

将本论文添加到一个合集 (https://huggingface.co/new-collection) 中即可从本页链接。

相似文章

超越可验证的RL(8分钟阅读)

TLDR AI

本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。

AgentV-RL:用智能体验证器扩展奖励建模

arXiv cs.CL

AgentV-RL引入了智能体验证器框架,通过具有工具增强的前向和后向智能体进行双向验证来增强奖励建模,相比最先进的ORM实现了25.2%的性能提升。该方法通过将多轮深思熟虑过程与强化学习相结合,解决了验证器在复杂推理任务中的误差传播和基础性不足等问题。