CodeMidas:从代码本身扩展智能编程强化学习环境

Hugging Face Daily Papers 论文

摘要

CodeMidas 是一个智能管道,它从源代码创建强化学习环境,扩展编程代理的训练,并在问题修复和程序构建等基准测试中展示性能提升。

通过强化学习 (RL) 训练有能力的编程代理需要多样化任务与可靠的验证器。开源代码库提供了此类任务的丰富来源,而现有方法通常依赖开发工件,如问题和提交,这限制了可提取任务的范围。为了更好地扩展强化学习环境,我们提出 CodeMidas,这是一个智能管道,它将现有代码库中已实现的功能转化为可执行的强化学习环境,仅使用源代码作为其特定任务输入。CodeMidas 在每个环境构建阶段分配智能计算:代理探索已实现的功能以制定行为规范,基于原始代码执行构建测试,并通过执行检查和重复解决方案部署来验证和过滤候选任务。生成的数据集包含来自 3,185 个开源代码库的 5,545 个训练任务,涵盖 23 种编程语言和 15 个技术领域。使用 GRPO 在这些任务上训练 MiMo-V2.5 可在所有五个多样化基准测试中提升性能,涵盖问题修复 (DeepSWE + 11.7%)、整程序构建 (ProgramBench +17%) 和终端工作 (Terminal-Bench v2.1 +8.5%)。消融研究表明,增加高质量训练任务的数量可提升性能。轨迹分析显示,强化学习训练的代理表现出更好的行为,如增加代码库探索和更多样化的自我验证。这些结果确立了源代码作为构建强化学习环境的可扩展基础,以改进跨多样软件任务的编程代理。
查看原文
查看缓存全文

缓存时间: 2026/09/21 03:18

论文页面 - CodeMidas:从代码本身扩展代理编码强化学习环境

来源:https://huggingface.co/papers/2609.22068
发布于 9 月 18 日

·

由 https://huggingface.co/tobiaslee 提交

Lei Li (https://huggingface.co/tobiaslee) 于 9 月 21 日

#2 当日热门论文 (https://huggingface.co/papers/date/2026-09-21)
作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

通过强化学习 (RL) 训练有能力的编码代理需要多样化的任务和可靠的验证器。开源代码库提供了此类任务的丰富来源,而现有方法通常依赖于开发制品(如问题和提交记录),这限制了可提取的任务范围。为了更好地扩展 RL 环境,我们推出了 CodeMidas——一种代理化流水线,它将现有代码库中已实现的功能转化为可执行的 RL 环境,仅使用源代码作为其特定任务的输入。CodeMidas 将代理计算分配到环境构建的每个阶段:代理探索已实现的功能以形成行为规范,基于原始代码的执行构建测试,并通过执行检查和重复的解决方案生成来验证和筛选候选任务。最终生成的数据集包含来自 3,185 个开源代码库的 5,545 个训练任务,涵盖 23 种编程语言和 15 个技术领域。使用 GRPO 在这些任务上训练 MiMo-V2.5,在全部五个不同的基准测试中均提升了性能,涵盖问题修复 (DeepSWE +11.7%)、完整程序构建 (ProgramBench +17%) 和终端工作 (Terminal-Bench v2.1 +8.5%)。消融研究表明,增加高质量训练任务的数量可以提升性能。轨迹分析显示,经过 RL 训练的代理展现了更好的行为,如增加代码库探索和更多样化的自我验证。这些结果确立了源代码作为构建 RL 环境的可扩展基础,能够提升编码代理在多样化软件任务中的表现。

查看 arXiv 页面 (https://arxiv.org/abs/2609.22068) 查看 PDF (https://arxiv.org/pdf/2609.22068) 项目页面 (https://mimo.xiaomi.com/rl/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.22068)

通过你的代理获取此论文:

hf papers read 2609.22068

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

无模型链接本文

在模型 README.md 中引用 arxiv.org/abs/2609.22068 以从本页链接它。

引用本文的数据集 0

无数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2609.22068 以从本页链接它。

引用本文的 Space 0

无 Space 链接本文

在 Space README.md 中引用 arxiv.org/abs/2609.22068 以从本页链接它。

包含本文的收藏 0

无收藏包含本文

将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

使用 MCP 进行代码执行:构建更高效的智能体

Anthropic Engineering

本文来自 Anthropic,探讨了如何将代码执行与 Model Context Protocol (MCP) 相结合,以提升 AI 智能体的效率。文章分析了工具定义和中间结果导致的 token 过载等挑战,并提出代码执行作为降低延迟和成本的解决方案。