代码智能体强化学习中的群体智能评分与优势重分配

Hugging Face Daily Papers 论文

摘要

小米开发了GAGAR,一种用于代码智能体强化学习的群体智能评分器,旨在超越测试通过来提升代码质量,并已集成到MiMo-V2.6系列中。

强化学习(RL)在代码智能体中常通过可执行测试提供二元奖励。使用这些奖励时,组相对策略优化(GRPO)会为每个展开组内通过测试的轨迹分配相同的优势,忽略了实现质量和任务要求遵守的差异。这导致策略缺乏学习信号,无法偏好干净、有针对性的实现,而不是包含不必要或超出范围更改的实现。我们引入GAGAR,一个用于代码智能体强化学习中质量感知信用重分配的框架。基于动态采样,保留包含通过和失败轨迹的组,GAGAR将每个组的所有轨迹放置在共享工作空间中,由一个经过SFT训练的智能评分器共同检查它们并对通过测试的候选进行排名。根据此排名,我们降低排名较低轨迹的权重,并按比例重新调整所有通过测试轨迹的优势以恢复其原始总和。这种总和保持的重分配保留了基于质量的降重所建立的相对权重,同时将信用转向更高质量的实现。我们使用MiMo-V2.6-Flash(总参数310B)和MiMo-V2.6-Pro(总参数1.02T)的预RL SFT检查点在工业规模上评估GAGAR。受控的仅代码Flash实验显示代码智能体性能改善、轨迹长度增长减少以及训练更稳定。我们进一步在Flash和Pro的大规模混合任务RL中应用GAGAR。我们的结果支持将基于测试的验证与群体智能评分相结合,以提升代码智能体强化学习的质量和稳定性。
查看原文
查看缓存全文

缓存时间: 2026/09/29 12:10

论文页面 - 面向代码智能体强化学习的分组式代理评分与优势再分配

来源:https://huggingface.co/papers/2609.32577 在小米,我们开发了GAGAR——一种代码智能体强化学习的新方法,它引入分组式代理评分器来实现在线优势再分配。GAGAR不仅优化测试通过率,更使代码智能体学会如何产出更高质量、更易维护的实现方案。这项技术已集成至近期发布的MiMo-V2.6系列大规模强化学习训练流水线。

本研究的动机源于同事对我们初代模型的测试反馈:“任务完成了,但模型在代码中留下了一堆糟粕。”

这句话揭示了基于测试评估的根本局限:通过测试并不等同于产出高质量实现。在成功解决方案中,有些精准简洁,有些却引入不必要的复杂性;有些直指核心问题,有些则采用冗长迂回的路径。二元化的测试奖励机制难以捕捉这些差异。GAGAR通过允许评分器对解决同一任务的多个轨迹进行组内联合评估,将低质量成功方案的信用重新分配给高质量方案,从而应对此挑战。通过这个过程,模型不仅能学会通过测试,更能学会选择更优解路径、编写更整洁精准、可直接合并的代码。

实现这一方案需要三个关键设计:

  1. 分组式:通过对比使差异显性化。单独审查某个实现时,质量差异往往难以识别。许多不必要的复杂性可能看似合理,但当多个解决方案并列呈现时,评分器能更准确判断哪些方法过于繁琐,哪些方案更优雅高效。
  2. 代理式:评估需要主动探究。评估代码轨迹同样需要代理式流程。对于包含数百个交互轮次的任务,评分器需要主动检查相关信息——包括中间轨迹、补丁、代码库及执行证据,而非仅凭单一输入或压缩摘要做出判断。
  3. 零和式:信用再分配而非简单惩罚。从低质量解决方案中移除的信用应转移给高质量方案。GAGAR并非简单降低低质量正样本的优势值,而是在保持整体正向奖励信号的同时,调整成功轨迹间的相对偏好。这避免了强化学习训练中正负优势失衡的问题。

我们将GAGAR集成到参数规模达3100亿和1.02万亿的工业级模型强化学习训练中,覆盖所有代码训练任务。我们观察到通过率与实现质量的提升,同时交互轮次和输出token消耗减少,训练过程也更稳定。

更广泛而言,GAGAR为扩展强化学习训练提供了新路径:我们不再仅扩大模型规模或采样数量,而是通过分配额外计算资源给评分器,以更好地理解哪些行为真正值得学习。

借助GAGAR,MiMo-V2.6系列实现了与前沿模型相当的代码能力。对于在包含数百个交互轮次环境中运行的代码智能体——其代码库与执行状态持续分叉——代理式评分器相比依赖跨轨迹状态共享的信用分配方法尤为适用。我们还在持续探索轮次级信用分配,并研究零和再分配如何应用于不同评分器、惩罚机制与优势调整策略。

最后,我们分享MiMo-V2.6系列的发布信息:

  • 博客:https://mimo.xiaomi.com/mimo-v2-6
  • 技术报告:https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
  • Hugging Face权重:https://huggingface.co/collections/XiaomiMiMo/mimo-v26

相似文章

GAGPO:广义优势分组策略优化

arXiv cs.AI

GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。

面向进度与可靠性的智能体强化学习组策略优化

arXiv cs.AI

ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。

Agent-G^2:基于高斯指导的代理强化学习

Hugging Face Daily Papers

Agent-G^2 引入了一个高斯指导框架,用于强化学习中的提示深度,提升了长期代理任务的性能,无需额外的探测回合,并在 ALFWorld 和 WebShop 基准测试中取得优异结果。