代码智能体强化学习中的群体智能评分与优势重分配
摘要
小米开发了GAGAR,一种用于代码智能体强化学习的群体智能评分器,旨在超越测试通过来提升代码质量,并已集成到MiMo-V2.6系列中。
查看缓存全文
缓存时间: 2026/09/29 12:10
论文页面 - 面向代码智能体强化学习的分组式代理评分与优势再分配
来源:https://huggingface.co/papers/2609.32577 在小米,我们开发了GAGAR——一种代码智能体强化学习的新方法,它引入分组式代理评分器来实现在线优势再分配。GAGAR不仅优化测试通过率,更使代码智能体学会如何产出更高质量、更易维护的实现方案。这项技术已集成至近期发布的MiMo-V2.6系列大规模强化学习训练流水线。
本研究的动机源于同事对我们初代模型的测试反馈:“任务完成了,但模型在代码中留下了一堆糟粕。”
这句话揭示了基于测试评估的根本局限:通过测试并不等同于产出高质量实现。在成功解决方案中,有些精准简洁,有些却引入不必要的复杂性;有些直指核心问题,有些则采用冗长迂回的路径。二元化的测试奖励机制难以捕捉这些差异。GAGAR通过允许评分器对解决同一任务的多个轨迹进行组内联合评估,将低质量成功方案的信用重新分配给高质量方案,从而应对此挑战。通过这个过程,模型不仅能学会通过测试,更能学会选择更优解路径、编写更整洁精准、可直接合并的代码。
实现这一方案需要三个关键设计:
- 分组式:通过对比使差异显性化。单独审查某个实现时,质量差异往往难以识别。许多不必要的复杂性可能看似合理,但当多个解决方案并列呈现时,评分器能更准确判断哪些方法过于繁琐,哪些方案更优雅高效。
- 代理式:评估需要主动探究。评估代码轨迹同样需要代理式流程。对于包含数百个交互轮次的任务,评分器需要主动检查相关信息——包括中间轨迹、补丁、代码库及执行证据,而非仅凭单一输入或压缩摘要做出判断。
- 零和式:信用再分配而非简单惩罚。从低质量解决方案中移除的信用应转移给高质量方案。GAGAR并非简单降低低质量正样本的优势值,而是在保持整体正向奖励信号的同时,调整成功轨迹间的相对偏好。这避免了强化学习训练中正负优势失衡的问题。
我们将GAGAR集成到参数规模达3100亿和1.02万亿的工业级模型强化学习训练中,覆盖所有代码训练任务。我们观察到通过率与实现质量的提升,同时交互轮次和输出token消耗减少,训练过程也更稳定。
更广泛而言,GAGAR为扩展强化学习训练提供了新路径:我们不再仅扩大模型规模或采样数量,而是通过分配额外计算资源给评分器,以更好地理解哪些行为真正值得学习。
借助GAGAR,MiMo-V2.6系列实现了与前沿模型相当的代码能力。对于在包含数百个交互轮次环境中运行的代码智能体——其代码库与执行状态持续分叉——代理式评分器相比依赖跨轨迹状态共享的信用分配方法尤为适用。我们还在持续探索轮次级信用分配,并研究零和再分配如何应用于不同评分器、惩罚机制与优势调整策略。
最后,我们分享MiMo-V2.6系列的发布信息:
- 博客:https://mimo.xiaomi.com/mimo-v2-6
- 技术报告:https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
- Hugging Face权重:https://huggingface.co/collections/XiaomiMiMo/mimo-v26
相似文章
MiMo-V2.6:扩展强化学习迈向自我提升(9分钟阅读)
MiMo-V2.6 引入了组间优势重分配,通过比较同级尝试和使用分级反馈来增强AI代理的强化学习,在多个任务领域显示稳定的性能提升。
GAGPO:广义优势分组策略优化
GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。
@cwolferesearch: 智能体强化学习需要新的算法改进。在GRPO中,用于训练的“群体”开始发生变化……
本线程讨论了针对智能体强化学习对GRPO的改进,重点介绍了不同层级的优势归一化(提示层级、任务层级、环境层级),以应对多任务、多轮次环境中的高奖励方差。
面向进度与可靠性的智能体强化学习组策略优化
ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。
Agent-G^2:基于高斯指导的代理强化学习
Agent-G^2 引入了一个高斯指导框架,用于强化学习中的提示深度,提升了长期代理任务的性能,无需额外的探测回合,并在 ALFWorld 和 WebShop 基准测试中取得优异结果。