从一到多,从多到一:面向软件工程智能体的类别感知迭代专家训练

Hugging Face Daily Papers 论文

摘要

本文介绍了一种用于软件工程智能体的类别感知专家训练框架,以缓解不同任务类别间进展不均的问题。该框架采用迭代训练和多教师蒸馏技术,并在Pro-618和SWE-bench Multilingual基准测试上取得了显著性能提升。

仓库级软件工程(SWE)包含异构任务类别,其在池化智能体强化学习下的进展可能不均衡:某些类别的进展伴随着其他类别的退步,而整体评估掩盖了这些变化。受这种类别跷跷板现象启发,我们开发了类别感知的专家训练和策略集成框架。可执行任务构建和SWE Labeler(一个基于证据的多轴标注系统)组织训练池。初始类别特定强化学习提高了平均训练成功率,但留下了不均衡的实例级进展,促使我们明确巩固成功行为并进行策略自适应任务选择。同源类别专家交替进行长期Agentic-miniRL和Refresh-Repair-Expand(RRE):更新后的策略刷新实例掌握度,重用自身验证成功的轨迹进行修复监督微调(SFT),并重新选择任务进行进一步强化学习。标签路由的多教师在策略蒸馏(MOPD)将专家合并为一个可部署的学生模型,其中ReLU门控奖励外推仅保留每个教师相对于参考的改进方向。专家训练和策略集成不需要外部模型提供解决方案轨迹或动作目标。我们通过整体和每类解析度、相对于每个联合强化学习基线的最小类别提升以及专家增益恢复,评估了池化强化学习和平衡强化学习、专家开发以及单模型集成。最终的MOPD策略在Pro-618上实现了58.04%的平均解析度,在SWE-bench Multilingual上实现了59.00%,分别比基础模型提高了5.39和2.78个百分点。
查看原文
查看缓存全文

缓存时间: 2026/09/22 03:25

论文页面 - 从一到多,从多到一:面向类别的迭代专家训练框架应用于软件工程智能体

来源:https://huggingface.co/papers/2609.23377

摘要

仓库级软件工程任务包含异构的任务类别,在统一的智能体强化学习中,其进展可能不均衡:部分类别的提升可能与其他类别的性能回退同时出现,而聚合后的整体解析度指标掩盖了这些变化。基于这种“类别跷跷板“现象,我们开发了一个类别感知的专家训练与策略整合框架。通过可执行任务构建和基于证据的多轴标注系统SWE-Labeler来组织训练池。初始的类别专用强化学习在提升平均训练成功率的同时,仍存在实例级进展不均衡的问题,这促使我们明确整合成功行为并实现策略自适应的任务选择。同源类别专家交替进行长期智能体微型强化学习与刷新-修复-扩展循环:更新后的策略刷新实例掌握度,重用自身已验证的成功轨迹进行修复式监督微调,并重新选择任务进行进一步强化学习。标签路由的多教师在策略蒸馏将各专家整合为一个可部署的学生模型,使用ReLU门控奖励外推,仅保留每个教师相对于参考模型的改进方向。专家训练与策略整合无需外部模型提供解决方案轨迹或动作目标。我们通过聚合和逐类别解析度评估了统一强化学习与平衡强化学习、专家开发以及单模型整合的效果,包括每个联合强化学习基线上的最小类别提升和专家增益恢复率。最终的MOPD策略在Pro-618上达到58.04%的平均解析度,在SWE-bench Multilingual上达到59.00%,分别比基础模型提升了5.39和2.78个百分点。

查看 arXiv 页面 (https://arxiv.org/abs/2609.23377) 查看 PDF (https://arxiv.org/pdf/2609.23377) 项目页面 (https://huggingface.co/Logics-MLLM/Logics-SWE-Qwen3.6-27B) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.23377)

在你的智能体中获取这篇论文:

hf papers read 2609.23377

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型1

Logics-MLLM/Logics-SWE-Qwen3.6-27B 强化学习 • 27B • 大约 1 小时前更新 • 30 • 5 (https://huggingface.co/Logics-MLLM/Logics-SWE-Qwen3.6-27B)

引用本文的数据集1

Logics-MLLM/Logics-SWE-Env-2.5K 查看器 • 大约 1 小时前更新 • 2.55k • 1 (https://huggingface.co/datasets/Logics-MLLM/Logics-SWE-Env-2.5K)

引用本文的空间0

没有链接本文的空间

在空间 README.md 中引用 arxiv.org/abs/2609.23377 即可从本页面链接。

包含本文的收藏夹0

没有包含本文的收藏夹

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

AgentBrew: 从强教师到弱LLM代理的终身知识酿造

arXiv cs.AI

AgentBrew 提出了一种无需训练的方法,将知识从强教师 LLM 代理蒸馏到弱学生代理,通过失败触发的反思循环和感知学生的合成来创建可执行的笔记,提高了编码、数学和工具使用任务的性能,而无需更新权重。

基于智能体经验的高效样本学习

Hugging Face Daily Papers

提出Experience Distillation方法,该方法将在智能体交互历史中通过上下文学习获得的增益内化到模型权重中,无需额外的环境交互,在软件工程和文字冒险任务上实现了显著的样本效率提升。

扩展视野而非参数:以35B智能体达到万亿参数性能

Hugging Face Daily Papers

介绍了Agents-A1,一个35B混合专家智能体模型,通过长视野轨迹缩放和三阶段训练方法(包括SFT、领域级教师和多教师蒸馏)实现了万亿参数级别的性能。在长视野智能体基准测试中,该模型表现优于或媲美更大规模的模型。