从一到多,从多到一:面向软件工程智能体的类别感知迭代专家训练
摘要
本文介绍了一种用于软件工程智能体的类别感知专家训练框架,以缓解不同任务类别间进展不均的问题。该框架采用迭代训练和多教师蒸馏技术,并在Pro-618和SWE-bench Multilingual基准测试上取得了显著性能提升。
查看缓存全文
缓存时间: 2026/09/22 03:25
论文页面 - 从一到多,从多到一:面向类别的迭代专家训练框架应用于软件工程智能体
来源:https://huggingface.co/papers/2609.23377
摘要
仓库级软件工程任务包含异构的任务类别,在统一的智能体强化学习中,其进展可能不均衡:部分类别的提升可能与其他类别的性能回退同时出现,而聚合后的整体解析度指标掩盖了这些变化。基于这种“类别跷跷板“现象,我们开发了一个类别感知的专家训练与策略整合框架。通过可执行任务构建和基于证据的多轴标注系统SWE-Labeler来组织训练池。初始的类别专用强化学习在提升平均训练成功率的同时,仍存在实例级进展不均衡的问题,这促使我们明确整合成功行为并实现策略自适应的任务选择。同源类别专家交替进行长期智能体微型强化学习与刷新-修复-扩展循环:更新后的策略刷新实例掌握度,重用自身已验证的成功轨迹进行修复式监督微调,并重新选择任务进行进一步强化学习。标签路由的多教师在策略蒸馏将各专家整合为一个可部署的学生模型,使用ReLU门控奖励外推,仅保留每个教师相对于参考模型的改进方向。专家训练与策略整合无需外部模型提供解决方案轨迹或动作目标。我们通过聚合和逐类别解析度评估了统一强化学习与平衡强化学习、专家开发以及单模型整合的效果,包括每个联合强化学习基线上的最小类别提升和专家增益恢复率。最终的MOPD策略在Pro-618上达到58.04%的平均解析度,在SWE-bench Multilingual上达到59.00%,分别比基础模型提升了5.39和2.78个百分点。
查看 arXiv 页面 (https://arxiv.org/abs/2609.23377) 查看 PDF (https://arxiv.org/pdf/2609.23377) 项目页面 (https://huggingface.co/Logics-MLLM/Logics-SWE-Qwen3.6-27B) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.23377)
在你的智能体中获取这篇论文:
hf papers read 2609.23377
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型1
Logics-MLLM/Logics-SWE-Qwen3.6-27B 强化学习 • 27B • 大约 1 小时前更新 • 30 • 5 (https://huggingface.co/Logics-MLLM/Logics-SWE-Qwen3.6-27B)
引用本文的数据集1
Logics-MLLM/Logics-SWE-Env-2.5K 查看器 • 大约 1 小时前更新 • 2.55k • 1 (https://huggingface.co/datasets/Logics-MLLM/Logics-SWE-Env-2.5K)
引用本文的空间0
没有链接本文的空间
在空间 README.md 中引用 arxiv.org/abs/2609.23377 即可从本页面链接。
包含本文的收藏夹0
没有包含本文的收藏夹
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
AgentBrew: 从强教师到弱LLM代理的终身知识酿造
AgentBrew 提出了一种无需训练的方法,将知识从强教师 LLM 代理蒸馏到弱学生代理,通过失败触发的反思循环和感知学生的合成来创建可执行的笔记,提高了编码、数学和工具使用任务的性能,而无需更新权重。
基于智能体经验的高效样本学习
提出Experience Distillation方法,该方法将在智能体交互历史中通过上下文学习获得的增益内化到模型权重中,无需额外的环境交互,在软件工程和文字冒险任务上实现了显著的样本效率提升。
扩展视野而非参数:以35B智能体达到万亿参数性能
介绍了Agents-A1,一个35B混合专家智能体模型,通过长视野轨迹缩放和三阶段训练方法(包括SFT、领域级教师和多教师蒸馏)实现了万亿参数级别的性能。在长视野智能体基准测试中,该模型表现优于或媲美更大规模的模型。
利用专家代理进行自动研究:开发高效且非平凡的训练配方
本文介绍了一种自动研究框架,利用专家代理通过代码执行与反馈的经验闭环,迭代优化训练配方。该系统借助谱系反馈(lineage feedback),无需人工干预,即可在 Parameter Golf 和 NanoChat 等任务上自主提升性能。
COLLEAGUE.SKILL:通过专家知识蒸馏实现自动化AI技能生成
本文介绍COLLEAGUE.SKILL,一个开源系统,能够从异构轨迹中自动提炼基于人的AI技能,形成可检查、可纠正、可移植的技能包,使LLM代理能够携带有限的人类专业知识和交互风格表征。