Socratic-SWE:基于轨迹派生的智能体技能实现自进化编码智能体
摘要
Socratic-SWE 提出了一种用于软件工程智能体的闭环自进化框架,该框架利用历史求解轨迹生成针对性修复任务,经过三次迭代后在 SWE-bench Verified 上达到 50.40%。
查看缓存全文
缓存时间: 2026/06/08 03:30
论文页面 - Socratic-SWE: 通过迹导代理技能实现自进化编码代理
来源:https://huggingface.co/papers/2606.07412
摘要
Socratic-SWE 利用历史求解迹来生成有针对性的修复任务,通过迭代改进提升代理性能,从而实现自进化的软件工程代理。
LLM 驱动的软件工程代理(https://huggingface.co/papers?q=LLM-driven%20software%20engineering%20agents)已成为现实世界语言模型能力的核心测试平台,但其训练仍受限于高质量 SWE 任务的可用性。现有的合成数据方法(https://huggingface.co/papers?q=synthetic%20data%20methods)通常通过固定突变(https://huggingface.co/papers?q=fixed%20mutation)或漏洞注入过程(https://huggingface.co/papers?q=bug-injection%20procedures)来创建任务,导致生成的任务分布很大程度上独立于代理自身的弱点与训练进度。我们提出 Socratic-SWE,一个闭环自进化框架(https://huggingface.co/papers?q=closed-loop%20self-evolution%20framework),该框架重用代理的历史求解迹(https://huggingface.co/papers?q=historical%20solving%20traces)作为训练信号的来源。Socratic-SWE 并非仅将迹视为奖励计算的证据,而是将其提炼为结构化的代理技能(https://huggingface.co/papers?q=structured%20agent%20skills),这些技能总结了反复出现的失败模式与有效的修复模式(https://huggingface.co/papers?q=repair%20patterns)。随后,这些技能指导在真实仓库中生成有针对性的修复任务。候选任务通过基于执行的验证(https://huggingface.co/papers?q=execution-based%20validation)进行检查,并使用求解器梯度对齐奖励(https://huggingface.co/papers?q=solver-gradient%20alignment%20reward)进行评分,从而保留的任务既可验证又有助于改进求解器。更新后的求解器产生新的迹,使得任务课程(https://huggingface.co/papers?q=task%20curriculum)能够在连续轮次中自适应。在 SWE-bench Verified(https://huggingface.co/papers?q=SWE-bench%20Verified)、SWE-bench Lite(https://huggingface.co/papers?q=SWE-bench%20Lite)、SWE-bench Pro(https://huggingface.co/papers?q=SWE-bench%20Pro)以及 Terminal-Bench 2.0(https://huggingface.co/papers?q=Terminal-Bench%202.0)上,Socratic-SWE 在相同计算预算下相较于自进化基线(https://huggingface.co/papers?q=self-evolving%20baselines)持续提升,经过三轮迭代后在 SWE-bench Verified(https://huggingface.co/papers?q=SWE-bench%20Verified)上达到 50.40%。这些结果表明,求解迹可以作为自进化 SWE 代理的可扩展基础。
查看 arXiv 页面(https://arxiv.org/abs/2606.07412)查看 PDF(https://arxiv.org/pdf/2606.07412)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.07412)
引用此论文的模型 0
尚无模型引用此论文
在模型 README.md 中引用 arxiv.org/abs/2606.07412 以从此页面链接。
引用此论文的数据集 0
尚无数据集引用此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.07412 以从此页面链接。
引用此论文的 Spaces 0
尚无 Space 引用此论文
在 Space README.md 中引用 arxiv.org/abs/2606.07412 以从此页面链接。
包含此论文的收藏集 0
尚无收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
SWE-Together: 在交互式用户会话中评估代码代理
SWE-Together 是一个基于真实用户-代理交互创建的多轮代码基准测试,采用反应式LLM模拟器,根据最终正确性和交互效率评估代理。
自演化编码智能体
本文综述了自演化编码智能体,这类智能体通过从先前的编码交互中更新框架、记忆、技能、工具或模型来改进其未来行为,并提出了一个分类体系,涵盖演化什么、何时演化以及由哪些软件特定证据驱动。
SWE-bench Science:编码代理能否解决科学工程任务?
SWE-bench Science 引入了一个仓库级基准,用于评估编码代理在科学软件修复任务中的表现,揭示了失败机制和科学指导的混合效应。
通过代理引导的求解与复现实现技能自进化
本文介绍了reSolve,一个用于智能体技能自进化的代理引导求解与复现框架,其性能达到74.9%,超越人工精心设计的基线14.8个百分点。
SWE-chat:来自真实用户场景中的编码代理交互
SWE-chat 发布了包含 6,000 场真实编码代理会话的数据集,显示仅有 44% 的代理生成代码最终进入提交,并揭示当前 AI 辅助开发中的效率与安全缺陷。