SWE-INTERACT: 将SWE基准重新构想为用户驱动的长期编码会话
摘要
SWE-Interact是一个新的测试平台,用于评估编码智能体在真实的多轮用户驱动软件工程任务中的表现,揭示了强大的单轮基准性能并不能可靠地迁移到交互式、迭代的工作流程中,在这些流程中,智能体必须发现用户意图并适应不断变化的需求。
查看缓存全文
缓存时间: 2026/07/01 19:44
论文页面 - SWE-INTERACT: 将 SWE Benchmarks 重塑为以用户驱动的长时编码会话
来源: https://huggingface.co/papers/2606.30573
摘要
SWE-Interact 提供了一个测试平台,用于评估编码代理在真实的、多轮次、用户驱动的软件工程场景中的表现,揭示出单轮性能与交互式任务完成之间的显著差距。
我们引入了 SWE-Interact,这是一个新的测试平台,用于评估编码代理 (https://huggingface.co/papers?q=coding%20agents) 在多轮次、交互式、用户驱动的软件工程任务上的表现。现有的前沿 SWE 基准通常预先提供完整的需求,并评估代理自主实现的能力。相比之下,SWE-Interact 将代理置于一个真实的开发者工作流程中:一个精心设计的用户模拟器 (https://huggingface.co/papers?q=user%20simulator) 以模糊或不完整的指令开始,逐步揭示需求,检查代理的工作空间,并提供有针对性的反馈、修订和新的约束,直到全部任务目标都被传达完毕。基于对真实编码代理交互的大规模研究 (https://huggingface.co/papers?q=large-scale%20studies),这一设置测试代理是否能够发现用户意图、适应不断变化的需求,并在自己先前工作的基础上继续推进。在一系列前沿及开源模型的测试中,我们发现,在单轮 SWE 任务上的强劲表现并不能可靠地迁移到多轮、用户驱动的工作流程 (https://huggingface.co/papers?q=user-driven%20workflows) 中:表现最好的模型能解决约 50% 的单轮基线任务,但只能解决 25% 的相应 SWE-Interact 任务。在我们评估中最强的模型,包括 Opus 4.8 和 GPT 5.5,即使在面对模糊的初始指令时也表现强劲,能坚持到用户提出所有需求,更好地整合这些需求并编写干净的代码。然而,它们仍然存在过度代理式编码、遗忘需求和技术性错误的问题。较弱的模型在模糊条件下起步不佳,过早放弃,遗忘或忽略指令,并且更多地重写代码。总体而言,SWE-Interact 衡量了前沿模型开发中一个正交的、真实世界的能力轴:在用户参与下的交互式目标发现 (https://huggingface.co/papers?q=goal%20discovery) 和迭代优化 (https://huggingface.co/papers?q=iterative%20refinement)。
查看 arXiv 页面 (https://arxiv.org/abs/2606.30573) 查看 PDF (https://arxiv.org/pdf/2606.30573) GitHub12 (https://github.com/scaleapi/SWE-Interact) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.30573)
引用该论文的模型 0
无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.30573 以便从此页面链接。
引用该论文的数据集 0
无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.30573 以便从此页面链接。
引用该论文的 Spaces 0
无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.30573 以便从此页面链接。
包含该论文的收藏集 0
无收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以便从此页面链接。
相似文章
SWE-Together: 在交互式用户会话中评估代码代理
SWE-Together 是一个基于真实用户-代理交互创建的多轮代码基准测试,采用反应式LLM模拟器,根据最终正确性和交互效率评估代理。
SWE-Touch:当用户修改代码时对编码智能体的基准测试
介绍了SWE-Touch,一个基准测试框架,它在智能体编码轨迹中注入与用户冲突的编辑,结果表明,尽管当前编码智能体在独立基准测试中表现强劲,但在协作场景中性能显著下降。
SWE Context Bench 刚刚证明了一件我想很多编码代理用户已经感受到的事情
新的基准论文《SWE Context Bench》测试编码代理能否跨任务复用知识,凸显了现有基准仅评估孤立问题解决的不足。作者讨论了外部记忆等解决方案,并提到了 langmem、mem0、supermemory 和 Greplica 等工具。
EvoCode-Bench:在多轮迭代交互中评估编码代理
介绍了EvoCode-Bench,这是一个包含26个有状态编码任务、共227轮评估的基准,用于评估多轮迭代交互中的编码代理,结果表明单轮性能高估了多轮能力22-40分。
Senior SWE Bench:一个专注于现实未充分指定功能任务的新基准测试
Senior SWE-Bench 是一个新的开源基准测试,旨在评估 AI 智能体在现实、未充分指定的软件工程任务上的表现,强调意图对齐和代码质量等技能,而非过于详细的规范。