@mohit_r9a: 当我们构建SWE-Interact时,目标是将任何SWE评估任务从点估计(所有信息……
摘要
SWE-Interact已更新,以支持软件工程任务的动态、用户驱动的评估会话,在Harbor中提供原生支持,用于模拟多轮用户-代理交互。
查看缓存全文
缓存时间: 2026/08/26 05:19
在构建 SWE-Interact 时,我们的目标是将 SWE 评估任务从预先提供所有信息的点估计模式,转变为由用户驱动、需求模糊性逐步递增的交互会话。
现在您可以直接在 Harbor 中运行 SWE-Interact 风格的动态评估,将任何任务转化为用户与智能体的对话会话。请参阅 Harbor 文档中的示例,感谢 @harborframework 团队实现此功能!
Kobe (@kobe0938): Harbor 现已支持模拟用户功能:用户智能体可扮演人类角色,通过多轮对话引导目标智能体完成任务。
相似文章
SWE-INTERACT: 将SWE基准重新构想为用户驱动的长期编码会话
SWE-Interact是一个新的测试平台,用于评估编码智能体在真实的多轮用户驱动软件工程任务中的表现,揭示了强大的单轮基准性能并不能可靠地迁移到交互式、迭代的工作流程中,在这些流程中,智能体必须发现用户意图并适应不断变化的需求。
SWE-Together: 在交互式用户会话中评估代码代理
SWE-Together 是一个基于真实用户-代理交互创建的多轮代码基准测试,采用反应式LLM模拟器,根据最终正确性和交互效率评估代理。
SWE-chat:来自真实用户场景中的编码代理交互
SWE-chat 发布了包含 6,000 场真实编码代理会话的数据集,显示仅有 44% 的代理生成代码最终进入提交,并揭示当前 AI 辅助开发中的效率与安全缺陷。
Socratic-SWE:基于轨迹派生的智能体技能实现自进化编码智能体
Socratic-SWE 提出了一种用于软件工程智能体的闭环自进化框架,该框架利用历史求解轨迹生成针对性修复任务,经过三次迭代后在 SWE-bench Verified 上达到 50.40%。
迈向自动化Eval Engineering(5分钟阅读)
LangChain发布了Eval Engineering Skill,通过映射智能体仓库和生产跟踪数据自动生成可执行的Harbor评估,并采用迭代式用户访谈流程以优化评估。