@mohit_r9a: 当我们构建SWE-Interact时,目标是将任何SWE评估任务从点估计(所有信息……

X AI KOLs Timeline 工具

摘要

SWE-Interact已更新,以支持软件工程任务的动态、用户驱动的评估会话,在Harbor中提供原生支持,用于模拟多轮用户-代理交互。

当我们构建SWE-Interact时,目标是将任何SWE评估任务从点估计(所有信息都预先提供给代理)转变为用户驱动的会话,并逐步增加欠规范化的程度。 现在,您可以从Harbor原生运行SWE-Interact风格的动态评估,将任何任务转化为用户<->代理会话。请查看Harbor文档中的示例,并感谢@harborframework团队添加此功能!
查看原文
查看缓存全文

缓存时间: 2026/08/26 05:19

在构建 SWE-Interact 时,我们的目标是将 SWE 评估任务从预先提供所有信息的点估计模式,转变为由用户驱动、需求模糊性逐步递增的交互会话。

现在您可以直接在 Harbor 中运行 SWE-Interact 风格的动态评估,将任何任务转化为用户与智能体的对话会话。请参阅 Harbor 文档中的示例,感谢 @harborframework 团队实现此功能!

Kobe (@kobe0938): Harbor 现已支持模拟用户功能:用户智能体可扮演人类角色,通过多轮对话引导目标智能体完成任务。

相似文章

SWE-INTERACT: 将SWE基准重新构想为用户驱动的长期编码会话

Hugging Face Daily Papers

SWE-Interact是一个新的测试平台,用于评估编码智能体在真实的多轮用户驱动软件工程任务中的表现,揭示了强大的单轮基准性能并不能可靠地迁移到交互式、迭代的工作流程中,在这些流程中,智能体必须发现用户意图并适应不断变化的需求。