@rohanpaul_ai:长期代理的可靠性尚未随更好的模型而实现。在WeaveBench的114个混合GUI-CLI任务中,最好的……

X AI KOLs Timeline 论文

摘要

本文认为,尽管模型更好,长期AI代理的可靠性仍然不足,如WeaveBench上仅41.2%的通过率所示,并提出了LongHorizon-Harness来管理任务状态以提高性能。

长期代理的可靠性尚未随更好的模型而实现。 在WeaveBench的114个混合GUI-CLI任务中,官方报告的最佳通过率为41.2%。 当前模型可以处理局部步骤,但需要明确的审核状态来保持整个任务的轨道。 长期代理可以解决单个步骤,但仍然可能失败,因为历史记录变得不可靠,关于哪些已完成、哪些失败以及哪些剩余。 LongHorizon-Harness将此视为任务状态问题。 本文认为,可靠性的跨度同样依赖于围绕模型的框架和模型本身。
查看原文
查看缓存全文

缓存时间: 2026/08/29 20:09

长期任务的可靠性随着模型改进而尚未实现。

在WeaveBench的114项混合图形界面-命令行任务中,官方报告的最佳通过率仅为41.2%。

当前模型可以处理局部步骤,但需要显式的审核状态来保持完整任务的正确执行。

长期智能体虽然能解决单个步骤,却依然会失败——因为历史记录会变得不可靠,无法准确反映哪些步骤已完成、哪些失败以及哪些尚未处理。

LongHorizon-Harness将此视为任务状态管理问题。

本文认为,在长时间跨度内保持可靠性,不仅取决于模型本身,更依赖于围绕模型的支撑框架。

Rohan Paul (@rohanpaul_ai): “长期任务依然不可靠。它们行不通,我不在乎别人怎么说。别给我看那些愚蠢的评估结果。也别提你运行了48小时的破脚本。长期任务根本没有被妥善处理。它们根本就行不通。”

  • Chamath在斯坦福大学

相似文章

WildClawBench:真实世界长周期智能体评估基准

Hugging Face Daily Papers

WildClawBench 使用真实的命令行界面环境和实际工具,评估语言和视觉-语言模型在现实长周期任务上的表现。该基准测试显示,即使最佳模型也仅达到62.2%的准确率,表明长周期智能体评估仍具有挑战性。