@rohanpaul_ai:长期代理的可靠性尚未随更好的模型而实现。在WeaveBench的114个混合GUI-CLI任务中,最好的……
摘要
本文认为,尽管模型更好,长期AI代理的可靠性仍然不足,如WeaveBench上仅41.2%的通过率所示,并提出了LongHorizon-Harness来管理任务状态以提高性能。
查看缓存全文
缓存时间: 2026/08/29 20:09
长期任务的可靠性随着模型改进而尚未实现。
在WeaveBench的114项混合图形界面-命令行任务中,官方报告的最佳通过率仅为41.2%。
当前模型可以处理局部步骤,但需要显式的审核状态来保持完整任务的正确执行。
长期智能体虽然能解决单个步骤,却依然会失败——因为历史记录会变得不可靠,无法准确反映哪些步骤已完成、哪些失败以及哪些尚未处理。
LongHorizon-Harness将此视为任务状态管理问题。
本文认为,在长时间跨度内保持可靠性,不仅取决于模型本身,更依赖于围绕模型的支撑框架。
Rohan Paul (@rohanpaul_ai): “长期任务依然不可靠。它们行不通,我不在乎别人怎么说。别给我看那些愚蠢的评估结果。也别提你运行了48小时的破脚本。长期任务根本没有被妥善处理。它们根本就行不通。”
- Chamath在斯坦福大学
相似文章
@rohanpaul_ai: 这篇论文对长期AI来说是一个残酷的现实检验。给一个智能体一年的相互关联的决策、延迟的反馈…
一篇论文评估了八个领先的AI模型在长期任务上的表现,发现即使表现最好的模型也只达到了人类表现的27.3%,突显了可靠长期AI执行的重大局限性。
LongHorizon-Harness:推进面向真实世界任务的长时程智能体
介绍了LongHorizon-Harness,一种面向长时程LLM智能体的任务状态管理方法,采用Manage-Execute-Audit循环,在WeaveBench和OSWorld等多个模型和基准上展示了一致的改进。
WeaveBench:混合界面计算机使用代理的长时域真实世界基准测试
WeaveBench是一个用于在长时域真实世界任务中跨多种界面(GUI、CLI、代码)评估计算机使用代理的新基准测试。它揭示了当前模型仅达到41.2%的通过率,且仅基于结果的评分高估了性能,凸显了评估中的重大差距。
Long-Horizon-Terminal-Bench:通过密集奖励评分测试智能体在长时程终端任务上的极限
介绍了 Long-Horizon-Terminal-Bench,这是一个包含46个长时程终端任务的基准,采用密集奖励评分,评估AI智能体在规划、长上下文和调试方面的能力。即使是最强模型也仅达到15.2%的pass@1,显示仍有很大的改进空间。
WildClawBench:真实世界长周期智能体评估基准
WildClawBench 使用真实的命令行界面环境和实际工具,评估语言和视觉-语言模型在现实长周期任务上的表现。该基准测试显示,即使最佳模型也仅达到62.2%的准确率,表明长周期智能体评估仍具有挑战性。