@rohanpaul_ai: 这篇论文对长期AI来说是一个残酷的现实检验。给一个智能体一年的相互关联的决策、延迟的反馈…
摘要
一篇论文评估了八个领先的AI模型在长期任务上的表现,发现即使表现最好的模型也只达到了人类表现的27.3%,突显了可靠长期AI执行的重大局限性。
查看缓存全文
缓存时间: 2026/08/29 15:55
这篇论文对长期AI而言是一记残酷的现实警钟。当赋予智能体长达一年的连续决策任务,包含延迟反馈和自身历史行为带来的后果时,其表现相比人类会急剧下滑。
研究团队测试了八款主流模型,包括GPT-5.6 Sol和Claude Opus 4.8。然而表现最优的配置——Qwen3.7-Max搭配Hermes系统,最终资金仅为普通人类参与者的27.3%。
一个完成全年任务却仅达到人类四分之一水平的系统,远未达到可靠长期执行的标准。
Rohan Paul (@rohanpaul_ai): “长期任务至今仍是笑话。它们根本行不通,我不在乎别人怎么说。别给我看那些愚蠢的评估报告,别告诉我你跑了48小时的无聊脚本。长期任务从未被妥善处理,它们就是无法运作。”
- Chamath在斯坦福大学
相似文章
超越最终分数:长期AI研发智能体的系统性评估
本文系统评估了七个前沿AI智能体在长期任务上的表现,发现它们更像是工程优化器而非自主研究者,并提出了改进训练和经验管理的建议。
@rohanpaul_ai:长期代理的可靠性尚未随更好的模型而实现。在WeaveBench的114个混合GUI-CLI任务中,最好的……
本文认为,尽管模型更好,长期AI代理的可靠性仍然不足,如WeaveBench上仅41.2%的通过率所示,并提出了LongHorizon-Harness来管理任务状态以提高性能。
@dair_ai:关于长时程智能体的杰出论文(建议收藏)——类似人类,如何让智能体在困难任务中坚持下去?
AutoLab 是一个新基准测试,针对 36 个由专家精心设计的长时程任务(系统优化、模型开发、CUDA 内核、谜题),对 17 个前沿模型进行评估。研究发现,决定成功的关键因素是持久性——而非初始尝试的质量。Claude-opus-4.6 在所有类别中名列前茅,而大多数其他模型要么过早终止,要么在几乎没有进展的情况下耗尽了预算。
@rohanpaul_ai: 德克萨斯大学论文显示AI智能体在部署后可能逐渐变得不那么可靠,即使模型本身并未变…
德克萨斯大学的一篇论文介绍了AgingBench,这是一个基准测试,揭示了AI智能体在部署后可能因记忆和维护衰减而变得不那么可靠,即使底层模型保持不变。
@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…
本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。