@rohanpaul_ai: 这篇论文对长期AI来说是一个残酷的现实检验。给一个智能体一年的相互关联的决策、延迟的反馈…

X AI KOLs Following 论文

摘要

一篇论文评估了八个领先的AI模型在长期任务上的表现,发现即使表现最好的模型也只达到了人类表现的27.3%,突显了可靠长期AI执行的重大局限性。

这篇论文对长期AI来说是一个残酷的现实检验。给一个智能体一年的相互关联的决策、延迟的反馈,以及其自身过去行动的后果,它的表现相对于人类就会崩溃。 研究人员测试了八个领先的模型,包括GPT-5.6 Sol和Claude Opus 4.8。然而,表现最好的设置Qwen3.7-Max与Hermes结合,最终只有人类参与者的27.3%的金钱。 一个在一年期任务中只达到人类表现四分之一的系统,远非可靠的长期AI执行。
查看原文
查看缓存全文

缓存时间: 2026/08/29 15:55

这篇论文对长期AI而言是一记残酷的现实警钟。当赋予智能体长达一年的连续决策任务,包含延迟反馈和自身历史行为带来的后果时,其表现相比人类会急剧下滑。

研究团队测试了八款主流模型,包括GPT-5.6 Sol和Claude Opus 4.8。然而表现最优的配置——Qwen3.7-Max搭配Hermes系统,最终资金仅为普通人类参与者的27.3%。

一个完成全年任务却仅达到人类四分之一水平的系统,远未达到可靠长期执行的标准。

Rohan Paul (@rohanpaul_ai): “长期任务至今仍是笑话。它们根本行不通,我不在乎别人怎么说。别给我看那些愚蠢的评估报告,别告诉我你跑了48小时的无聊脚本。长期任务从未被妥善处理,它们就是无法运作。”

  • Chamath在斯坦福大学

相似文章

@dair_ai:关于长时程智能体的杰出论文(建议收藏)——类似人类,如何让智能体在困难任务中坚持下去?

X AI KOLs Following

AutoLab 是一个新基准测试,针对 36 个由专家精心设计的长时程任务(系统优化、模型开发、CUDA 内核、谜题),对 17 个前沿模型进行评估。研究发现,决定成功的关键因素是持久性——而非初始尝试的质量。Claude-opus-4.6 在所有类别中名列前茅,而大多数其他模型要么过早终止,要么在几乎没有进展的情况下耗尽了预算。

@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…

X AI KOLs Following

本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。