@rohanpaul_ai: 当前代理基准可能在真正失败开始之前就结束了。FM-Bench表明一个模型在5年后看起来很强,但20年后仍可能远远落后……

X AI KOLs Timeline 论文

摘要

FM-Bench是一个用于评估长期AI代理的基准,揭示短期表现并不能保证在模拟20年管理任务中的长期成功。

当前代理基准可能在真正失败开始之前就结束了。 FM-Bench表明,一个模型在5年后可能表现强劲,但20年后仍可能远远落后,因此长期运行的代理需要长期评估。 FM-Bench让15个前沿模型在模拟的20年中管理一个足球俱乐部,涉及大约340到400个决策点,其中转会、合同、现金、投资和对手行动不断改变未来。 排名在早期几乎与最终结果不相似。在种子1上,第5年的排名与最终顺序的相关性仅为0.19,DeepSeek-V4-Pro在第5年和第10年领先,但最终排名第12。 竞争也改变了局面。在共享的竞技场中,10个不同的模型至少赢得了一次联赛冠军,而不是一个早期领先者永远累积优势。 与更强表现相关的是管理行为:在接近结束时削减回报缓慢的投资、保持现金部署以及提前续约。令牌使用量相差约7倍,但仍未决定排名。 因此,对于长期运行的代理,短期任务成功是持续决策质量的弱代理。需要注意的是,单独董事会使用3个种子,而竞技场只有一个共享世界。 – arxiv.org/abs/2608.18423 标题:“FM-Bench:一个用于长期管理的竞争代理基准”
查看原文
查看缓存全文

缓存时间: 2026/09/03 04:05

当前的智能体基准测试可能在真正的问题暴露之前就已结束。

FM-Bench 展示了一个模型在5年后看似表现强劲,20年后仍可能远远落后。因此,长期运行的智能体需要长期评估。

FM-Bench 让15个前沿模型在模拟中管理一家足球俱乐部长达20年,期间涉及约340到400个决策节点,转会、合同、资金、投资以及对手行动不断改变未来走向。

早期的排名与最终结果几乎没有相似性。在种子1的测试中,第5年的排名与最终结果的相关性仅为0.19,DeepSeek-V4-Pro在第5年和第10年都处于领先地位,但最终排名第12位。

竞争也改变了格局。在共享竞技场中,10个不同的模型至少赢得过一次联赛冠军,而不是一个早期领先者持续积累优势。

与更强表现相关的是管理行为:在临近结束时削减回报缓慢的投资、保持资金持续部署、更早地续约。Token使用量相差约7倍,但仍未能决定排名顺序。

因此,对于长期运行的智能体而言,短期任务成功只是持续决策质量的薄弱代理指标。需要注意的是,独立排行榜使用了3个种子,而共享竞技场仅使用1个共享世界。

– arxiv.org/abs/2608.18423

标题:“FM-Bench:一项针对长期竞争智能体管理的基准测试”

相似文章

@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…

X AI KOLs Following

本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。