@rohanpaul_ai: 当前代理基准可能在真正失败开始之前就结束了。FM-Bench表明一个模型在5年后看起来很强,但20年后仍可能远远落后……
摘要
FM-Bench是一个用于评估长期AI代理的基准,揭示短期表现并不能保证在模拟20年管理任务中的长期成功。
查看缓存全文
缓存时间: 2026/09/03 04:05
当前的智能体基准测试可能在真正的问题暴露之前就已结束。
FM-Bench 展示了一个模型在5年后看似表现强劲,20年后仍可能远远落后。因此,长期运行的智能体需要长期评估。
FM-Bench 让15个前沿模型在模拟中管理一家足球俱乐部长达20年,期间涉及约340到400个决策节点,转会、合同、资金、投资以及对手行动不断改变未来走向。
早期的排名与最终结果几乎没有相似性。在种子1的测试中,第5年的排名与最终结果的相关性仅为0.19,DeepSeek-V4-Pro在第5年和第10年都处于领先地位,但最终排名第12位。
竞争也改变了格局。在共享竞技场中,10个不同的模型至少赢得过一次联赛冠军,而不是一个早期领先者持续积累优势。
与更强表现相关的是管理行为:在临近结束时削减回报缓慢的投资、保持资金持续部署、更早地续约。Token使用量相差约7倍,但仍未能决定排名顺序。
因此,对于长期运行的智能体而言,短期任务成功只是持续决策质量的薄弱代理指标。需要注意的是,独立排行榜使用了3个种子,而共享竞技场仅使用1个共享世界。
– arxiv.org/abs/2608.18423
标题:“FM-Bench:一项针对长期竞争智能体管理的基准测试”
相似文章
@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…
本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。
@rohanpaul_ai: 大多数代理基准测试在完成一项任务后就结束了,但经营商店并非如此,这也是这些代理开始失效的地方。MerchantBench…
MerchantBench 是一个基准测试,它通过让人工智能代理管理一个模拟在线商店一年来评估这些代理,揭示了在持续性能和连续行动方面的挑战。
@rohanpaul_ai: 这篇论文对长期AI来说是一个残酷的现实检验。给一个智能体一年的相互关联的决策、延迟的反馈…
一篇论文评估了八个领先的AI模型在长期任务上的表现,发现即使表现最好的模型也只达到了人类表现的27.3%,突显了可靠长期AI执行的重大局限性。
@rohanpaul_ai: 德克萨斯大学论文显示AI智能体在部署后可能逐渐变得不那么可靠,即使模型本身并未变…
德克萨斯大学的一篇论文介绍了AgingBench,这是一个基准测试,揭示了AI智能体在部署后可能因记忆和维护衰减而变得不那么可靠,即使底层模型保持不变。
FM-Bench:一个针对竞争代理长期管理的基准测试
FM-Bench 是一个新的基准测试,用于评估管理足球俱乐部20年的LLM代理的长期决策能力。研究显示,管理行为比模型规模或token花费更能驱动性能。