FM-Bench:一个针对竞争代理长期管理的基准测试
摘要
FM-Bench 是一个新的基准测试,用于评估管理足球俱乐部20年的LLM代理的长期决策能力。研究显示,管理行为比模型规模或token花费更能驱动性能。
查看缓存全文
缓存时间: 2026/08/20 04:04
论文页面 - FM-Bench:用于竞争性智能体长期管理的基准测试
来源:https://huggingface.co/papers/2608.18423
摘要
FM-Bench评估了管理足球俱乐部的LLM智能体在20年时间跨度内的长期决策能力,揭示其表现主要受管理行为驱动,而非模型规模或token消耗量。
语言模型智能体现在能够可靠地执行有限任务。然而,它们是否能在行动具有累积后果、环境会对其选择作出反应的长期跨度内维持有效决策,这一问题在很大程度上尚未得到衡量。FM-Bench(https://huggingface.co/papers?q=FM-Bench)正是为此设计的基准测试(Football Management Benchmark)。一个LLM智能体通过26个工具和约340到400个决策点,在游戏中运行一家足球俱乐部长达20年。它需要在与所有对手相同的预算下组建阵容、交易球员、谈判合同、投资设施和青训、设定阵容,并向可能解雇它的董事会汇报。在此期间,一个确定性引擎(https://huggingface.co/papers?q=deterministic%20engine)会逐年累积数据,最终生成单一评分,无需LLM评判或人工评分。单项赛道将15个前沿模型分别与一个固定的脚本化世界对战;竞技场赛道则让这些模型与一个脚本化锚点(https://huggingface.co/papers?q=scripted%20anchor)共同处于一个共享的20年世界中;据我们所知,这是首次在此规模上进行的直接对决评估。我们衡量了支撑最终评分的六项行为能力。在三个种子设定下,所有15个模型都完成了所有长期任务,而盲目的脚本化基线在大多数情况下中途失败。claude-fable-5在单项赛道平均分和竞技场赛道中均位列榜首,但竞技场的冠军头衔仍在十个模型间轮转。模型规模、价格或供应商都无法预测其排名;排名在长期跨度后期才趋于稳定,而最好的首次参与人类玩家也仅位于模型排行榜底部。区分模型的关键在于管理行为,而非计算能力。高分模型会在临近结束时减少回报周期长的投资,保持资金活跃而非闲置,并远在截止日期前开启续约谈判,而token消耗量则毫无预测力。没有一个模型能从数百次被拒的报价中学会市场的隐含价格,而自管理记忆(https://huggingface.co/papers?q=self-managed%20memory)以两种相反的模式失败:一种是只增不删的归档,另一种是每个赛季都重写的计划。代码在此处提供:https://github.com/Analogy-AI/fm-bench (https://huggingface.co/papers?q=fm-bench)
查看arXiv页面 (https://arxiv.org/abs/2608.18423) 查看PDF (https://arxiv.org/pdf/2608.18423) GitHub10 (https://github.com/Analogy-AI/fm-bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18423)
在你的智能体中获取此论文:
hf papers read 2608\.18423
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2608.18423,即可从此页面链接到该模型。
引用本文的数据集 0
无数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2608.18423,即可从此页面链接到该数据集。
引用本文的Spaces 0
无Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2608.18423,即可从此页面链接到该Space。
包含本文的收藏集 0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到该收藏集。
相似文章
CoffeeBench:异构多智能体经济中长期任务LLM智能体的基准测试
CoffeeBench 是一个用于在长期多智能体经济模拟中评估 LLM 智能体的基准测试,其中企业互动 90 天以最大化利润,揭示了不同模型在通信模式和性能上的差异。
@rohanpaul_ai: 当前代理基准可能在真正失败开始之前就结束了。FM-Bench表明一个模型在5年后看起来很强,但20年后仍可能远远落后……
FM-Bench是一个用于评估长期AI代理的基准,揭示短期表现并不能保证在模拟20年管理任务中的长期成功。
EcoAgent-Bench:评估预算受限的LLM代理中的经济决策
本文介绍了EcoAgent-Bench,一个包含304个任务的基准测试,用于评估LLM代理在明确预算和定价操作下的经济决策,测试五个任务族中的四种与成本相关的决策。
DFAH-Bench:金融决策中可观测智能体不稳定性的基准评测
介绍DFAH-Bench,一个用于衡量金融智能体决策中行为不稳定性的重放基准,发现仅凭结果一致性会遗漏显著的轨迹分歧。
LongMedBench:面向长时程临床决策的医疗智能体基准测试
LongMedBench 是一个新的基准测试,用于评估基于LLM的医疗智能体在长时程临床决策中的表现。它使用来自 MIMIC-IV 的真实电子健康记录数据,包含335名具有多次就诊记录的患者,并提出了针对事实问答、时序推理和长时程决策的评估套件。