FM-Bench:一个针对竞争代理长期管理的基准测试

Hugging Face Daily Papers 论文

摘要

FM-Bench 是一个新的基准测试,用于评估管理足球俱乐部20年的LLM代理的长期决策能力。研究显示,管理行为比模型规模或token花费更能驱动性能。

语言模型代理现在能够可靠地执行有限任务。但它们是否能在长期范围内维持有效的决策,即行动有累积后果且环境对其选择作出响应,这在很大程度上尚未被测量。FM-Bench(足球管理基准测试)衡量了这一点。一个LLM代理通过26个工具和大约340到400个决策点,在游戏内管理一家足球俱乐部20年。它以与所有竞争对手相同的预算招募阵容,交易球员,谈判合同,投资设施和青训,设定阵容,并向可以解雇它的董事会负责,同时一个确定性引擎将每年积累成一个最终分数,没有LLM裁判或人类评分员。单人轨道让15个前沿模型中的每一个对抗一个固定的脚本世界,而竞技场将相同模型加上一个脚本锚点放在一个共享的20年世界中;据我们所知,这是首次在如此规模上进行的直接评估。我们测量了分数背后的六种行为能力。在三个种子中,所有15个模型都完成了每个周期,而盲脚本基线在大多数周期中失败,claude-fable-5在单人板的平均分和竞技场中名列前茅,但冠军仍在十个模型中轮换。规模、价格或供应商都不能预测排名;排名只在周期后期稳定,而最好的首次人类玩家仅位于模型板的底部。区分模型的是管理行为,而不是计算能力。高分模型在接近结束时减少回报缓慢的投资,保持现金投资而非闲置,并在截止日期前很久开始续约,而token花费无法预测任何东西。没有模型能从数百次被拒绝的投标中学习市场的隐藏价格,自我管理的记忆以两种相反模式失败:一个只增长的存档或每个赛季重写的计划。代码可在 https://github.com/Analogy-AI/fm-bench 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/20 04:04

论文页面 - FM-Bench:用于竞争性智能体长期管理的基准测试

来源:https://huggingface.co/papers/2608.18423

摘要

FM-Bench评估了管理足球俱乐部的LLM智能体在20年时间跨度内的长期决策能力,揭示其表现主要受管理行为驱动,而非模型规模或token消耗量。

语言模型智能体现在能够可靠地执行有限任务。然而,它们是否能在行动具有累积后果、环境会对其选择作出反应的长期跨度内维持有效决策,这一问题在很大程度上尚未得到衡量。FM-Bench(https://huggingface.co/papers?q=FM-Bench)正是为此设计的基准测试(Football Management Benchmark)。一个LLM智能体通过26个工具和约340到400个决策点,在游戏中运行一家足球俱乐部长达20年。它需要在与所有对手相同的预算下组建阵容、交易球员、谈判合同、投资设施和青训、设定阵容,并向可能解雇它的董事会汇报。在此期间,一个确定性引擎(https://huggingface.co/papers?q=deterministic%20engine)会逐年累积数据,最终生成单一评分,无需LLM评判或人工评分。单项赛道将15个前沿模型分别与一个固定的脚本化世界对战;竞技场赛道则让这些模型与一个脚本化锚点(https://huggingface.co/papers?q=scripted%20anchor)共同处于一个共享的20年世界中;据我们所知,这是首次在此规模上进行的直接对决评估。我们衡量了支撑最终评分的六项行为能力。在三个种子设定下,所有15个模型都完成了所有长期任务,而盲目的脚本化基线在大多数情况下中途失败。claude-fable-5在单项赛道平均分和竞技场赛道中均位列榜首,但竞技场的冠军头衔仍在十个模型间轮转。模型规模、价格或供应商都无法预测其排名;排名在长期跨度后期才趋于稳定,而最好的首次参与人类玩家也仅位于模型排行榜底部。区分模型的关键在于管理行为,而非计算能力。高分模型会在临近结束时减少回报周期长的投资,保持资金活跃而非闲置,并远在截止日期前开启续约谈判,而token消耗量则毫无预测力。没有一个模型能从数百次被拒的报价中学会市场的隐含价格,而自管理记忆(https://huggingface.co/papers?q=self-managed%20memory)以两种相反的模式失败:一种是只增不删的归档,另一种是每个赛季都重写的计划。代码在此处提供:https://github.com/Analogy-AI/fm-bench (https://huggingface.co/papers?q=fm-bench)

查看arXiv页面 (https://arxiv.org/abs/2608.18423) 查看PDF (https://arxiv.org/pdf/2608.18423) GitHub10 (https://github.com/Analogy-AI/fm-bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18423)

在你的智能体中获取此论文:

hf papers read 2608\.18423

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型链接此论文

在模型的README.md中引用 arxiv.org/abs/2608.18423,即可从此页面链接到该模型。

引用本文的数据集 0

无数据集链接此论文

在数据集的README.md中引用 arxiv.org/abs/2608.18423,即可从此页面链接到该数据集。

引用本文的Spaces 0

无Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2608.18423,即可从此页面链接到该Space。

包含本文的收藏集 0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到该收藏集。

相似文章

LongMedBench:面向长时程临床决策的医疗智能体基准测试

arXiv cs.AI

LongMedBench 是一个新的基准测试,用于评估基于LLM的医疗智能体在长时程临床决策中的表现。它使用来自 MIMIC-IV 的真实电子健康记录数据,包含335名具有多次就诊记录的患者,并提出了针对事实问答、时序推理和长时程决策的评估套件。