CivBench:文明VI中工具介导智能体的长期基准

arXiv cs.AI 论文

摘要

CivBench是一个开源基准,用于评估在使用文明VI的长期、工具介导环境中语言模型智能体的表现,引入了主动监控率和RAG@10等指标来评估智能体行为。

arXiv:2609.02459v1 公告类型:新 摘要:我们推出CivBench,一个开源基准,用于通过模型上下文协议(MCP)评估在长期、工具介导环境中的语言模型智能体。单个情节跨越300多个回合,在大规模动作空间中产生数千次工具调用,需要在部分可观测性下进行持续规划、状态监控和执行。该环境公开了76个MCP工具和一个叙述层,将视觉游戏状态转换为结构化文本。 我们使用CivBench来描述四个模型家族在23个可接受运行中的智能体行为。该样本是试点性的,而非模型排名:在此规模上,聚合结果无法可靠地区分模型。相反,我们引入了两个环境可测量的接口级指标:主动监控率(PMR),捕捉智能体是否主动查询潜在战略状态;以及RAG@10,捕捉在结构化规划反思中声明的承诺是否在后续十个回合内执行。 在共享剧本协议下,我们观察到两个一致的模式。智能体对可获取但需要显式查询的战略相关状态监控不足:尽管剧本指导每20回合查询胜利进度,但智能体仅每30到75回合查询一次,并且在20次可检测的失败中,有7次在游戏结束前未能在20回合警告窗口内查询。智能体也经常未能执行自己在规划反思中声明的近期承诺(跨模型的RAG@10在48.2%到65.8%之间)。尽管有工具访问和明确指导,这两种模式仍然出现,我们将它们解释为指令下的偏差,而非能力的缺失。 我们在https://github.com/lmwilki/civ6-mcp发布环境、场景、日志、指标和分析流程。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:06

# CivBench:一个基于《文明VI》中介工具智能体的长周期基准测试  
来源:https://arxiv.org/html/2609.02459  

Austin Tudor David Andrews††thanks:共同第一作者;贡献相等。Liam Wilkinson11footnotemark:1  
所属机构:托尼·布莱尔全球变化研究所  
Jamie Heagerty  
所属机构:Google DeepMind  
Harry Coppock  
所属机构:英国人工智能安全研究所  
所属机构:帝国理工学院  
所属机构:唐宁街10号  
Jakob Nicolaus Foerster  
所属机构:牛津大学  
Rui Ponte Costa  
所属机构:牛津大学  

###### 摘要  
我们推出CivBench——一个开源基准测试,用于通过模型上下文协议(MCP)评估语言模型智能体在长周期、工具中介环境中的表现。单次任务涵盖300余轮交互,并在庞大的动作空间中产生数千次工具调用,需要在部分可观测条件下进行持续规划、状态监控与执行。该环境提供76个MCP工具及一个叙述层,可将可视化游戏状态转化为结构化文本。我们使用CivBench在23次有效运行中刻画四个模型家族的智能体行为。该样本属于初步实验而非模型排名:在此规模下,聚合结果无法可靠区分模型。相反,我们引入两个由环境提供的接口层面可测量的指标:主动监控率(PMR),用于捕捉智能体是否主动查询潜在战略状态;以及RAG@10,用于评估结构化规划反思中声明的承诺是否在后续十轮内执行。在共享战术手册协议下,我们观察到两种一致模式:智能体会策略性地欠监控那些可获取但需显式查询的战略相关状态——尽管战术手册指导每20轮查询胜利进度,智能体实际每30-75轮才查询一次,且在20次可检测的失败中,有7次在游戏结束前的20轮预警窗口内未能及时查询。智能体也常无法执行自身规划反思中声明的近期承诺(RAG@10在各模型间介于48.2%至65.8%)。尽管拥有工具访问权限和明确指导,这两种模式依然出现,我们将其解读为指令下的行为偏差而非能力缺失。我们将环境、场景、日志、指标及分析流程发布于 https://github.com/lmwilki/civ6-mcp 。  
提交至 NeurIPS 2026 评估与数据集赛道  

## 1 引言  
前沿模型正日益作为智能体部署:它们调用工具、检测外部状态并在连续决策序列中行动。评估这种行为需要能捕捉持续操作而非孤立问答的环境,包括部分可观测性、大动作空间及效果可能延迟显现的决策。现有评估通常孤立流程中的组件——推理、工具使用或短期规划——但难以揭示这些能力在长周期中如何交互。特别是,它们无法直接衡量智能体是否维持对相关状态的感知或将既定计划转化为后续行动。  
《文明VI》(图15 https://arxiv.org/html/2609.02459#A3.F15)为此类场景提供了合适的测试平台。单局游戏跨越300余轮,需同时管理经济、科学、文化、军事、外交、空间及时间维度。游戏设有六种胜利条件,因此无单一目标主导全局。智能体必须跟踪计划、监控对手并在新信息到来时调整策略。这使《文明VI》成为评估情境化工具中介行为的理想工具,而非静态游戏知识测试。  
我们推出CivBench,一个通过模型上下文协议(MCP)将语言模型智能体与《文明VI》连接的开源基准。CivBench提供覆盖核心游戏系统的76个MCP工具,包括状态查询、单位控制、城市管理、外交与研究。它还配备叙述层,可将可视化游戏状态转化为结构化文本。因此智能体通过工具调用而非像素或定制API进行交互。  
CivBench的核心设计决策是分离信息可得性与信息是否被带入上下文。所有非本地状态必须通过显式查询获取,使我们能区分“不可用信息”与“可用但未检索信息”。这允许从交互轨迹中直接测量注意力分配与计划执行,而非依赖聚合结果。  
我们在23次有效完整游戏运行中评估了四个模型家族。以该样本量,数据不支持稳定的模型排名。我们转而分析轨迹中的行为:智能体如何分配工具调用、是否维持对潜在战略状态的感知、以及既定计划是否伴随行动执行。  

#### 核心贡献:  
1. **1. CivBench基准环境**。我们推出一个基于《文明VI》完整游戏的MCP基准,包含76个工具、固定场景和结构化日志(图1 https://arxiv.org/html/2609.02459#S1.F1)。  
2. **2. 叙述协议**。我们设计了一种结构化接口,将可视化游戏状态转化为智能体可读观察结果,同时保留“智能体仅观测其所查询内容”的约束,实现可控可观测性。  
3. **3. 行为指标**。我们引入主动监控率(PMR),衡量智能体是否主动查询潜在战略状态;以及RAG@K,衡量既定承诺是否在后续窗口期内执行。  
4. **4. 实证刻画**。通过横跨四个模型家族的23次运行,我们证明环境与指标使两种接口层面的模式可测量:对可查询全局状态的监控不足,以及未能执行近期承诺。我们将此视为可在更大规模复现的初步发现,而非模型排名。  

参照图注  
图1:模型上下文协议(MCP)架构。智能体通过MCP工具交互;服务器将调用转化为《文明VI》操作并通过叙述层返回结构化观察结果。(第3节 https://arxiv.org/html/2609.02459#S3)  

## 2 相关工作  
### 2.1 作为AI环境的《文明》  
先前基于《文明》的环境在引擎与接口上各有不同。CivRealm(Qi 等人,2024 https://arxiv.org/html/2609.02459#bib.bib10)使用FreeCiv及Gymnasium风格API,而CivAgent(FuxiAILab,2024 https://arxiv.org/html/2609.02459#bib.bib5)和Vox Deorum(Vox Deorum,2025 https://arxiv.org/html/2609.02459#bib.bib14)则在《文明》的其他实现中研究LLM行为。CivBench在三方面存在差异(表6 https://arxiv.org/html/2609.02459#A3.T6)。首先,它使用MCP而非Gymnasium,匹配生产工具接口。其次,它引入叙述层,将状态可得性与是否被显式查询分离,实现可控可观测性。第三,它针对《文明VI》,其更丰富且文档完备的机制使我们能考察智能体“知道什么”与“做什么”之间的差距(第6.1节 https://arxiv.org/html/2609.02459#S6.SS1)。  

### 2.2 LLM评估  
近期工作评估LLM智能体在范围各异的交互环境中的表现。BALROG(Paglieri 等人,2025 https://arxiv.org/html/2609.02459#bib.bib9)报告了解释策略与执行策略之间的差距,但未使用MCP。CICERO(Meta基础AI研究外交团队(FAIR),2022 https://arxiv.org/html/2609.02459#bib.bib6)在外交游戏中表现优异,而较短周期的游戏基准(Costarelli 等人,2024 https://arxiv.org/html/2609.02459#bib.bib2;Duan 等人,2024 https://arxiv.org/html/2609.02459#bib.bib3)和多智能体框架(Rutherford 等人,2024 https://arxiv.org/html/2609.02459#bib.bib11;Ellis 等人,2023 https://arxiv.org/html/2609.02459#bib.bib4)在更受限的设定下研究相关能力。其他基准孤立智能体行为的特定组件,包括长期管理(Vending-Bench 2(Andon Labs,2025 https://arxiv.org/html/2609.02459#bib.bib1))、工具使用(MCPAgentBench(MCPAgentBench,2025 https://arxiv.org/html/2609.02459#bib.bib8)、ToolBench、API-Bank(Qin 等人,2023 https://arxiv.org/html/2609.02459#bib.bib15;Li 等人,2023 https://arxiv.org/html/2609.02459#bib.bib16))以及软件工程(SWE-bench(Jimenez 等人,2024 https://arxiv.org/html/2609.02459#bib.bib7))。  
CivBench在单一长周期、工具中介的环境中整合了这些要素,采用生产级MCP接口,可通过交互轨迹分析注意力分配与计划执行,而非依赖聚合结果。与主要对任务成功或最终结果评分的先前游戏智能体基准不同,CivBench发布完整工具调用轨迹,并定义针对信息检索与承诺执行的指标。  

## 3 环境  
### 3.1 《文明VI》  
《文明VI》是一款4X策略游戏,玩家需探索、扩张、开发资源并与敌对文明竞争。标准一局游戏跨越300余轮,需在经济、科学、文化、军事、外交、空间及时间维度进行决策(附录A.1 https://arxiv.org/html/2609.02459#A1.SS1)。游戏设有六种胜利条件——科技、文化、征服、宗教、外交及分数——因此无单一目标主导。智能体必须在资源约束下平衡相互竞争的目标。  
《文明VI》也有助于分离游戏知识与执行。虽然策略知识可能出现在训练数据中,但每次运行都呈现具有不完全信息和许多工具中介决策的新状态。因此CivBench通过与实时游戏状态交互而非仅凭记忆策略来评估行为。  

### 3.2 MCP接口  
CivBench通过FireTuner协议经TCP连接至《文明VI》。CivBench服务器提供覆盖核心系统的76个MCP工具,包括状态查询、单位行动、城市管理、外交、研究、治理、宗教、贸易及游戏生命周期操作(表8 https://arxiv.org/html/2609.02459#A4.T8)。典型一回合涉及5-15次工具调用,整局游戏累计数千次。智能体必须决定调用哪些工具、何时调用以及如何处理返回文本。该接口比Gymnasium风格API更接近现实世界的工具使用,后者通常通过固定观察空间中介交互。  

### 3.3 叙述层  
叙述层是CivBench的主要接口贡献。智能体仅观测其显式查询的状态:相关信息是可表征的但不会被被动观测,必须通过工具调用主动检索。此设计分离了信息的可得性与信息是否被带入上下文。因此,CivBench能区分不可用信息与可用但未查询的信息,从而直接分析注意力分配。观察结果以结构化文本而非原始张量或像素返回,其格式与注释支持决策,同时保留“智能体必须决定查询什么”的要求。  
叙述层包含29个函数,涵盖核心游戏系统(表3 https://arxiv.org/html/2609.02459#A1.T3)。关键的是,该接口改善了表征但不强制检索:相关状态(例如胜利进度)除非被显式查询,否则不会产生观察结果。此边界为第6.1节(https://arxiv.org/html/2609.02459#S6.SS1)的感官分析奠定了基础。  
在本次发布中,CivBench主要作为基准工具而非排行榜。基准实例由固定存档/场景、模型配置、共享战术手册、完整MCP转录和衍生指标表组成。发布脚本从原始日志重新计算结果指标、工具使用模式、PMR和RAG@K。这使当前23局游戏数据集成为初步参考集,而主要贡献在于可复用的环境与轨迹级测量协议。  

## 4 评估框架  
### 4.1 实验设计  
我们在单个LLM智能体对抗《文明VI》内置AI对手的条件下进行评估。模型标识符、端点、访问日期和工具版本见附录E(https://arxiv.org/html/2609.02459#A5)及表9(https://arxiv.org/html/2609.02459#A5.T9)。每个场景由固定地图与游戏种子定义。可复现性还取决于游戏版本、DLC配置、场景文件、模型配置和战术手册版本。  

表1:评估场景(难度递增)  
#### 场景设计原理  
Ground Control是基准场景。Snowflake限制在孤立地图上进行军事胜利。Cry Havoc引入严重劣势,未包含在报告结果中。由于Snowflake仅有四次有效运行且Cry Havoc被排除,场景层面结论具描述性。  
#### 智能体战术手册  
所有模型接收相同版本战术手册,规定回合结构、检查点及五字段日记(战术、战略、工具使用、规划、假设)。早期版本使用硬触发条件;报告运行使用较柔和的指导版本。战术手册标准化交互结构,同时将工具选择与优先处理留给智能体。  

### 4.2 指标  
我们报告结果度量与行为度量。归一化分数捕捉竞争地位,而PMR和RAG@K衡量聚合结果中不可见的监控与执行行为。  
#### 归一化分数  
normalized_score = agent_raw_score / winner_raw_score_at_game_end。获胜智能体得分为1.0;其他反映相对地位。我们将其视为描述性指标而非战略能力度量,因分数将多系统聚合为单一结果。  
#### PMR:主动监控率  
PMR = strategic_monitoring_tool_calls / all_non_infrastructure_tool_calls。监控工具需要主动查询(例如get_victory_progress, get_diplomacy),而基础设施工具调用(例如end_turn)被排除。PMR衡量工具预算中用于维持全局视图而非响应本地状态的比例,作为注意力分配的代理。我们不认为PMR高时本质上最优;相关发现是:即使对于推荐明确且缺失与可检测威胁相关的信号,监控仍然不足。  
#### RAG@K:反思-行动差距  
RAG@K = (Y + 0.5P) / total_commitments,其中承诺从规划反思中提取,并在K轮(K=10)内评估。承诺指定目标(例如单位、城市或研究项目),并标记为“已执行”、“部分执行”或“未执行”。RAG@K衡量既定计划在短期内转化为后续行动的程度。我们使用固定周期(K=10)以捕捉近期执行,同时限制因上下文变化产生的歧义。RAG@10应解读为在共享日记协议下具体自述近期承诺的执行保真度,而非规划质量的完整度量。PMR和RAG@K都是接口层面指标,捕捉工具中介交互下的监控与执行行为。  

### 4.3 实际考量  
《文明VI》为商业授权;用户需拥有游戏副本。可复现性取决于固定的游戏版本、配置、种子和战术手册(附录E.1 https://arxiv.org/html/2609.02459#A5)。

相似文章

WildClawBench:真实世界长周期智能体评估基准

Hugging Face Daily Papers

WildClawBench 使用真实的命令行界面环境和实际工具,评估语言和视觉-语言模型在现实长周期任务上的表现。该基准测试显示,即使最佳模型也仅达到62.2%的准确率,表明长周期智能体评估仍具有挑战性。