ForecastBench-Sim:模拟世界预测基准

arXiv cs.AI 论文

摘要

介绍 ForecastBench-Sim,这是一个基于 Freeciv 游戏回放构建的模拟世界预测基准,旨在为评估 AI 系统的概率推理提供可控且可立即解析的任务。

arXiv:2606.18686v1 Announce Type: new 摘要:通用人工智能系统的预测基准通常继承了现实世界的限制:结果解析缓慢,尾部事件罕见,反事实问题难以评分。我们提出了 ForecastBench-Sim,这是一个基于 Freeciv(一款以《文明》系列为模型的回合制策略游戏)游戏回放构建的模拟世界预测基准。预测者接收一份固定的世界报告(当前游戏状态的快照),并回答关于隐藏未来状态的问题;随后,基准继续模拟并对预测进行评分。由于世界是模拟的,同一设置可以生成任意时间范围上的连续或二元预测问题,用于条件或因果问题的配对干预世界,以及罕见或破坏性事件的可解析示例。我们描述了基准流程、问题类别、评分协议和发布产物,并报告了来自模型评估和匿名人工试点的验证切片。ForecastBench-Sim 旨在通过提供可控且可立即解析的任务,以补充现实世界预测基准,用于研究动态世界状态下的概率推理。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:40

# ForecastBench-Sim:一个基于模拟世界的预测基准
来源:https://arxiv.org/html/2606.18686
###### 摘要

通用人工智能系统的预测基准通常受限于现实世界的约束:结果需要很长时间才能揭晓、尾部事件罕见、反事实问题难以评分。我们提出 ForecastBench-Sim,一个基于模拟世界的预测基准,构建在 Freeciv(一款以《文明》系列为模型的回合制策略游戏)的游戏推演之上。预测者接收一份固定的世界报告(当前游戏状态的结构化快照),并回答关于隐藏未来状态的问题;基准随后继续仿真并评分预测结果。由于世界是模拟的,同一设置可以生成任意时间范围的连续或二元预测问题、用于条件或因果问题的配对干预世界,以及罕见或破坏性结果的已解决示例。我们描述了基准流水线、问题族、评分协议和发布产物,并报告了来自模型评估和匿名人类试点的验证切片。ForecastBench-Sim 旨在通过提供受控的、即时可解决的任务来补充现实世界的预测基准,用于研究动态世界状态下的概率推理。

预测、基准、模拟世界、语言模型、概率推理

## 1 引言

预测是评估通用人工智能系统的天然试验场:良好的预测需要提取相关证据、在不确定性下推理,并为未来事件分配校准的概率。现有的预测基准(如 ForecastBench)很有价值,但现实世界的评估存在结构性限制(Karger 等人,2024)。结果可能需要数周或数月才能揭晓,罕见事件很难被观察到,而反事实问题通常无法评分,因为只有一个世界被实现。

仿真提供了一条互补的途径。一个模拟世界可以保留预测的基本结构——部分信息、路径依赖、交互代理和隐藏的未来状态——同时赋予评估者对结果揭晓和干预的控制权。ForecastBench-Sim 使用 Freeciv 推演作为这一基础(The Freeciv Project, 2026),并构建在用于 Freeciv 的 AI 环境的 CivRealm 基础设施之上(Qi 等人,2024)。每个任务由一份世界报告(向预测者展示的游戏状态和历史的结构化呈现)、一组预测问题以及通过继续仿真产生的隐藏未来组成。

ForecastBench-Sim 支持对匹配的世界报告进行二元事件预测和连续分布预测,包含报告理解的理解性检查,并可以通过在推演前改变存档游戏状态来生成配对的干预世界。我们报告了来自现有模型运行和一个小型匿名人类试点的紧凑验证结果。

#### 相关工作。

现实世界的 LLM 预测基准依赖于自然出现的问题,这些问题具有延迟、单次实现的特点(Karger 等人,2024;Williams 等人,2025;Requeima 等人,2024;Halawi 等人,2024),这引入了已充分记录的方法论陷阱(Paleka 等人,2025a)。回测(Pastcasting)试图通过重复使用模型未见过的过去事件来解决这一问题(FutureSearch 等人,2025);ForecastBench-Sim 使用仿真支持的基础,更接近于可控的多智能体环境,如 CivRealm(Qi 等人,2024)。与通过对玩具图进行形式推理来评分的因果推理基准不同(Jin 等人,2023),ForecastBench-Sim 能够在丰富的演化世界上实现匹配的分叉-解决干预问题,补充了语言模型预测中一致性和校准方面的工作(Paleka 等人,2025b;Tian 等人,2023)。

## 2 基准设计

参见标题图 1:ForecastBench-Sim 在受控的模拟世界上评估关于隐藏未来状态的预测。向预测者显示一份固定的报告;未来的回合被保留,直到仿真继续并进行评分。同一机制也支持用于条件或因果问题的配对存档干预。

### 2.1 世界与报告

ForecastBench-Sim 从 Freeciv 游戏推演开始。每个世界包含多个文明,拥有不断发展的城市、科技、领土、国库、外交和冲突。我们暴露一个固定的快照,当前为第 60 回合,并对预测者隐藏后续回合。未来在评分前生成,但在预测时是隐藏的。

预测者观察的是世界报告,而不是直接观察模拟器状态。报告被设计为语言模型和人类参与者的共同输入表面:它们以结构化文本、表格、历史和地图/报告证据的形式总结第 60 回合的状态。这使任务接近普通的预测——预测者看到关于世界的证据,而不是答案本身——同时避免了来自外部网络搜索的检索干扰。

表 1:ForecastBench-Sim 的组成。H0 行是报告阅读检查;H1–H7 行是预测任务。T/W = 模板/世界。
### 2.2 问题族

从每个报告出发,基准生成跨越多个未来时间范围的匹配预测问题。二元问题询问某个事件或关系在后续回合是否成立,连续问题询问某个世界变量的未来值。例如,一个二元问题可能询问某个文明在某个未来回合的国库是否超过一个阈值,而匹配的连续问题则询问国库数值本身。

连续问题引发五个分位数,目前为 p10、p25、p50、p75 和 p90。主要的连续族包括城市数量、科技和国库值;二元模板涵盖更广泛的比较和阈值事件。前瞻性任务使用时间范围 H1–H7,对应于第 60 回合快照之后的 30 回合增量(第 90 到第 270 回合,大致相当于典型游戏的后半部分)。H0 问题询问快照状态本身,作为理解性检查而非预测任务。

### 2.3 评分

二元预测使用 Brier 分数(Brier, 1950)评分;连续预测使用从引发的分位数计算的 CRPS(Gneiting and Raftery, 2007)评分。我们将 CRPS 按每个族固定值范围归一化(城市:40,科技:60,国库:2000),以便三个连续模板可以在不改变每题评分规则的情况下进行平均。这些范围与人类试点中使用的箱边界相匹配(附录 C),使模型和人类分数在同一尺度上。H0 检查单独报告,因为它们测试的是报告阅读而非预测。

## 3 受控评估的便利条件

该基准支持三种预测机制,通过如何建立条件事件来区分。无条件预测从固定报告出发预测P(Y);观测条件预测从模拟世界语料库中的自然变化预测P(Y|X);干预预测预测P(Y|do(X)),其中X通过在推演前改变存档状态来设定。每种机制使用相同的适当评分规则。第三种机制是现实世界预测基准通常无法解决的问题,因为只有一个历史被实现;模拟器通过在每个分支产生单独的真实值将其转化为一个可评分的问题。

无条件基准最接近现有的现实世界预测基准。预测者接收一份报告并预测后来会发生什么,而不被告知进行了任何特殊干预。这种设置支持由 Brier 分数评分的二元问题和由 CRPS 评分的连续问题,产生一个 ForecastBench 风格的评估表面,具有自动揭晓和固定提示。

干预机制是现实世界基准通常无法评分的:基准在预测回合复制一个存档,应用一个干预,展开修改后的世界,并根据干预世界的结果对预测进行评分。现有的试点使用两种干预:将一个文明的政府切换到共和国,并向其国库添加 500 金币,并在基线和条件设定下重用相同的目标模板。在存档的九模型切片中,每个精选模型在两个试点上的平均干预增益都是正的(共和国:+0.029 到 +0.057;+500 金币:+0.013 到 +0.062;图 10)。一个 Opus 4.5 的安慰剂控制在空条件措辞下几乎不改变 Brier(0.165 vs. 0.169 基线),而真实的共和国条件上升到 0.360(图 11),表明响应不能仅由条件措辞解释。

观测机制则可以通过对模拟世界语料库进行采样并测量事件共现的频率来填充。该切片尚未包含在已发布的产物中,但它与干预机制保持清晰分离,因为数据来源是一个语料库而非分叉的推演。

最后,模拟世界使尾部风险评估变得实用,因为可以密集采样大的冲击,而不是等待它们发生。作为一个例子,一个配套的匿名分析使用相同的问题族发现,国库结果低于模型声称的 p10 的比例在 H6–H7 时上升到大约 50%(图 12;Anonymous, 2026)。

## 4 验证结果

我们使用现有的模型运行来检查基准是否表现为一个预测评估,而不是一个报告解析练习。主要的无条件运行包含来自 30 个模型的 4,655 个二元问题和来自 31 个模型的 2,310 个连续问题。图 2 中的紧凑排行榜显示了精选子集,涵盖了本文所用产物中的全部模型,同时保留了更大运行中的排名背景。在九个精选模型中,H1–H7 二元问题的平均 Brier 范围从 0.220(GPT-5.1)到 0.313(Gemini 2.5 Flash),H1–H7 连续问题的平均归一化 CRPS 范围从 0.283(o3)到 0.590(Gemini 2.5 Pro),Brier 的跨度大约为 40%,CRPS 的跨度大约为两倍。在 H1–H7 上平均,ForecastBench-Sim 二元 Brier 与 ForecastBench 数据集 Brier 的 Spearman 相关系数ρ=+0.43(p=0.018, N=30 个重叠模型),与 Epoch Capabilities Index(Ho 等人, 2025)的相关系数ρ=0.48(p=0.007),表明 ForecastBench-Sim 的排名既与一个已发表的现实世界预测基准一致,也与一个通用能力指数一致。每时间范围的相关系数和底层模型列表见附录 D。

参见标题图 2:九个精选模型的紧凑验证切片,模型、H0、人类基线和干预产物均完全覆盖。柱状图显示平均前瞻性能;排名标记给出每个模型在更大二元或连续运行中的位置。二元分数和连续分数产生不同的模型性能序数排名;这是当代工作的主题(Anonymous, 2026)。

该基准还显示出有意义的截止时间结构(图 3)。在精选集上平均,平均 Brier 从 H1 的 0.205 上升到 H7 的 0.264(在 H5 达到 0.287 的峰值),平均归一化 CRPS 从 H1 的 0.134 单调上升到 H7 的 0.639——随着预测范围从快照后 30 回合扩大到 210 回合,增加了 4.8 倍。这表明模拟任务包含可预测的信号和依赖时间范围的不确定性。我们不打算让这篇研讨会论文成为最终的模型排名论文。

H0 检查提供了对输入格式的独立检查。所有九个精选模型的 H0 二元 Brier 低于 0.032,H0 连续归一化 CRPS 低于 0.024(大多数得分为 0.000;见表 2),表明前瞻性错误并非主要由无法阅读第 60 回合报告引起。详细的 H0 结果见附录 B。

最后,匿名人类试点表明相同的问题族可以呈现给人类。十名参与者回答了两个世界上 24 个连续问题,涵盖了 H1、H3、H4 和 H6 的城市、科技和国库模板。在这个小试点中,群体平均归一化 CRPS 接近均匀箱基线,因此我们将其视为对更大人类基线的简单可行性检查,而不是一个明确的模型比较;详情见附录 C。

参见标题图 3:ForecastBench-Sim 捕捉了依赖时间范围的难度:关于更远期未来的问题比关于近期未来的问题更难。(分数按精选模型集的截止时间平均。)

## 5 未来工作

ForecastBench-Sim 目前使用 Freeciv,因为它提供了一个可检查的多智能体世界,具有保存状态和重放基础设施,但更广泛的目标是构建一个仿真支持的切片族,这些切片可以插入相同的评估接口,与 ForecastBench 等基准中的数据集和市场问题并列。Freeciv 由于其复杂性和广泛的机制(以及可预测的量),很可能是模拟世界中评估通用预测能力的最佳单一选择。然而,它当然可以被更专门的仿真所补充——不同的底层基础会暴露不同的预测技能。例如,一个基于生成式智能体社会模拟器(如 Concordia, Vezhnevets 等人, 2023)的问题集可能会探测模型是否能在社会压力下预测其他智能体的行为。流行病学基于智能体的模型会产生密集的尾部风险材料——疫情激增和干预反事实——而无需等待真实疫情爆发。

第二个扩展可以改变预测的评分方式。与其根据单个 0/1 结果来揭晓一个概率,同一个起始世界可以在不同的 RNG 种子下展开 N 次,并根据多次展开中的经验事件频率来揭晓预测。这将把揭晓从一个单一噪声实现转换为接近模拟器真实生成概率的目标——这只有在世界是模拟的情况下才可能实现。

在同一机制下,一些其他方向也很自然:顺序预测,其中报告在多个快照时揭示,模型必须在证据积累时更新;以及反事实一致性检查,其中同一目标在多个条件下被查询。

相似文章

FlightSimulatorBench: 小型MoE版本

Reddit r/LocalLLaMA

介绍FlightSimulatorBench,这是一个小型混合专家(MoE)版本基准测试,用于在飞行模拟任务中评估AI模型。

BehaviorBench:面向行为科学任务的基础模型基准测试

arXiv cs.CL

本文介绍了BehaviorBench,一个用于评估基础模型在行为科学任务(包括行为预测、战略决策、主体特征推断和行为知识应用)上表现的综合基准。它还介绍了Be.FM-1.5,一个经过微调的模型,实现了出色的分布对齐,突显了通用模型与行为适应模型之间的差距。