dig.bench(网站)
摘要
dig.bench 是一个基准,用于评估 AI 模型在文本游戏中发现未知规则的能力,通过 70 个交互式游戏和一个比较前沿模型的排行榜来衡量科学发现能力。
dig.bench 是一个基准,衡量代理能否通过实验发现游戏的未知规则。它包含 70 个文本游戏,其中 21 个已经公开发布。进度根据游戏是否能在有限步骤内被攻克来评分。人类能够发现解决即使是最难游戏所需的必要发现,而最好的模型在攻克顶级游戏中仍显吃力。
查看缓存全文
缓存时间: 2026/08/18 15:34
# dig.bench
来源:https://digbench.ai/
dig\.bench
## 发现文字游戏中的未知规则
70 个互动游戏 · 21 个公开
## 排行榜
基础测试框架
Opus 5GPT\-5\.5Kimi K3Gemini 3\.1 ProGLM\-5\.2DeepSeek V4 FlashDeepSeek V4 ProQwen 3\.6 27B
代理式测试框架
Opus 5 \+ Prime AgentFable 5 \+ Claude CodeGPT\-5\.6 Sol \+ CodexKimi K3 \+ Kimi CodeGemini 3\.1 Pro \+ PRO\-LONG
难度分级
所有游戏均可被人类首次尝试通过,已由外部人类测试员验证。胜率:每个游戏的胜利次数在各次运行中取平均值,再对该级别的十个游戏取平均。
## 关于
dig\.bench 是一个科学发现基准测试。
其 70 个游戏中的每一个都衡量智能体是否能通过实验发现该游戏本身的未知规则。所有游戏均为文本形式,这使其处于语言模型的自然领域:模型与发现之间不存在视觉干扰,因此 dig\.bench 测试的是纯粹的发现能力。人类和前沿模型在相同信息下玩相同游戏,评分标准是游戏能否在有限步数内被攻克。
游戏根据难度分为 7 个等级。没有简单游戏,所有游戏都需要付出努力才能游玩,但人类能够发现解决最困难游戏所需的规则,而最佳模型却难以攻克顶级游戏。
规模 70 个新互动游戏(21 个已公开)。我们测试模型的哪些能力 为了击败每个游戏,智能体必须发现未知规则并应用它们来解决挑战。评估 人类和前沿模型通过相同界面游玩:相同的游戏状态、相同的动作集、相同的步数预算。
dig.bench 游戏示意图。一个持有互动环境的游戏服务器通过 API 提供游戏界面,并通过模型测试框架(基础框架提供下一个动作、游戏状态、推理和滚动上下文,或代理框架增加带有文件系统的上下文管理和工具)以 API 或 MCP 方式提供模型。双方看到相同的游戏,以 JSON 形式显示在游戏表示中:观察结果、关卡、生命值、剩余步数、状态和合法动作。界面显示合法动作、创意模式开关、当前观察结果、生命值、关卡和剩余步数,以及逐步历史记录。平台及等效的人类与模型界面。1 标记可用动作;2 创意模式,某些游戏中的选项,允许玩家进入另一个关卡,可以在不影响步数的情况下进行实验;3 当前游戏状态;4 游戏统计;5 动作和状态历史。
## 试玩
70 个游戏中的 21 个已公开。等级对模型而言难度递增(1 = 最易,7 = 最难)。
## 复现
通过 SDK 或 API 运行任何模型对抗这些游戏。
## 加入我们
加入我们的社区 DisCo (https://discoforever.org/),您可以追踪在这些谜题上的进展并与志同道合的人交流。
## 引用
DiG\-bench:游戏中的发现
Ruairidh M\. Battleday,Kai Sandbrink,Jimi Cullen\-Drohan,Zihan Yan,Timothy Muller,Clare Maguire,Ales Kubicek,Fraser Greenlee\-Scott,Sukrit Sumant,Tri Dao,Jürgen Schmidhuber,Michal Valko,Joshua Tenenbaum,Thomas L\. Griffiths,Zeb Kurth\-Nelson,James C\.R\. Whittington
```
@misc{battleday2026dig,
title={DiG-bench: Discovery in Games},
author={Ruairidh M. Battleday and Kai Sandbrink and Jimi Cullen-Drohan and Zihan Yan and Timothy Muller and Clare Maguire and Ales Kubicek and Fraser Greenlee-Scott and Sukrit Sumant and Tri Dao and Jürgen Schmidhuber and Michal Valko and Joshua Tenenbaum and Thomas L. Griffiths and Zeb Kurth-Nelson and James C.R. Whittington},
year={2026},
eprint={2608.12593},
archivePrefix={arXiv},
primaryClass={cs.AI},
url={https://arxiv.org/abs/2608.12593},
}
```
相似文章
DiG-bench:游戏中的发现
介绍 DiG-bench,一个包含70个游戏的基准测试,旨在通过主动实验测试 AI 智能体发现隐藏规则和目标的能力,具有七个难度等级。
ASI-Bench:在人工超级智能的黎明
ASI-Bench 是一个新的基准测试,旨在评估 AI 系统在 11 个科学领域中创新探索和自主科学执行的能力,揭示了当前 AI 对人类指导的严重依赖。
DungeonBench:龙与地下城战斗中规则丰富的战术推理基准
DungeonBench 是一个用于评估龙与地下城战斗中战术推理的新基准,在单个遭遇战和关联的冒险日中测试 AI 策略在规则丰富的决策任务上的表现。前沿语言模型通常能赢下直接战斗,但在更长周期内的资源预算和休息时机上表现不佳。
通过基准构建教授AI:QuestBench作为负责任知识工作的课程实践
本文介绍了QuestBench,这是一个由学生构建的基准,用于评估人文和社会科学领域的深度研究系统。结果显示,即使是像GPT-5.5这样的先进系统也只能通过57.58%的问题,突显了可信度方面的失败。
CursorBench 3.1
CursorBench 3.1 引入了专注于代码库理解、缺陷查找、规划和代码审查的新基准任务,并展示了各种AI模型的更新得分和成本比较。