DiG-bench:游戏中的发现

arXiv cs.AI 论文

摘要

介绍 DiG-bench,一个包含70个游戏的基准测试,旨在通过主动实验测试 AI 智能体发现隐藏规则和目标的能力,具有七个难度等级。

arXiv:2608.12593v1 公告类型:新 摘要:发现——提出新的概括——是科学过程的核心部分。尽管其重要性,当前 AI 基准测试领域存在空白,很少有基准测试直接探究在目标未知的受控环境中通过实验发现新知识的能力。为了填补这一空白,我们发布了一个新基准:DiG-bench(游戏中的发现)。DiG-bench 包含 70 个独立的游戏。每个游戏编码为短字符串,并具有独特的变换规则,必须通过交互和实验来发现。游戏关卡提供一系列挑战,以测试规则是否已被发现,其中每个关卡的获胜条件也是未知的。我们为 AI 智能体提供七个难度等级的游戏。最低等级通常可被多个模型解决,而最高等级挑战智能体框架中的最佳模型。全部 70 个游戏至少有一位人类首次尝试即成功解决。其中 21 个游戏的子集公开发布,其余部分保密以便安全评估。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:26

# DiG-bench: Discovery in Games

Source: https://arxiv.org/html/2608.12593

###### 摘要

发现——即提出新颖的概括——是科学过程的核心部分。尽管其重要性不言而喻,但当前的 AI 基准测试领域仍存在空白:很少有基准直接在目标未知的受控环境中,通过实验检验发现新知识的能力。为了填补这一空白,我们发布了一个新基准:DiG-bench(Discovery in Games,游戏中的发现)。DiG-bench 由 70 个独立的游戏组成。每个游戏被编码为一个短字符串,并具有必须通过交互和实验才能发现的独特变换规则。游戏的关卡呈现出一系列挑战,用于检验规则是否已被发现,而每个关卡的通关条件同样是未知的。我们为 AI 智能体提供了七个难度级别的游戏。最低级别通常可由多个模型解决,而最高级别则对智能体框架(agentic harnesses)中的最佳模型构成挑战。所有 70 个游戏都至少有一个人首次尝试即成功解决。其中 21 个游戏的子集公开发布,其余部分保密以进行安全评估。

基准测试网站:https://digbench.ai/

图 1:DiG-bench 上的模型表现。每个模型在每个难度级别中赢得的游戏比例。基础框架(basic harness)中的模型在所有七个级别上进行了

相似文章

dig.bench(网站)

TLDR AI

dig.bench 是一个基准,用于评估 AI 模型在文本游戏中发现未知规则的能力,通过 70 个交互式游戏和一个比较前沿模型的排行榜来衡量科学发现能力。

DungeonBench:龙与地下城战斗中规则丰富的战术推理基准

arXiv cs.AI

DungeonBench 是一个用于评估龙与地下城战斗中战术推理的新基准,在单个遭遇战和关联的冒险日中测试 AI 策略在规则丰富的决策任务上的表现。前沿语言模型通常能赢下直接战斗,但在更长周期内的资源预算和休息时机上表现不佳。

安卓会梦想破解游戏吗?用BenchJack系统化审计AI智能体基准测试

arXiv cs.AI

本文介绍BenchJack,一种自动化红队系统,通过识别奖励黑客漏洞来系统化审计AI智能体基准测试。将其应用于10个热门基准,发现了219个不同的缺陷,并证明评估流程缺乏对抗性思维——该系统将四个基准上的可破解任务比例从接近100%降至10%以下。

历经考验:在陌生环境中重新评估智能体的能力

Hugging Face Daily Papers

GauntletBench是一个新的基于网页的基准测试,用于评估AI智能体在挑战性场景中的表现,重点关注时间感知、图形理解和3D推理。结果表明,最先进的智能体成功率仅为19.1%,而非专业人士则超过80%,凸显了当前智能体系统的显著局限性。