DungeonBench:龙与地下城战斗中规则丰富的战术推理基准
摘要
DungeonBench 是一个用于评估龙与地下城战斗中战术推理的新基准,在单个遭遇战和关联的冒险日中测试 AI 策略在规则丰富的决策任务上的表现。前沿语言模型通常能赢下直接战斗,但在更长周期内的资源预算和休息时机上表现不佳。
arXiv:2607.29577v1 公告类型:新论文
摘要:游戏和模拟器通过将决策转化为可测量的结果而成为有价值的基准,但许多现有套件对规则丰富的战术推理测试不足——即当地形、时机、资源、目标和规则交互同时起作用时,做出良好选择的能力。我们引入了 DungeonBench,这是一个用于龙与地下城战斗中战术推理的基准,旨在覆盖 2014 年系统参考文档中绝大多数与战斗相关且效果可由模拟器解析的内容,同时保留简化战斗模拟器通常抽象掉的机制。在每一步,DungeonBench 都提供一个完整的战术观察、一个待处理的决策,以及一个涵盖移动、攻击、法术、反应、目标、准备和稀缺资源的可执行选项索引列表。任务是评估合法选择的价值,这些选择的后果取决于行动经济、生物特性、战场地形、时机窗口和未来遭遇。DungeonBench 包含两个轨道:Encounter(遭遇战),评估单场战斗中的局部战术表现;Day(冒险日),通过持续生命值、法术位、消耗品、准备和短休息时机将遭遇战串联起来,迫使策略在短期战术优势与未来生存能力之间进行权衡。同一引擎生成的决策流支持启发式控制器、语言模型策略、学习型选项排序器以及掩码动作强化学习智能体。我们在此共享决策流上评估了前沿语言模型策略。结果表明,完整的战术观察并未使基准饱和:前沿策略通常能赢下直接遭遇战,但在关联的冒险日中暴露出资源预算、休息时机和规则感知战术纪律方面的失败。
查看缓存全文
缓存时间: 2026/08/03 07:33
# DungeonBench:一个用于龙与地下城战斗中规则密集型战术推理的基准测试 来源:https://arxiv.org/html/2607.29577 ###### 摘要 游戏和模拟器通过将决策转化为可衡量的结果来提供有价值的基准测试,但许多现有测试套件未能充分测试规则密集型的战术推理能力:即在几何、时机、资源、目标和规则交互同时发挥作用时做出良好选择的能力。我们引入了*DungeonBench*,这是一个用于龙与地下城(D&D)战斗的战术推理基准测试,旨在覆盖2014年系统参考文档(System Reference Document)中绝大多数与战斗相关、且其效果可由模拟器解析的内容,同时保留简化战斗模拟器通常会抽象掉的机制。在每一步中,DungeonBench都会呈现一个完整的战术观察状态、一个待定决策,以及一个索引化的可执行选项列表,涵盖移动、攻击、法术、反应、目标、准备和稀缺资源。任务是评估合法选择的的价值,而这些选择的后果取决于行动经济性、生物特性、战场几何、时间窗口以及未来的遭遇战。DungeonBench有两条赛道:*Encounter*(遭遇战),评估单场战斗中的局部战术发挥;以及*Day*(冒险日),通过持续的生命值、法术位、消耗品、准备和短休息时机将多场遭遇战串联起来,迫使策略在即时战术优势与未来生存能力之间进行权衡。同一个由引擎生成的决策流支持启发式控制器、语言模型策略、学习型选项排序器以及掩码动作强化学习智能体。我们在此共享决策流上评估了前沿语言模型策略。结果表明,完整的战术观察并不会使基准测试饱和:前沿策略通常能赢得直接遭遇战,但串联的遭遇日暴露了在资源预算、休息时机和规则感知战术纪律方面的失败。 ## 1 引言 参见图1:DungeonBench概览。引擎将战术状态映射为合法可执行选项;策略在同一决策流上进行选择,模拟器对Encounter和Day的结果进行评分。 游戏为人工智能提供了稳健的测试平台:明确的规则、可衡量的结果和可重复的交互循环,能够毫不含糊地说明智能体做了什么以及其决策产生了什么。因此,游戏已推动连续控制、棋类游戏、多智能体体育、程序化导航和开放世界等领域取得进展 (Brockmanet al.,2016 (https://arxiv.org/html/2607.29577#bib.bib2); Cobbeet al.,2020 (https://arxiv.org/html/2607.29577#bib.bib5); Lanctotet al.,2019 (https://arxiv.org/html/2607.29577#bib.bib4); Xuet al.,2025 (https://arxiv.org/html/2607.29577#bib.bib1))。然而,有一种推理仍然代表性不足:在合法动作异构且其价值由规则交互、时间窗口、目标和稀缺资源决定的领域中的战术判断。在战术领域中,一个决策可能是关于站在哪里,另一个是关于攻击哪个敌人,还有一个是关于是否消耗稀缺的法术位、触发反应、保护专注、利用地形,或是为后续战斗保留资源。这些选择涉及不同的动作类型,并通
相似文章
RTSGameBench:一个用于视觉语言模型战略推理的实时策略基准测试
RTSGameBench是一个基于实时策略游戏《Beyond All Reason》的基准测试,用于评估视觉语言模型中的战略推理能力。它提供了多样化的对战组合、诊断性小游戏以及一个能够生成新场景的自我演化框架。
dig.bench(网站)
dig.bench 是一个基准,用于评估 AI 模型在文本游戏中发现未知规则的能力,通过 70 个交互式游戏和一个比较前沿模型的排行榜来衡量科学发现能力。
DiG-bench:游戏中的发现
介绍 DiG-bench,一个包含70个游戏的基准测试,旨在通过主动实验测试 AI 智能体发现隐藏规则和目标的能力,具有七个难度等级。
CivBench:文明VI中工具介导智能体的长期基准
CivBench是一个开源基准,用于评估在使用文明VI的长期、工具介导环境中语言模型智能体的表现,引入了主动监控率和RAG@10等指标来评估智能体行为。
DI-Bench:系统化生成企业智能体领域数据智能基准
DI-Bench 是一个管道,用于系统化生成企业数据智能任务的基准,结合知识检索和分析计算。它评估模型,并发现在业务规则修改计算的任务中,模型仅能达到32%的准确率。