MirrorCraft:在Minecraft隐藏规则变化下的配对评估
摘要
MirrorCraft 是一个配对基准,用于评估 Minecraft 中基于 LLM 的智能体在隐藏规则变化下的表现,使用匹配的 Vanilla 和 Mirror 世界,通过规则干预效应(RIE)测量性能变化。
arXiv:2607.29218v1 公告类型:新
摘要:随着大语言模型(LLM)的繁荣,一个有趣的话题出现了:基于LLM的智能体如何在Minecraft中工作?不幸的是,大多数现有基准在固定游戏机制下评估它们。在这些设置中的高性能并不能表明当熟悉的配方、掉落物和其他规则发生变化时,智能体是否能够继续取得进展。在本文中,我们引入了MirrorCraft,一个用于在Minecraft中隐藏规则变化下评估智能体的配对基准。每个Mirror世界是其配对Vanilla世界的副本,其中选定的服务端规则由相应的数据包修改。在每个Vanilla-Mirror配对中,地形、出生点、资源分布、目标、界面和行动预算保持一致。MirrorCraft包括五个受控生物群系、六套规则集、三个进度目标、两个模型家族,以及共享Mineflayer接口下的六种智能体配置。我们使用确定性的进度里程碑和成功率来评估任务进度,并使用规则干预效应(RIE)来度量匹配的Vanilla和Mirror世界之间的性能变化。实验表明,隐藏规则变化在不同规则集之间产生了显著不同的影响。在未提供规则描述的评估配置中,ReAct取得了最高的综合Mirror得分。提供精确规则在所有三个目标上的平均进度和完成度方面带来了适度的提升。MirrorCraft将Minecraft评估扩展到固定机制之外,并提供了一个受控环境,用于研究当当前世界规则与熟悉规则不同时,智能体如何利用游戏结果。
查看缓存全文
缓存时间: 2026/08/03 07:31
# MirrorCraft:隐藏规则变更下的配对评估 Minecraft 源码:https://arxiv.org/html/2607.29218 Jianxin Gao¹\equalcontrib, Beini Hu²\equalcontrib, Runze Li³\equalcontrib, Wanli Peng¹\corresponding Ruohan Lei¹, Jinyuan Zhang¹, Linna Deng¹, Tianyi Yu⁴, Zining Wang⁵
## 摘要
随着大型语言模型(LLMs)的繁荣,一个有趣的话题出现了:基于 LLM 的智能体如何在 Minecraft 中工作?不幸的是,大多数现有基准在固定游戏机制下评估它们。在这些设置中的高性能并不能表明当熟悉的配方、掉落物和其他规则变化时,智能体是否能够继续取得进展。在本文中,我们介绍了 MirrorCraft,一个用于在 Minecraft 中隐藏规则变更下评估智能体的配对基准。每个 Mirror 世界都是其配对 Vanilla 世界的副本,并通过相应的数据包修改了选定的服务器端规则。在每个 Vanilla-Mirror 对中,地形、出生点、资源分布、目标、接口和动作预算保持匹配。MirrorCraft 在共享的 Mineflayer 接口下包含五个受控生物群系、六个规则套件、三个进度目标、两个模型家族和六种智能体配置。我们使用确定性的进度里程碑和成功率评估任务进展,并使用规则干预效应(RIE)来测量匹配的 Vanilla 和 Mirror 世界之间的性能变化。实验表明,隐藏规则变更在不同套件之间具有显著不同的影响。在没有规则描述的情况下评估的配置中,ReAct 在合并的 Mirror 得分中最高。提供确切的规则在全部三个目标上平均进展和完成度上带来适度提升。MirrorCraft 将 Minecraft 评估扩展到固定机制之外,并提供了一个受控设置,用于研究当当前世界的规则与熟悉规则不同时,智能体如何利用游戏结果。
## 引言
Minecraft 被广泛游玩并在网上有文档记录 (Fan 等, 2022 (https://arxiv.org/html/2607.29218#bib.bib3)),因此智能体可能利用语言模型预训练期间编码的熟悉机制,而不是推断当前世界的规则 (Yu 和 Lu, 2025 (https://arxiv.org/html/2607.29218#bib.bib19))。因此,在固定机制下的高性能可能反映了这种先验,而不是从当前世界的结果中进行推断。当配方、掉落物或工具要求发生变化时,一个错误的假设可能会扭曲后续计划;评估必须将变更规则下的性能与相对于标准规则的差异区分开来。MineRL、MineDojo、MCU、MineExplorer 和 SciCrafter 覆盖了多样的任务、泛化、探索和参数化发现,同时保持游戏机制固定 (Guss 等, 2019 (https://arxiv.org/html/2607.29218#bib.bib2); Fan 等, 2022 (https://arxiv.org/html/2607.29218#bib.bib3); Zheng 等, 2025 (https://arxiv.org/html/2607.29218#bib.bib4); Ju 等, 2026 (https://arxiv.org/html/2607.29218#bib.bib26); Zhou 等, 2026 (https://arxiv.org/html/2607.29218#bib.bib25))。因此,在这些基准上的高性能并不能表明当熟悉的配方、掉落物和其他规则变化时,智能体是否能够继续取得进展。Mars、NovelGym 和 NovelCraft 评估了相对于默认或未扰动条件下的变更机制或新颖性,而 XENON 研究了一种在扰动后修订任务知识的智能体 (Tang 等, 2024 (https://arxiv.org/html/2607.29218#bib.bib21); Goel 等, 2024 (https://arxiv.org/html/2607.29218#bib.bib29); Feeney 等, 2023 (https://arxiv.org/html/2607.29218#bib.bib23); Lee 等, 2026 (https://arxiv.org/html/2607.29218#bib.bib20))。表1 (https://arxiv.org/html/2607.29218#Sx1.T1) 区分了在线评估、变更机制或引入的新颖性,以及标准和变更运行是否从同一世界的匹配副本开始。然而,表中先前具有变更机制基准都没有使用这种配对形式。
表 1:代表性基准协议。“匹配副本”表示分别从同一世界的副本初始化的标准和变更运行;MC 表示 Minecraft。
我们介绍了 MirrorCraft,一个用于 Minecraft Java 1.19 中隐藏规则变更的配对基准。对于标准机制下的每个 Vanilla 世界,六个配对的 Mirror 世界从其存档中复制,每个加载不同规则套件的数据包。Vanilla 世界及其 Mirror 版本使用相同的地形、出生点、放置资源、任务、观察接口、动作接口和动作预算。普通动作会显示其结果,但智能体不会被告知哪些规则发生了变化。这种设计在不改变起始地图或智能体与游戏交互方式的情况下比较标准规则和修改规则。MirrorCraft 包含 10 个 Vanilla 世界,跨越五个受控生物群系、六个规则套件和三个进度任务:*Iron Armor*、*Diamond* 和 *Enchantment*。主要研究通过相同的 Mineflayer 主体和语义技能在 Vanilla 和 Mirror 世界中评估两个模型和六种智能体配置。一个单独的规则披露条件为 ReAct 提供了确切的 Mirror 规则。由服务器验证的里程碑为部分进展提供得分,而成功率(SR)记录最终目标的完成情况。对于相同的 Vanilla 世界、模型、任务、智能体配置和动作预算,RIESC\mathrm{RIE}_{\mathrm{SC}}和RIESR\mathrm{RIE}_{\mathrm{SR}}报告平均 Vanilla 结果减去对应的配对 Mirror 结果的 Score 和 SR。将 Mirror 性能与两个 RIE 一起报告,将修改规则下的性能与相对于标准规则的差异分开。主要研究包含 10 个 Vanilla 世界和六个设计的规则套件上的 8,640 个回合。RIE 值在不同套件中在符号和量级上都有所不同,因此 Mirror 世界并不统一比其 Vanilla 版本更难。在六个未收到规则描述的配置中,ReAct 实现了最高的合并 Mirror 得分。RIE 值最小的配置并不总是实现最强的 Mirror 性能,这表明为什么需要这两个量。对于 ReAct,提供确切的规则在全部三个任务中提高了平均 Score 和 SR,但仍不能确保完成。
我们的贡献有三点。首先,我们引入了一个 Minecraft 基准,它在保留用于比较的起始世界和交互协议的同时更改选定的规则。其次,我们提供了一个通用的智能体接口、由服务器验证的进度和完成度量,以及两个 RIE 度量,用于将每个 Vanilla 世界与其配对的 Mirror 世界进行比较。第三,我们的 8,640 回合主要研究揭示了规则套件之间的显著差异,以及即使规则被披露时 ReAct 仍然存在的失败。
## 相关工作
##### Minecraft 智能体。
Minecraft 智能体将语言模型规划与可复用技能、反馈和结构化知识相结合 (Wang 等, 2023b (https://arxiv.org/html/2607.29218#bib.bib9), a (https://arxiv.org/html/2607.29218#bib.bib8); Zhu 等, 2023 (https://arxiv.org/html/2607.29218#bib.bib10); Wang 等, 2025 (https://arxiv.org/html/2607.29218#bib.bib13); Liu 等, 2025 (https://arxiv.org/html/2607.29218#bib.bib11))。目标导向图从 Minecraft 知识源中检索前置条件链 (Leung 等, 2026 (https://arxiv.org/html/2607.29218#bib.bib12))。ReAct 跟踪最近的推理、动作和观察,Reflexion 将反馈转化为口头反思,Voyager 检索可复用程序,XENON 和 ADAM 从结果中修订任务关系 (Yao 等, 2023 (https://arxiv相似文章
Minecraft中面向时间敏感互补协作的多智能体框架
论文提出了TickingCollabBench,这是一个基于Minecraft的多智能体基准测试,用于动态环境中的时间敏感互补协作任务,并展示了与全局知识预言机相比,大语言模型在此类条件下经常失败。
MineExplorer:在《我的世界》中评估多模态大语言模型代理的开放世界探索能力
MineExplorer基准测试通过多智能体合成设计的原子任务和多跳任务,评估了多模态大语言模型代理在《我的世界》中的开放世界探索能力。实验表明,开放世界探索仍具挑战性,强模型在长轨迹中性能急剧下降。
WISE: 一种基于Why-Which推理的Minecraft长视距智能体
WISE提出了一种用于Minecraft的长视距智能体框架,通过因果事件图增强低级控制器的情景记忆,使其能够在视角变化下稳健回忆,并通过因果推理实现机会性任务重排序。该框架还采用了多尺度渐进探索策略,在长视距稀疏任务上展示了更高的成功率和效率。
BenchTrace:用于测试LLM智能体反思能力与受控演进的基准
BenchTrace是一个用于评估LLM智能体自我进化能力的基准,重点通过包含1,821个标注回合的数据集以及两个评估任务——反思评估与进化评估——来测试反思与受控演进。使用Qwen3-32B和GPT-4.1进行的实验表明,两个模型均表现不佳,主要瓶颈在于诊断,并存在泛化与遗忘问题。
Eval-Pair Matrix:面向有源检索增强生成的LLM评判者答案配对元评估
介绍了Eval-Pair Matrix,一种针对有源检索增强生成(RAG)的受控元评估协议,通过诱导隐藏矛盾来检测LLM评判者的自我宽容性。研究发现同模型效应极小,并强调了对RAG评判者研究方法论的改进。