MineCEraft:在Minecraft世界中评估语言模型作为建筑工程师

arXiv cs.AI 论文

摘要

这篇论文介绍了MineCEraft,一个用于评估Minecraft建筑任务中语言模型的开源基准,揭示了LLMs在物理和空间推理方面的局限性。

arXiv:2608.28884v1 公告类型:新 摘要:我们介绍了MineCEraft(Minecraft建筑工程基准,发音为mine-see-ee-raft),一个易于使用的开源基准,旨在系统地评估LLMs在Minecraft中建筑任务的可靠性和局限性。MineCEraft基准包括723个由领域专家手工制作的自然语言指令,具有可编程验证评估,涵盖17个不同的任务类别,为评估LLMs执行现实建筑工程项目的能力提供了一个安全可控的实验环境。使用这个基准,我们对最先进的LLMs进行了深入评估,并执行了详细的错误分析,揭示了将LLMs应用于建筑工程项目时的关键失败模式和实际挑战。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:42

# 在Minecraft世界中评估语言模型作为建筑工程者
来源:https://arxiv.org/html/2608.28884  
Sewoong Lee  
所属机构:西贝尔计算与数据科学学院,格兰杰工程学院,伊利诺伊大学厄巴纳-香槟分校  
Risham Sidhu  
所属机构:西贝尔计算与数据科学学院,格兰杰工程学院,伊利诺伊大学厄巴纳-香槟分校  
Julia Hockenmaier  
所属机构:西贝尔计算与数据科学学院,格兰杰工程学院,伊利诺伊大学厄巴纳-香槟分校  
Yoonhwa Jung  
所属机构:佛罗里达大学土木与海岸工程系  
通讯作者:[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected])

###### 摘要
我们推出了MineCEraft(Minecraft建筑工程基准测试,发音为mine-see-ee-raft),一个易于使用的开源<sup>1</sup>基准测试,旨在系统性地评估大型语言模型(LLMs)在Minecraft建筑任务中的可靠性和局限性。MineCEraft基准测试包含723条由领域专家精心设计的自然语言指令,并配有程序化可验证的评估标准,涵盖17个不同的任务类别,为评估LLMs执行现实建筑工程任务的能力提供了一个安全、可控的实验环境。利用该基准测试,我们对最先进的LLMs进行了深入评估,并进行了详细的错误分析,揭示了应用LLMs于建筑工程任务时的关键失败模式和实际挑战。参见图1说明:基于LLM的智能体甚至无法可靠执行一条简单的建造拱桥的指令。我们将任务分解为基于规则的评估组件。该基准测试揭示了阻碍基于LLM的智能体在现实世界建筑场景中可靠应用的局限性。

## 1 引言
建筑是工程学中最古老的分支之一,伴随着人类从诞生之初至今。尽管人工智能在数学(Tao,2024)和科学(Wang等人,2026)等领域取得了显著进展,但其在建筑工程方面的有限贡献表明,莫拉维克悖论(Moravec,1988)在某些领域依然成立:对人类容易的事情对计算机仍然困难,而对计算机容易的事情对人类仍然困难。参见图2说明:MineCEraft任务中LLM生成建筑的示例。在具身化的Minecraft环境中,即使是相对简单的指令,LLM也经常产生结构上存在缺陷的输出。此处展示的所有示例均使用claude-3-7-sonnet-20250219生成,智能体配置参考White*等人(2025)(附录E.2)。由人类创建的示例见附录H。虽然LLMs在许多基于文本的任务中展现出令人印象深刻的推理能力,但这些技能如何转化到物理、空间环境中仍是一个开放性问题。为了系统性地评估这一点,我们将物理建筑的核心挑战抽象为一个高度受控的简化环境。我们研究的一个关键问题是:“我们如何能够系统性地证明,即使在像Minecraft这样高度简化的环境中,LLMs也无法可靠地执行甚至基本的建筑任务?”我们揭示了基于LLM的AI在可靠执行指令方面的局限性,其产生的输出不仅形状和尺寸不准确,而且存在物理上不切实际且不稳定的结构,违背了基本的工程约束。本文的贡献如下:
- •我们将具身建筑表述为一个受工程约束的任务,其正确性需要满足物理合理性、结构稳定性和规划可行性,从而能够评估超越先前基准中基于编辑距离指标的结构复杂建筑。
- •我们引入了MineCEraft,一个结合自然语言指令跟随、长周期具身建筑以及一个可程序化地将建筑质量分解为准确性、安全性和规划标准评估流程的开源基准测试。
- •利用该框架,我们提供了系统性证据,表明最先进的基于LLM的智能体严重缺乏可靠的空间推理和规划能力,即使在像Minecraft这样的简化环境中,也始终无法满足基本的工程级安全和稳定性约束。

## 2 相关工作
| 基准测试 | 具身环境 | 自然语言需求 | 长周期评估 | 物理感知 | 建筑工程 |
| :--- | :---: | :---: | :---: | :---: | :---: |
| Voyager (Wang等人, 2024) | ✓ | ✗ | ✓ | ✗ | ✗ |
| EmbodiedBench (Yang等人, 2025) | ✓ | ✓ | ✓ | ✓ | ✗ |
| MineCollab (White*等人, 2025) | ✓ | ✗ | ✓ | ✗ | ✗ |
| CEQuest (Wu等人, 2025) | ✗ | ✓ | ✗ | ✗ | ✓ |
| BAPv2 (Jayannavar等人, 2026) | ✓ | ✓ | ✓ | ✗ | ✗ |
| **MineCEraft (我们的)** | **✓** | **✓** | **✓** | **✓** | **✓** |

表1:基准测试对比。

### 2.1 具身AI
具身AI研究探讨智能体如何将语言在交互环境中具体化,通常聚焦于导航(Thomason等人, 2020; Padmakumar等人, 2022)或短期家庭操作(Shridhar等人, 2020)。虽然这些基准测试评估了序列决策,但建筑引入了独特的挑战:智能体必须生成满足复杂几何、物理和工程约束的长周期空间结构。

### 2.2 基于Minecraft的建筑与语言具体化
Minecraft已被广泛用作研究语言引导建筑的平台,既关注指令发出(Narayan-Chen等人, 2019; Köhn等人, 2020),也关注指令跟随(Gray等人, 2019; Jayannavar等人, 2020)。最近的工作(Chaturvedi等人, 2024; Kranti等人, 2024; Jayannavar等人, 2026)探索了使用纯文本LLMs进行基于Minecraft对话语料库(MDC)的建造者动作预测(BAP)任务。但MineCEraft基准测试与MDC有根本不同,因为我们主要关注建筑任务本身,而MDC关注的是Minecraft作为一个交互式游戏,以及指令发出者和跟随者(建造者)之间的来回对话。MineCEraft不假设建造者能够说话,但包含更复杂、更物理真实的建造任务,不允许使用MDC目标结构中常见的悬浮方块,同时允许智能体使用Minecraft的全部材料(而不仅仅是有限的六种颜色库存)。MineCollab(White*等人, 2025)引入了Minecraft中基于蓝图的建筑任务,并评估了智能体实现工程式规范的能力。然而,其任务关注于相对基础的结构(例如金字塔),并提供明确的坐标级蓝图,这意味着主要挑战在于执行而非解释自然语言指令。相比之下,我们的MineCEraft评估的是使用**未指定指令**的现实建筑,而非要求智能体复制精确的目标结构。

### 2.3 建筑工程评估
在Minecraft领域之外,一些基准测试研究了语言模型中的建筑工程知识。CEQuest(Wu等人, 2025)评估了大型语言模型在建筑工程问题上的表现。虽然该基准测试提供了对领域知识的有效评估,但它完全在基于文本的环境中运行,并未评估具身环境中的智能体。补充性工作在Minecraft中探索了基于物理的模拟。例如,Beck等人(2024)引入了Minecraft结构的弹性求解器,可对已建建筑进行应力和变形分析。尽管这项工作关注于物理模拟而非语言引导的任务,但它展示了在Minecraft环境中评估建筑结构特性的潜力。总而言之,现有工作要么评估建筑场景中的语言具体化,要么评估基于文本环境中的工程知识。然而,没有一项工作共同评估自然语言指令跟随、具身建筑、长周期空间规划和工程感知的结构评估。MineCEraft通过引入一个用于自然语言引导建筑任务的基准测试来填补这一空白,该基准测试融合了受工程启发的评估标准:它在一个统一的框架内(见表1),评估智能体解释建筑规范、规划多步骤建造过程以及产生物理有效建筑的能力。

## 3 任务设置
MineCEraft基准测试包含723条由领域专家精心设计的自然语言建筑指令。这些任务跨越17种不同的任务类型,旨在涵盖多样化的建筑场景和工程需求。

### 3.1 未指定指令
MineCEraft的一个决定性特征是使用未指定指令来评估空间推理。与传统的将输出与单一真实目标进行比较的基准测试不同,我们的任务反映了现实世界的建筑,要求智能体满足一组开放式约束。在我们的基准测试中,像“使用混凝土建造一栋两层楼的框架(包括楼梯)。每层楼应比下一层高4个方块。”这样的提示并没有一个精确的正确体素配置。相反,智能体根据第4节中明确的标准(例如,正确的形状、尺寸、材料使用、物理合理性)进行评估。此外,任务通常涉及初始指令后的多轮修订。这测试了智能体根据演变环境调整其空间理解的能力。

参见图3(a)说明:**物理上不合理**的悬浮方块示例(红色框突出显示)。  
参见图3(b)说明:跨度和高度均为5个方块的**平面桥梁**的冯·米塞斯应力(最大值≈7.8 kPa)。  
参见图3(c)说明:跨度和高度均为5个方块的**拱形桥梁**的冯·米塞斯应力(最大值≈5.3 kPa)。  
图3:超越简单几何评估拱形结构。  
提示:**“建造一座拱桥。”**  
物理合理性通过广度优先搜索验证,会对断开的悬浮方块(例如,图3(a),由claude-3-7-sonnet-20250219生成)进行惩罚。结构稳定性通过冯·米塞斯应力衡量。我们使用标准的平桥(图3(b),≈7.8 kPa)作为最大阈值(σ_max)。在结构工程中,真正的拱桥能更有效地分配荷载(图3(c),≈5.3 kPa),从而在相同跨度下比平桥产生更低的最大应力。任何超过平桥基准应力(σ_max > σ_ref)的次优拱形结构,其稳定性得分将按比例受到惩罚。

### 3.2 任务设计与覆盖
MineCEraft包含一系列建筑任务,旨在(1)确保建筑场景的广泛多样性,(2)通过明确的规则或基于物理的计算实现客观精确的评估,以及(3)反映在现实建筑实践中真实可行的要求。用于定性分析的错误案例示例如图2所示。

#### 3.2.1 结构元素
此类别涵盖建筑的基本结构组件:地基、墙壁、屋顶、柱子和框架。任务指定了具体的混凝土要求,如尺寸、厚度、高度或层数。由于这些元素由明确的几何和材料约束定义,因此允许使用基于规则的检查来评估尺寸和连通性。它们在引入更复杂的建筑场景之前,作为结构正确性的基本测试。

#### 3.2.2 建筑类型
除了独立的结构元素外,“建筑”类别评估的是集成建筑的建造。这些任务组合了多个组件,并引入了更高级的要求,包括房间布局、材料约束、可达性和时间规划。该类别包括一系列场景:
##### 基础建筑
指令指定了房屋不同部分的材料分配,例如柱子、墙壁、屋顶和地基。变体包括不同的材料组合和提示措辞。示例性示例如图2-B所示,这些任务使用算法3和11进行评估。
参见图4(a)说明:**有偏见的**柱子放置,其中中心柱子紧邻另一根柱子。  
参见图4(b)说明:在**有偏支撑**下的冯·米塞斯应力(最大值≈140 MPa)。  
参见图4(c)说明:在**平衡支撑**下的冯·米塞斯应力(最大值≈60 MPa)。  
图4:MineCEraft显示,与(c)中的替代方案相比,(a)和(b)中LLM生成的结构在结构上不稳定。  
当中心柱子附着在另一根柱子上时,荷载无法均匀分布,导致应力场偏斜,峰值冯·米塞斯应力(≈140 MPa)高于平衡的五柱配置(≈60 MPa)。该建筑使用claude-3-7-sonnet-20250219生成,提示为:“**建造一个由恰好五根2×2×2柱子支撑的10×10平顶屋顶。安排柱子使屋顶尽可能结构稳定。**”
##### 多个房间/卧室
任务要求建造具有指定数量房间(例如,一到五个;见算法5)的房屋。多卧室指令通过额外使用算法2指定房屋内应包含的床的数量,扩展了基于房间的任务。
##### 多层建筑
智能体被指示建造具有明确高度和柱子约束的上层楼或结构框架。

相似文章

超越API:探究MLLMs在物理工具使用中的极限

arXiv cs.CL

本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。

一个MUD能否评估LLM?一个99美元的概念验证

Hacker News Top

CrucibleBench将语言模型置于一个持久化的MUD环境中,通过50轮游戏和隐藏的社交目标来评估智能体行为。包含13个模型的概念验证发布显示,使用LLM评判组件可显著改变排行榜顺序,这凸显了在评判消融分析中报告排名稳定性的必要性。