MineExplorer:在《我的世界》中评估多模态大语言模型代理的开放世界探索能力
摘要
MineExplorer基准测试通过多智能体合成设计的原子任务和多跳任务,评估了多模态大语言模型代理在《我的世界》中的开放世界探索能力。实验表明,开放世界探索仍具挑战性,强模型在长轨迹中性能急剧下降。
查看缓存全文
缓存时间: 2026/06/02 15:35
论文页面 - MineExplorer:评估MLLM智能体在Minecraft中的开放世界探索能力
来源:https://huggingface.co/papers/2605.30931
摘要
MineExplorer基准通过多智能体合成设计的原子任务和多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力。
多模态大语言模型(MLLMs)在感知、推理和动作生成方面展现出强大能力。然而,它们在动态开放世界中维持探索的能力仍不明确。现有的具身化和基于游戏的基准往往将交互压缩为短时任务,或将其成功与特定领域的游戏机制纠缠在一起。本文中,我们引入了MineExplorer基准,用于评估MLLM智能体在Minecraft中的开放世界探索能力。我们首先筛选出那些解决方案高度依赖Minecraft特定知识的原子任务,以更好地反映通用的开放世界推理。然后,我们围绕ReAct风格的能力框架组织基准,并将原子任务组合成隐式的多跳任务。为进一步构建可靠的实例,MineExplorer使用多智能体合成工作流,该工作流联合设计任务图、沙盒场景和基于规则的里程碑评估器。人工评估表明,多智能体合成工作流生成的实例比单智能体基线显著更可靠。使用先进MLLM智能体的实验表明,开放世界探索仍具挑战性:强模型可以处理许多单跳任务,但在需要协调隐藏前提条件的长轨迹中性能急剧下降。进一步分析发现,任务难度与智能体完成度相关,而更大的模型或思维模式并不总能转化为更好的性能。代码和数据集可在 https://github.com/Jometeorie/MineExplorer 获取。
查看arXiv页面 (https://arxiv.org/abs/2605.30931) 查看PDF (https://arxiv.org/pdf/2605.30931) GitHub2 (https://github.com/Jometeorie/MineExplorer) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30931)
在您的智能体中获取此论文:
hf papers read 2605\.30931
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在模型README.md中引用 arxiv.org/abs/2605.30931,以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集README.md中引用 arxiv.org/abs/2605.30931,以从此页面链接。
引用此论文的Spaces0
没有Space链接此论文
请在Space README.md中引用 arxiv.org/abs/2605.30931,以从此页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
三思而后行:LLM 智能体的自主探索
本文指出自主探索是大语言模型智能体的关键能力,并提出了先探索后行动范式,该范式将信息收集与任务执行解耦,以提升适应性和实际性能。同时引入了探索检查点覆盖率作为可验证的指标,用于评估探索的广度。
MineCEraft:在Minecraft世界中评估语言模型作为建筑工程师
这篇论文介绍了MineCEraft,一个用于评估Minecraft建筑任务中语言模型的开源基准,揭示了LLMs在物理和空间推理方面的局限性。
Minecraft中面向时间敏感互补协作的多智能体框架
论文提出了TickingCollabBench,这是一个基于Minecraft的多智能体基准测试,用于动态环境中的时间敏感互补协作任务,并展示了与全局知识预言机相比,大语言模型在此类条件下经常失败。
新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
多智能体LLMs未能相互探索
本文指出当前LLM智能体未能系统地探索同伴,导致协调不佳,并引入MACE,一个轻量级框架,使用上下文赌博机进行有效的同伴选择。