空中MLLM智能体的零样本任务级评估

arXiv cs.CL 论文

摘要

MissionBench是一个新的基准测试,用于评估多模态大语言模型(MLLMs)在三维空中环境中执行长期具身任务的表现。结果显示,即使是表现最好的模型,其任务成功率也不到35%,而人类的表现达到84.4%。

arXiv:2607.22014v1 公告类型:交叉 摘要:多模态大语言模型(MLLMs)正逐渐成为具身智能体的核心推理模块,但目前尚不清楚通用模型能否仅通过一条高级指令解决长期具身任务。我们引入了MissionBench,一个用于在三维空中环境中对MLLMs进行任务级评估的基准。它包含五个模拟三维环境和四个任务家族中的120个任务。智能体必须仅依靠自我中心观察和动作历史来自主规划、导航并报告结果,无需针对空中场景的微调。在22个开源和闭源MLLMs中,最强的模型在少于35%的任务上成功,而人类表现达到84.4%,突显了多步骤具身任务的难度。尽管模型家族之间差异很大,但我们观察到规模提升带来的收益,表明更大的通用模型具有更强的零样本具身能力。我们的分析表明,任务级能力需要协调多种能力,超越空间感知,包括多步骤规划和自适应推理。这推动了闭环评估的必要性,并凸显了基于规模驱动的改进在具身AI中的前景与风险。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:42

# 面向空中多模态大语言模型智能体的零样本任务级评估
来源:https://arxiv.org/abs/2607.22014
查看 PDF(https://arxiv.org/pdf/2607.22014)

> 摘要:多模态大语言模型 \(MLLMs\) 正逐渐成为具身智能体的核心推理模块,然而通用模型在仅凭单条高层指令解决长周期具身任务方面的能力仍不明确。我们提出 MissionBench,一个用于空中 3D 环境中 MLLM 任务级评估的基准。它包含 120 个任务,覆盖五个模拟 3D 环境和四个任务族。智能体必须仅利用以自我为中心的观测和自身动作历史,自主规划、导航并报告结果,无需针对空中场景进行微调。在 22 个开源和闭源 MLLM 中,最强模型的任务成功率低于 35%,而人类表现达到 84.4%,凸显了多步骤具身任务的难度。尽管模型族之间差异巨大,但我们观察到缩放带来的增益,表明更大的通用模型具备更强的零样本具身能力。我们的分析显示,任务级能力需要协调多种能力,而不仅仅是空间感知,还包括多步骤规划和自适应推理。这推动了对闭环评估的需求,并突显了缩放驱动改进对具身 AI 的前景与风险。

## 提交历史

来自:Jona Ruthardt \[通过电子邮件查看(https://arxiv.org/show-email/66a745b9/2607.22014)\] **\[v1\]** 2026 年 7 月 24 日,星期五,06:22:50 UTC(17,719 KB)

相似文章

MLUBench: 多模态大语言模型终身遗忘评估基准

arXiv cs.AI

MLUBench 是一个大规模的多模态大语言模型终身遗忘基准,包含9个类别的127个实体。论文指出现有遗忘方法存在累积退化问题,并提出 LUMoE 来缓解此问题,显示出显著改进。

MLE-bench:评估机器学习代理在机器学习工程中的表现

OpenAI Blog

# MLE-bench:评估机器学习代理在机器学习工程中的表现 来源:[https://openai.com/index/mle-bench/](https://openai.com/index/mle-bench/) OpenAI 评估机器学习代理在机器学习工程中的表现 我们推出了 MLE-bench,这是一个用于衡量 AI 代理在机器学习工程中表现如何的基准。为此,我们从 Kaggle 精选了 75 个与 ML 工程相关的竞赛,创建了一个多样化的具有挑战性的任务集合,用于测试真实的 ML 工程

WildClawBench:真实世界长周期智能体评估基准

Hugging Face Daily Papers

WildClawBench 使用真实的命令行界面环境和实际工具,评估语言和视觉-语言模型在现实长周期任务上的表现。该基准测试显示,即使最佳模型也仅达到62.2%的准确率,表明长周期智能体评估仍具有挑战性。