MetaSpace:具身智能体中空间认知的蜕变测试

arXiv cs.AI 论文

摘要

MetaSpace 是一个框架,应用蜕变测试来评估具身智能体的空间认知能力,从执行轨迹中生成测试用例,并将逻辑/物理约束编码为 Prolog 规则。基准测试表明,最先进的 MLLM 驱动的智能体在空间认知上的得分远低于人类水平,其中方向性任务尤为薄弱。

arXiv:2608.07533v1 公告类型:新 摘要:具身智能体是一种通过物理身体与环境交互的智能实体。目前,具身智能体的评估主要依赖两种范式:(1) 人工标注的视觉问答(VQA)对;(2) 高层任务完成指标,如导航或操作的成功率。前者劳动密集且标注质量存在变异性。后者可能掩盖关键漏洞,使智能体通过次优手段或安全违规完成任务,从而隐藏安全风险和低效。鉴于空间认知是执行具身任务的基石,迫切需要评估具身智能体在任务执行过程中是否具备稳健的空间认知。 受软件工程中蜕变测试原理的启发,我们提出了 MetaSpace,一种用于评估智能体空间认知的新框架。通过利用来自真实执行轨迹的时空多模态状态,MetaSpace 基于由逻辑规则和物理定律定义的蜕变关系(MRs)自动生成测试用例。关键的是,我们将这些 MRs 编码为逻辑编程语言(Prolog)中的可执行规则。违反这些关系表示空间认知失败。我们在三个具身场景中的实证评估表明,MetaSpace 成功检测到最先进(SOTA)MLLM 驱动的智能体中的 90,422 个空间认知错误。我们引入空间认知(SC)评分来量化性能。结果表明,所有 SOTA 智能体的平均得分在 0.44 到 0.52 之间,显著低于人类基准的 0.96。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:02

# MetaSpace:具身智能体空间认知的蜕变测试
来源:https://arxiv.org/html/2608.07533 (2026-02-17)

###### 摘要。

具身智能体是一种通过物理身体与环境交互的智能实体。目前,具身智能体的评估主要依赖两种范式:(1) 人工标注的视觉问答(VQA)对;(2) 高层任务完成度指标,如导航或操作的成功率。前者劳动密集,且受标注质量差异影响。后者可能掩盖关键脆弱性,使智能体能够通过次优手段或违反安全规则完成任务,从而隐藏安全风险和低效问题。鉴于空间认知是执行具身任务的基石,迫切需要评估具身智能体在任务执行过程中是否具备稳健的空间认知。受软件工程中

相似文章

SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力

Hugging Face Daily Papers

SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。