MetaSpace:具身智能体中空间认知的蜕变测试
摘要
MetaSpace 是一个框架,应用蜕变测试来评估具身智能体的空间认知能力,从执行轨迹中生成测试用例,并将逻辑/物理约束编码为 Prolog 规则。基准测试表明,最先进的 MLLM 驱动的智能体在空间认知上的得分远低于人类水平,其中方向性任务尤为薄弱。
arXiv:2608.07533v1 公告类型:新
摘要:具身智能体是一种通过物理身体与环境交互的智能实体。目前,具身智能体的评估主要依赖两种范式:(1) 人工标注的视觉问答(VQA)对;(2) 高层任务完成指标,如导航或操作的成功率。前者劳动密集且标注质量存在变异性。后者可能掩盖关键漏洞,使智能体通过次优手段或安全违规完成任务,从而隐藏安全风险和低效。鉴于空间认知是执行具身任务的基石,迫切需要评估具身智能体在任务执行过程中是否具备稳健的空间认知。
受软件工程中蜕变测试原理的启发,我们提出了 MetaSpace,一种用于评估智能体空间认知的新框架。通过利用来自真实执行轨迹的时空多模态状态,MetaSpace 基于由逻辑规则和物理定律定义的蜕变关系(MRs)自动生成测试用例。关键的是,我们将这些 MRs 编码为逻辑编程语言(Prolog)中的可执行规则。违反这些关系表示空间认知失败。我们在三个具身场景中的实证评估表明,MetaSpace 成功检测到最先进(SOTA)MLLM 驱动的智能体中的 90,422 个空间认知错误。我们引入空间认知(SC)评分来量化性能。结果表明,所有 SOTA 智能体的平均得分在 0.44 到 0.52 之间,显著低于人类基准的 0.96。
查看缓存全文
缓存时间: 2026/08/11 08:02
# MetaSpace:具身智能体空间认知的蜕变测试 来源:https://arxiv.org/html/2608.07533 (2026-02-17) ###### 摘要。 具身智能体是一种通过物理身体与环境交互的智能实体。目前,具身智能体的评估主要依赖两种范式:(1) 人工标注的视觉问答(VQA)对;(2) 高层任务完成度指标,如导航或操作的成功率。前者劳动密集,且受标注质量差异影响。后者可能掩盖关键脆弱性,使智能体能够通过次优手段或违反安全规则完成任务,从而隐藏安全风险和低效问题。鉴于空间认知是执行具身任务的基石,迫切需要评估具身智能体在任务执行过程中是否具备稳健的空间认知。受软件工程中
相似文章
MetaSpatial:强化VLMs在元宇宙中的3D空间推理
MetaSpatial是一个强化学习框架,旨在增强视觉语言模型(VLMs)的3D空间推理能力,能够生成连贯且物理上合理的3D场景,无需硬编码优化。
SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
Embodied-BenchClaw:一种用于具身空间智能基准构建的自主多智能体系统
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。
DataSpace:异构工作空间上可验证分析的数据代理基准
介绍了DataSpace,一个用于在异构工作空间上评估数据代理可验证表格分析能力的基准测试,包含410个跨语言任务和7,439个工件。当前前沿模型仅达到66.34%的准确率,表明仍有提升空间。