Embodied-BenchClaw:一种用于具身空间智能基准构建的自主多智能体系统
摘要
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。
arXiv:2606.11909v1 公告类型:新
摘要:基准对于评估具身空间智能至关重要,但其构建工作劳动密集、难以复用且维护困难。现有的具身基准往往是静态的,随着模型改进可能很快饱和,从而限制其区分新能力的能力。我们提出Embodied-BenchClaw,一种用于构建具身空间智能基准的自主智能体系统。给定用户指定的评估意图,Embodied-BenchClaw通过五阶段流水线自动生成一个完整且可持续更新的基准包:意图蓝图、数据收集、结构化与清洗、基准合成以及评估报告。该流水线由三个智能体(规划、构建和评估)协同运作。为了提高可复用性和可靠性,Embodied-BenchClaw引入了可扩展技能库和过程质量控制,使基准构建具有可组合性、可验证性和可修复性。我们实例化了多个基准,涵盖室内空间推理、室外空间推理、机器人操作、四足机器人导航、无人机/空中视角理解以及静态基准增强。这些基准覆盖了多样的具身载体、数据来源和空间能力。通过人工评估、基于评判者的评估、一致性检查、成本分析和消融实验,结果表明Embodied-BenchClaw能够构建可验证、可执行、可维护且具有诊断价值的具身空间基准,同时减少人力投入。
查看缓存全文
缓存时间: 2026/06/11 13:49
# Embodied-BenchClaw:面向具身空间智能基准构建的自主多智能体系统 来源:https://arxiv.org/html/2606.11909 蒋宝阳¹ 张凤春² 王乐远³ 李昊天³ 王怡达³ 季哲⁴ 赖金山² 任曦⁵ 胡建伟¹ 马强¹ ¹奇源实验室 ²电子科技大学信息与软件工程学院 ³北京邮电大学 ⁴东北大学计算机科学与工程学院 ⁵北京航空航天大学计算机科学与工程学院 ###### 摘要 基准测试对于评估和推动具身空间智能发展至关重要,但其构建过程仍然劳动密集、难以复用且不易维护。现有的具身基准通常以静态数据集的形式发布,且随着模型能力的提升可能迅速饱和,从而降低其区分下一代模型的能力。我们提出 **Embodied-BenchClaw**,一个用于构建具身空间智能基准的自主智能体系统。给定用户指定的评估意图,Embodied-BenchClaw 通过一个五阶段流水线(包括意图蓝图设计、数据收集、结构化和清洗、基准合成以及评估报告生成)自动生成一个完整且可持续更新的基准包。该流水线由三个智能体协调运作:规划智能体、构建智能体和评估智能体,分别负责意图到蓝图的转换、基准生成以及评估驱动的优化。为了提高可复用性和可靠性,Embodied-BenchClaw 引入了一个可扩展的技能库,将复杂的基准构建分解为可组合、可验证且可修复的构建模块,并结合过程质量控制来约束和纠正生成过程中的低质量样本。我们实例化了多个由 Embodied-BenchClaw 生成的基准,涵盖室内空间推理、室外空间推理、机器人操作、四足机器人导航、无人机/航拍视角理解以及静态基准增强。这些基准跨越多种具身载体、异构数据源以及细粒度的空间能力。大量实验(包括人工评估、基于评判者的质量评估、一致性检查、成本分析和消融研究)表明,Embodied-BenchClaw 能够在减少人工工作量的前提下,构建可验证、可执行、可维护且具有诊断效力的具身空间基准。结果展示了其在实现可扩展且可持续更新的具身空间智能评估方面的潜力。 参见图注图1:Embodied-BenchClaw 概览。给定用户请求,Embodied-BenchClaw 推荐基准范围、资源、能力和评估计划,然后通过智能体构建和过程质量控制自动构建可持续更新的基准包。构建过程得到可复用资源的支持,包括技能、专家模板、能力/资源卡片、模拟器、静态基准以及真实世界图像或视频。 ## 1 引言 视觉语言模型(VLM)、多模态大语言模型(MLLM)以及视觉-语言-动作模型正在快速发展。除了模型规模扩展外,近期研究越来越多地探索自动化模型改进流程,包括自动数据生成、自我评估、智能体反馈和迭代能力精炼(Yuan 等,2024 (https://arxiv.org/html/2606.11909#bib.bib60);Gao 等,2025 (https://arxiv.org/html/2606.11909#bib.bib61);Kiela 等,2021 (https://arxiv.org/html/2606.11909#bib.bib35))。在此背景下,基准测试不再仅仅是静态排行榜,而是衡量新兴能力、暴露失败模式以及为模型进化提供反馈的关键工具(Kiela 等,2021 (https://arxiv.org/html/2606.11909#bib.bib35))。然而,基准构建的速度仍远慢于模型开发。高质量基准在设计、标注、验证和维护上成本高昂,且一旦发布,可能迅速饱和、过拟合或受到污染(Kiela 等,2021 (https://arxiv.org/html/2606.11909#bib.bib35);Yang 等,2023 (https://arxiv.org/html/2606.11909#bib.bib62))。这种不匹配使得难以及时评估新模型能力,难以为模型改进提供可靠反馈。 参见图注图2:具身空间智能基准之间的表征相似性。相似性基于数据集级别的 Qwen-SAE 激活指纹(Deng 等,2026 (https://arxiv.org/html/2606.11909#bib.bib64))计算,揭示了现有基准之间潜在的重叠性和互补性。 这一瓶颈在具身空间智能领域尤为突出。具身智能体要求模型能够从视觉观察中推理自我中心的空间关系、物体布局、导航线索、跨视角对应、操作相关约束以及任务可行性。大量具身 AI 基准已被开发用于导航、指令跟随、操作、3D 理解、自动驾驶、机器人操作以及多模态智能体评估,正如近期综述所总结的(Duan 等,2022 (https://arxiv.org/html/2606.11909#bib.bib57);Liu 等,2025 (https://arxiv.org/html/2606.11909#bib.bib58))。代表性基准如 ALFRED、LIBERO、EmbodiedScan 和 EmbodiedBench 提供了有价值的任务定义、数据资源和评估协议(Shridhar 等,2020 (https://arxiv.org/html/2606.11909#bib.bib20);Liu 等,2023 (https://arxiv.org/html/2606.11909#bib.bib6);Wang 等,2024 (https://arxiv.org/html/2606.11909#bib.bib32);Yang 等,2025 (https://arxiv.org/html/2606.11909#bib.bib9))。许多现有系统也自动化了基准或数据构建的部分环节,例如程序化场景生成、基于模板的任务实例化、演示合成、轨迹重放、模拟器状态验证、任务生成或奖励生成(Deitke 等,2022 (https://arxiv.org/html/2606.11909#bib.bib38);Nasiriany 等,2024 (https://arxiv.org/html/2606.11909#bib.bib23);Mandlekar 等,2023 (https://arxiv.org/html/2606.11909#bib.bib40);Ma 等,2023 (https://arxiv.org/html/2606.11909#bib.bib45))。尽管如此,大多数具身基准仍然以固定制品的形式发布,绑定到特定的模拟器、数据集、任务定义或评估脚本。当出现新的 VLM、应用场景或空间能力时,构建合适的基准仍需在能力分解、资源选择、证据检查、题目设计、评分构建和结果分析方面投入大量人工工作。 此外,现有具身空间基准可能存在表征覆盖重叠。如图2 (https://arxiv.org/html/2606.11909#S1.F2) 所示,我们使用 Qwen-SAE 激活指纹(Deng 等,2026 (https://arxiv.org/html/2606.11909#bib.bib64))分析了现有具身空间智能基准之间的表征相似性。对于每个基准,多模态样本被映射为稀疏内部激活分布,然后平均为数据集级别的指纹。成对余弦相似度热图显示,多个基准在模型内部特征空间中占据高度相似区域,表明当前具身空间评估中存在潜在冗余。这一观察促使我们构建一个不仅能够生成新基准,还能够分析、精炼并持续更新基准包以覆盖尚未充分评估的能力区域的构建框架。 为了弥补这一空白,我们提出 **Embodied-BenchClaw**,一个质量引导的多智能体框架,用于自动构建面向 VLM 的具身空间基准。如图1 (https://arxiv.org/html/2606.11909#S0.F1) 所示,Embodied-BenchClaw 将高层用户请求转化为可持续更新的基准包。它首先与用户交互,推荐并确认基准范围、资源选择、目标能力和评估计划。然后通过三个协作智能体自动进行基准构建:规划智能体将用户意图转换为构建计划,构建智能体执行五阶段基准构建工作流,过程质量控制智能体验证中间制品,并在验证失败时触发局部修复。构建过程得到可复用资源的支持,包括技能库、专家模板库、能力/资源卡片、模拟器、静态基准以及真实世界图像或视频。 与一次性问题生成不同,Embodied-BenchClaw 强调资源感知的构建、层级化技能引导的执行、基于证据的题目合成、可执行评分、溯源追踪以及局部修复。每个构建阶段通过阶段性的技能 DAG 实现,其中技能是可执行单元,具有输入输出契约、工具绑定、验证规则和可选的修复动作。过程质量控制智能体调用可执行验证来检查中间制品,包括模式有效性、证据完整性、答案可推导性、评分可执行性、响应可解析性以及溯源完整性。当验证失败时,Embodied-BenchClaw 通过溯源记录定位受影响的构建步骤,并触发局部修复,而非重新启动整个工作流。最终输出不仅仅是一组孤立的问题,而是一个任务特定的基准包,包含题目、元数据、证据记录、参考答案、评分协议、模型响应日志、评估报告以及更新建议。在当前实现中,Embodied-BenchClaw 聚焦于基于图像、多视图和模拟器状态的具身空间评估,而非闭环机器人控制、触觉感知、力反馈或实时物理交互。通过使基准构建可复用、可验证和可维护,Embodied-BenchClaw 支持及时的 VLM 评估、基准精炼以及面向生命周期的基准维护。 我们的贡献总结如下: - • 我们提出 **Embodied-BenchClaw**,一个全自动的多智能体框架,用于具身空间基准构建。它包含规划智能体、构建智能体和过程质量控制智能体,能够从用户指定的评估意图转化为可持续更新的基准包。 - • 我们设计了一种层级化技能引导的执行机制,包含阶段性的 DAG。每个构建阶段通过可复用技能执行,具有明确的输入输出契约、可执行组件、验证规则和修复动作,支持模块化且可溯源的基准构建。 - • 我们引入了一种基于可执行验证、溯源追踪和局部修复的过程质量控制机制。该机制约束智能体行为、检查中间制品,并提升基准构建的可靠性和可维护性。 - • 我们实例化了六个代表性具身空间基准,包括 **Indoor-Bench**、**NavLand-Bench**、**Drive-Bench**、**Aerial-Bench**、**Quad-Bench** 和 **Manip-Bench**,涵盖室内推理、室内导航、自动驾驶、无人机航拍感知、四足机器人推理和机器人操作。 表1:与代表性基准构建和评估系统的比较。“/是”表示系统在其主要设计中明确支持该能力。“多类型数据源”指从多种类别的数据源(如模拟器、真实世界视觉数据、现有基准和用户提供的数据)构建基准。 | 方法 | 模态 | 领域 | 端到端构建 | 可复用技能 | 具身空间 | 多类型数据源 | 证据/评分/修复 | 优化 | |---|---|---|---|---|---|---|---|---| | Dynabench (2021) | 单模态 | NLP | ✗ | ✗ | ✗ | ✗ | ✓ | ✓ | | WebArena (2024) | 多模态 | 智能体 | ✗ | ✗ | ✗ | ✗ | ✓ | ✓ | | RoboCasa (2024) | 多模态 | 具身 AI | ✗ | ✗ | ✓ | ✗ | ✓ | ✗ | | RoboGen (2024) | 多模态 | 具身 AI | ✗ | ✗ | ✓ | ✗ | ✓ | ✓ | | AutoBencher (2025) | 单模态 | LLM 评估 | ✓ | ✗ | ✗ | ✗ | ✓ | ✓ | | BenchAgents (2025) | 单模态 | LLM 评估 | ✓ | ✗ | ✗ | ✗ | ✓ | ✓ | | EmbodiedBench (2025) | 多模态 | 具身 AI | ✗ | ✗ | ✓ | ✗ | ✓ | ✗ | | Code2Bench (2026) | 多模态 | 软件工程 | ✓ | ✗ | ✗ | ✗ | ✓ | ✓ | | **Embodied-BenchClaw (Ours)** | 多模态 | 具身 AI | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ## 2 相关工作 自动化基准构建近期已成为评估快速发展模型的重要方向。Dynabench 研究了人机协作的动态基准测试(Kiela 等,2021 (https://arxiv.org/html/2606.11909#bib.bib35)),而 AutoBencher、BenchBench 和 BenchAgents 则将 LLM 或多模态能力的基准创建自动化(Li 等,2024 (https://arxiv.org/html/2606.11909#bib.bib3);Zheng 等,2026 (https://arxiv.org/html/2606.11909#bib.bib4);Butt 等,2024 (https://arxiv.org/html/2606.11909#bib.bib63))。BenchAgents 与我们的工作特别相关:它将基准创建分解为规划、生成、数据验证和评估智能体,并使用人在回路的反馈来控制基准多样性和质量(Butt 等,2024 (https://arxiv.org/html/2606.11909#bib.bib63))。然而,其主要关注点是一般生成能力(例如文本生成过程中的规划和约束满足),而非具身空间基准构建。其他系统则聚焦于可执行或基于环境的评估。Code2Bench 和 PRDBench 构建带有可执行测试的代码导向基准(Zhang 等,2026b (https://arxiv.org/html/2606.11909#bib.bib36);Fu 等,2025 (https://arxiv.org/html/2606.11909#bib.bib37));WebArena、SWE-bench 和 Claw-Eval-Live 在网页、软件或工作流环境中评估智能体(Zhou 等,2024 (https://arxiv.org/html/2606.11909#bib.bib52);Jimenez 等,2024 (https://arxiv.org/html/2606.11909#bib.bib53);Li 等,2026 (https://arxiv.org/html/2606.11909#bib.bib56))。A2Eval 更接近于基准优化,因为它重新组织现有的具身 VLM 基准以实现更紧凑和高效的评估(Zhang 等,2026a (https://arxiv.org/html/2606.11909#bib.bib1))。表1 (https://arxiv.org/html/2606.11909#S1.T1) 总结了对比情况。 ## 3 Embodied-BenchClaw ### 3.1 概览 Embodied-BenchClaw 是一个面向 VLM 驱动的具身空间智能的自动化基准构建框架。给定一个高层用户请求,Embodied-BenchClaw 首先与用户交互,明确目标能力范围、推荐的数据源、评估设置和模型名录。在用户确认构建计划后,Embodied-BenchClaw 调用可复用技能、专家模板、能力卡片和质量反馈机制来构建完整的基准包。 Embodied-BenchClaw 的输出并非孤立问题的集合,而是一个基准包,包含基准题目、元数据、证据记录、参考答案、评分协议、模型响应、排行榜、诊断报告和更新建议。这种设计使得构建的基准既能支持即时 VLM 评估,也能支持后续的基准精炼。 图3 (https://arxiv.org/html/2606.11909#S3.F3) 展示了整体工作流。Embodied-BenchClaw 将基准构建组织为五个自动化阶段,同时可复用的技能库在这些阶段中提供可执行的构建操作。在阶段边界设置质量门,用于检测构建错误、追溯原因,并在必要时触发局部修复。以下小节首先总结五阶段工作流,然后介绍技能库和过程质量控制机制。
相似文章
ESI-Bench:迈向闭环感知-行动的具身空间智能
介绍了 ESI-BENCH,这是一个基于 OmniGibson 构建的全面具身空间智能基准,涵盖 10 个任务类别和 29 个子类别。实验表明,主动探索显著优于被动方法,失败主要源于行动盲视而非感知,揭示了模型与人类相比的元认知差距。
空间中的自我:无人机具身智能中自我意识与空间认知的基准测试
本文介绍了SIS-Bench,一个用于通过多模态大语言模型评估无人机具身智能中自我意识与空间认知的基准,并探索了运动感知表示以提升性能。
VABench: 通过视觉演示、主动感知和度量控制来测量具身空间智能
VABench 引入了一个基准,通过测试模型在视觉演示和主动感知下观察、推理和行动的能力,来评估模型中的具身空间智能。它表明主动摄像头控制提高了任务成功率,但没有模型能完成长期任务。
具身算子与基准测试:迈向可复用和可部署的具身智能系统
本文定义具身算子为具身智能流水线中的可复用功能模块,提出一个涵盖五大类别的分类体系,并构建了一个多维基准框架来评估其可部署性和可组合性。
SpatialClaw: 重新思考智能体空间推理的动作接口
SpatialClaw是一个无需训练的框架,它采用代码作为动作接口,使视觉语言模型能够进行灵活、有状态的空间推理,在多种3D/4D空间推理任务上取得了卓越性能。