具身算子与基准测试:迈向可复用和可部署的具身智能系统

arXiv cs.AI 论文

摘要

本文定义具身算子为具身智能流水线中的可复用功能模块,提出一个涵盖五大类别的分类体系,并构建了一个多维基准框架来评估其可部署性和可组合性。

arXiv:2607.03283v1 Announce Type: new 摘要:具身智能系统不仅需要端到端策略模型,还需要可复用的功能模块,将多模态观测、机器人状态、人类示教和任务上下文转换为结构化表示、决策、轨迹、控制参考和系统服务。本文将这些模块定义为具身算子,并将其作为具身智能流水线中独立但可组合的单元进行研究。我们明确了其定义边界,强调任务语义、标准化输入输出接口、可部署性、可复用性和多层可优化性。我们进一步构建了一个涵盖五大类别的分类体系:检测与分割、空间定位与三维理解、手部运动恢复、具身基础模型与任务决策算子,以及规划、控制与系统支持算子。针对每个类别,我们总结了代表性功能、技术范式、应用角色和实际局限性。除分类体系外,我们提出一个多维基准框架,从正确性、端到端效率、资源使用、时间稳定性、可移植性、接口兼容性、部署可靠性和下游任务效用等方面评估具身算子。我们还讨论了工作流级算子加速,以及算子组合、数据标准化、世界模型、VLA安全、边缘部署和实际应用价值等方面的开放挑战。总体而言,本文认为具身算子应作为整体可部署组件进行优化和评估,从而为可复用、可扩展、可验证的具身智能系统奠定基础。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:34

# 具身算子与基准评测:面向可复用、可部署的具身智能系统  
来源:https://arxiv.org/html/2607.03283  
\newcolumntype L[1]>{\arraybackslash}p{#1}\newcolumntype C[1]>{\arraybackslash}p{#1}\newcolumntype Y>{\arraybackslash}X{1}]  
AI Infra Team at JDT  
清华大学  
天津大学  
北京航空航天大学  
\contribution 完整作者列表见贡献部分(2026年7月3日)  

###### 摘要  

具身智能系统不仅需要端到端的策略模型,还需要大量可复用的功能模块,这些模块将多模态观测、机器人状态、人类演示和任务上下文转化为结构化表示、决策、轨迹、控制参考和系统服务。本文将这类模块定义为**具身算子**,并将其作为具身智能流水线中独立但可组合的单元进行研究。我们首先明确具身算子的定义边界,强调其任务语义、标准化输入/输出契约、可部署性、可复用性和多层可优化性。随后构建一个涵盖五大类别的分类体系:检测与分割算子、空间定位与三维理解算子、手部运动恢复算子、具身基础模型与任务决策算子,以及规划、控制与系统支持算子。针对每个类别,我们总结了在面向操作的具身系统中具有代表性的功能、技术范式、应用角色和实际局限性。除了算子的分类体系,我们还进一步提出了一个面向具身算子的多维基准框架。与传统的单一模型评估不同,所提出的基准考虑了正确性、端到端效率、资源使用、时间稳定性、可移植性、接口兼容性、部署可靠性以及下游任务效用。我们还从工作流层面讨论了算子加速策略,并分析了算子组合、数据标准化、世界模型、VLA安全性、边缘部署和实际应用价值等方面面临的开放性挑战。总体而言,本文认为具身算子应作为整体可部署的组件而非孤立的神经网络进行优化和评估,从而为可复用、可扩展且可验证的具身智能系统奠定基础。  

\correspondence 熊俊武  

## 1 引言  

具身智能旨在使物理或仿真机器人代理能够感知环境、理解任务上下文,并通过具身执行进行交互。近年来,视觉-语言-动作模型、机器人学习数据集、仿真平台和开源机器人学习系统的进展显著增强了具身代理的能力[liu2025aligning, kim24openvla, team2024octo, black2024pi_0, bjorck2025gr00t, o2024open, khazatsky2024droid, cadene2026lerobot]。然而,高质量的具身智能系统不能仅依赖端到端的策略模型。在实际的流水线中,数据收集、演示理解、场景重建、机器人学习、任务决策和机器人执行等环节需要大量可复用的功能模块,将原始多模态信号和中间系统状态转化为结构化表示、决策和可执行输出。在本文中,我们将这类可复用的功能模块称为**具身算子**。  

与低层张量计算原语不同,一个具身算子是一种可部署的功能单元[mayoral2022robotcore],具有明确的任务语义、标准化的输入/输出接口以及可测量的性能特征[mayoral2024robotperf]。在具身数据收集和机器人执行中,这些算子扮演着核心角色,将RGB图像、深度观测、视频、点云、机器人状态、语言指令和人类演示转化为可用的标注、表示、规划和控制信号。典型输出包括手部边界框、手部掩码、物体位姿、相机轨迹、深度图、重建场景、手部关键点、手部运动轨迹、动作提议、抓取位姿、无碰撞轨迹、控制器参考以及系统消息。这些输出为下游任务(如演示解析、操作策略学习、模仿学习、仿真资产构建、任务规划和闭环机器人执行)提供了必要支持。  

本白皮书聚焦于面向操作的具身智能流水线中频繁使用的一组核心具身算子。我们首先明确具身算子的定义和边界,并构建一个面向具身智能工作流中算子的分类体系。然后分析手-物检测与分割算子——它们从视觉观测中识别手、物体和交互区域,为人类演示理解和以交互为中心的数据标注提供关键线索。这一讨论涵盖其方法论分类、评估标准以及保持质量的加速策略。接下来,我们考察空间定位与三维理解算子,包括基于SLAM的定位、物体级位姿估计、深度预测、场景重建和稠密地图构建。进一步讨论手部运动恢复算子,重点关注其问题形式化、输入/输出格式、代表性模型范式,以及重建质量和效率方面的关键局限性。此外,我们回顾了具身基础模型和任务决策算子,包括视觉-语言模型、视觉-语言-动作模型和世界模型。还介绍了规划、控制与系统支持算子,包括抓取规划、轨迹规划、碰撞检测、ROS 2适配、数据传输和异构调度。最后,我们提出了一个多维基准,用于从功能和系统两个层面评估具身算子。  

将具身算子作为独立但可组合的功能单元进行研究,其动机有二。第一,具身智能系统需要可靠的中间表示和可执行输出,而不仅仅是最终的策略预测。手部定位误差、掩码质量、物体位姿估计、深度预测、手部运动恢复、动作生成、轨迹规划、碰撞检测或系统同步中的错误,都会直接传播到下游学习或执行模块,降低任务性能。第二,实际部署不仅受预测精度的约束,还受运行时效率、内存压力、时间稳定性、坐标与时间戳一致性、跨硬件兼容性、故障恢复能力和集成成本的影响。因此,具身算子应从系统级视角进行评估,同时考虑表示质量、计算开销、执行可靠性和下游可用性。  

本文的核心主张是:具身算子应作为整体的功能单元而非孤立的神经网络进行优化和评估。一个有用的算子不仅应达到强大的基准精度,还应提供标准化的接口、稳定的输出、可控的失败行为、高效的运行时性能,以及与上下游模块清晰的兼容性。这一观点对于构建可复用的具身算子库尤为重要,其中感知、定位、重建、运动恢复、任务决策、规划、控制、通信和运行时支持模块必须集成到可重现、可扩展的工作流中。  

本文的主要贡献总结如下:  

- • 定义了具身算子的概念和边界,并构建了一个连接视觉感知、空间理解、人与动作理解、具身基础模型、任务决策、规划、控制和系统支持的分类体系。  
- • 系统综述了手-物检测与分割算子,包括任务形式化、代表性技术范式、评估指标以及保持质量的加速策略。  
- • 分析了空间定位与三维理解算子,涵盖基于SLAM的定位、物体级位姿估计、深度预测、场景重建、稠密地图构建以及在实际具身智能场景中的局限性。  
- • 从问题定义、输入/输出表示、模型范式、重建质量、效率和开放性挑战等方面,讨论了手部运动恢复算子。  
- • 回顾了具身基础模型和任务决策算子,包括视觉-语言模型、视觉-语言-动作模型和世界模型,并讨论了它们在语义理解、动作生成和未来状态预测中的作用。  
- • 分析了规划、控制与系统支持算子,包括抓取规划、轨迹规划、碰撞检测、控制器执行、ROS 2适配、数据传输和异构调度。  
- • 提出了一个面向具身算子的多维评估视角,强调预测质量、运行时效率、时间鲁棒性、接口标准化、部署兼容性、执行可靠性和下游任务效用。  

## 2 具身算子的背景与分类  

### 2.1 定义边界  

在本文中,**具身算子**指的是在具身智能系统中执行明确定义功能的可复用计算模块。它比底层深度学习算子或硬件内核更广泛,因为其作用不限于数值计算。相反,它将感知输入、空间信息、人类行为、任务上下文、机器人状态或中间系统状态,转化为下游具身模块可以消费的表示、决策、轨迹、控制参考或系统服务。因此,一个具身算子同时承载计算语义和任务语义。其价值不仅在于产生准确的输出,还在于提供稳定的接口、可预测的运行时行为,以及对后续感知、规划、学习、控制和部署过程的可靠支持。  

具身算子的边界可以通过五个关键属性来刻画。第一,功能独立性:它完成一个明确定义的具身任务,例如分割、位姿恢复、深度估计、动作生成、抓取规划、轨迹规划、碰撞检测、消息适配或异构调度。第二,显式的输入/输出契约:其他模块可以消费其输出,而无需依赖内部实现细节。对于涉及几何或时间信息的算子,该契约可能进一步指定坐标系、时间戳、单位、置信度、约束和失败状态。第三,可复用性:能够在不同的机器人系统、数据生产工作流和应用场景中复用。第四,可部署性:以实际形式部署,例如服务、SDK、ROS 2节点[macenski2022ros2]、插件、离线处理工具或运行时组件[mayoral2022robotcore]。第五,多层可优化性:能在模型架构、计算图、底层算子、硬件内核、数据移动、序列化和运行时调度等多个层面进行优化。  

**表 1:具身算子的代表性类别及示例模块**  
| 类别 | 代表性算子 | 功能角色 |
|------|------------|----------|
| 视觉感知 | SAM2、Grounding DINO、YOLO-World、CoTracker、手部关键点检测器 | 从图像或视频中提取物体掩码、目标位置、轨迹、关键点和视觉交互区域。 |
| 空间定位与三维理解 | FoundationPose、ORB-SLAM3、Depth Anything、DUSt3R/MASt3R、VGGT、三维重建 | 估计物体位姿、相机运动、深度、场景几何和操作与导航所需的空间约束。 |
| 人与动作理解 | Dyn-HaMR、HaMeR、WiLoR[potamias2025wilorendtoend3dhand]、HaWoR[zhang2025haworworldspacehandmotion]、MANO[MANO]/SMPL重建、动作重定向 | 将人类演示转化为结构化的运动、姿态、轨迹和交互表示。 |
| 具身基础模型与任务决策 | Qwen-VL、RT-2、OpenVLA、π₀、VLA模型、世界模型 | 将视觉观测、语言指令、机器人状态和历史上下文映射为规划、动作或预测的未来状态。 |
| 规划、控制与系统支持 | Contact-GraspNet、AnyGrasp、MoveIt 2、cuRobo、ROS 2/NITROS、异构调度 | 将感知和决策输出转化为可执行的机器人行为,同时协调通信和计算资源。 |

### 2.2 具身算子的分类  

从具身智能工作流的角度,具身算子可以分为五个代表性类别。第一类是**视觉感知算子**,包括物体检测、图像与视频分割、目标跟踪和关键点检测。这些算子将原始视觉观测转化为语义线索、空间区域和与交互相关的信息,供下游模块使用。第二类是**空间定位与三维理解算子**,包括深度估计、6D位姿估计、SLAM、点云处理、三维重建、占用率预测和视觉里程计。这些算子使机器人能够推断物体位置、相机或机器人运动,以及周围环境的几何结构。第三类是**人与动作理解算子**,包括人体姿态估计、手部重建、运动恢复、动作识别、动作分割和动作重定向。这些算子对于将人类演示转化为结构化轨迹和可复用的机器人学习数据至关重要。第四类是**具身基础模型与任务决策算子**,包括视觉-语言模型、视觉-语言-动作模型、世界模型、任务规划器和动作生成器。这些算子连接高层指令理解、场景推理、未来状态预测和机器人动作生成。第五类是**规划、控制与系统支持算子**,包括抓取规划、轨迹规划、碰撞检测、控制器执行、ROS 2消息适配、数据传输和异构调度。这些算子将感知和任务决策输出转化为可行的机器人行为,同时协调执行所需的计算和通信资源。  

尽管第四类和第五类密切相关,但它们扮演着不同的功能角色。具身基础模型和任务决策算子主要决定**应该执行什么**动作或任务,而规划、控制与系统支持算子则决定在运动学、动力学、碰撞、通信和运行时约束下**如何执行**该动作。这些类别并非孤立,而是通常组合成完整的具身工作流[o2024open, cadene2026lerobot]。在一个机器人操作流水线中,物体检测算子可能首先识别目标,分割算子提取其掩码,位姿估计算子恢复其6D位姿,VLA模型或任务规划器生成动作提议。随后,抓取规划、轨迹规划、碰撞检测和控制算子将提议转化为可执行的机器人运动。与此同时,ROS 2适配[macenski2022ros2]、数据传输和异构调度算子协调整个流程的执行。

相似文章

ESI-Bench:迈向闭环感知-行动的具身空间智能

Hugging Face Daily Papers

介绍了 ESI-BENCH,这是一个基于 OmniGibson 构建的全面具身空间智能基准,涵盖 10 个任务类别和 29 个子类别。实验表明,主动探索显著优于被动方法,失败主要源于行动盲视而非感知,揭示了模型与人类相比的元认知差距。