SurgVLA-Bench:面向腹腔镜手术机器人视觉-语言-动作模型评估的基准

arXiv cs.AI 论文

摘要

SurgVLA-Bench是首个用于评估腹腔镜手术机器人视觉-语言-动作模型的综合基准,利用SurRoL仿真平台评估动作准确性和语义一致性。

arXiv:2606.29247v1 公告类型:新 摘要:视觉-语言-动作(VLA)模型代表了手术机器人领域中具身智能的一个有前景的方向。尽管通用机器人领域已有许多VLA基准,但专门针对手术场景的标准化评估平台仍然缺失。为解决这一局限,我们提出了SurgVLA-Bench,这是首个用于评估腹腔镜手术机器人VLA模型的综合基准。利用SurRoL仿真平台,我们构建了一个从原子动作到完整手术流程的分层任务分类体系,并辅以评估动作准确性和语义一致性的多维度评估框架。随后,我们系统评估了两种代表性范式,包括自回归模型(如OpenVLA)和流匹配模型(如$\pi_{0}$、$\pi_{0.5}$和SmolVLA)。实验表明,自回归模型在语义理解方面表现优异,而流匹配模型通常具有更高的任务精度,但可能面临泛化方面的权衡。然而,即使是最佳模型仍远未达到令人满意的水平,因为受限的内窥镜视野、狭窄的视角以及频繁的遮挡仍然是基本的物理瓶颈。代码和数据可在 https://github.com/VCL-HNU/SurgVLA 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:33

# SurgVLA-Bench:面向腹腔镜手术机器人视觉-语言-动作模型评估基准
来源:https://arxiv.org/html/2606.29247

11国家机器人视觉感知与控制技术工程研究中心,中国  
22湖南大学卓越工程师学院,湖南,中国  
33湖南大学人工智能与机器人学院,湖南,中国  
33邮箱:SunJiashuo@hnu\.edu\.cn, liu\_min@hnu\.edu\.cn  
岳赫⋆温宣刘陶毛王嘉正陈翔刘敏†

###### 摘要

视觉-语言-动作(VLA)模型为手术机器人的具身智能带来了有前景的方向。尽管通用机器人领域已有诸多VLA基准,但专门为手术场景设计的标准评估平台仍然缺乏。为弥补这一空白,我们提出SurgVLA-Bench,这是首个用于评估腹腔镜手术机器人中VLA模型的综合基准。基于SurRoL仿真平台,我们构建了从原子动作到完整手术过程的层级任务分类体系,并辅以评估动作精度和语义一致性的多维度评估框架。然后,我们系统评估了两种代表性范式,包括自回归模型(如OpenVLA)和流匹配模型(如π₀、π₀.5和SmolVLA)。实验表明,自回归模型在语义理解方面表现优异,而流匹配模型通常能达到更高的任务精度,但可能面临泛化权衡。然而,即使表现最好的模型也远未达到令人满意的程度,因为受限的内窥镜视野、局限的视角以及频繁的遮挡仍然是基本的物理瓶颈。代码和数据可在https://github.com/VCL-HNU/SurgVLA获取。

## 1 引言

手术机器人已日益成为现代临床实践的重要组成部分,相比传统手动操作,它们具有更高的精度、灵巧性和稳定性。然而,当前系统仍严重依赖经验丰富的外科医生进行持续遥操作,这促使人们追求更高水平的自主性。在这一背景下,视觉-语言-动作(VLA)模型[27 (https://arxiv.org/html/2606.29247#bib.bib1)]作为一种有前景的范式涌现,展示了理解语言指令、执行特定任务动作以及在不同场景间泛化的卓越能力[1 (https://arxiv.org/html/2606.29247#bib.bib32)]。这引发了一个问题:VLA模型能否使智能手术机器人理解指令并执行精确的干预操作?

VLA模型领域近期经历了显著进展。RT-2[29 (https://arxiv.org/html/2606.29247#bib.bib9)]开创性地将视觉-语言模型的输出令牌直接用作机器人动作。OpenVLA[12 (https://arxiv.org/html/2606.29247#bib.bib2)]引入了首个开源VLA框架,为后续模型开发提供了架构洞察。PaLM-E[5 (https://arxiv.org/html/2606.29247#bib.bib10)]证明了在互联网规模数据上训练VLA模型的可行性。π₀[2 (https://arxiv.org/html/2606.29247#bib.bib6)]引入了流匹配[14 (https://arxiv.org/html/2606.29247#bib.bib28)]结合多阶段训练,显示出对任务泛化的积极效果。SmolVLA[20 (https://arxiv.org/html/2606.29247#bib.bib4)]和VLA-Adapter[23 (https://arxiv.org/html/2606.29247#bib.bib11)]探索了轻量级方法以实现高效的VLA部署,而RyNN-VLA[3 (https://arxiv.org/html/2606.29247#bib.bib12)]则将具身模型与世界模型结合以增强环境理解。然而,这些模型主要针对通用场景开发,缺乏对手术场景的适用性,包括区分手术特定对象的能力、满足毫米级精度要求的能力,以及应对模型幻觉[13 (https://arxiv.org/html/2606.29247#bib.bib29)]带来的安全问题的能力。

手术自主性的研究主要依赖于任务特定方法,包括用于缝合和移物操作的模仿学习[19 (https://arxiv.org/html/2606.29247#bib.bib16),21 (https://arxiv.org/html/2606.29247#bib.bib14)]、模拟环境中的强化学习[24 (https://arxiv.org/html/2606.29247#bib.bib13),25 (https://arxiv.org/html/2606.29247#bib.bib15)]以及物理平台上的强化学习[11 (https://arxiv.org/html/2606.29247#bib.bib18)],还有用于手术场景理解的视觉-语言预训练[26 (https://arxiv.org/html/2606.29247#bib.bib17)]。尽管这些方法在其各自范围内有效,但每个方法仅解决了感知-语言-动作流水线的一个子集,没有一种方法提供统一框架来联合整合视觉理解、语言指令跟随和动作生成。在评估方面,通用机器人基准如LIBERO[15 (https://arxiv.org/html/2606.29247#bib.bib19)]、CALVIN[16 (https://arxiv.org/html/2606.29247#bib.bib20)]和RLBench[9 (https://arxiv.org/html/2606.29247#bib.bib21)]通过提供标准任务套件和可重复的评估协议,对推动VLA研究起到了重要作用。在手术领域,数据集如Cholec80[22 (https://arxiv.org/html/2606.29247#bib.bib24)]和CholecT50[17 (https://arxiv.org/html/2606.29247#bib.bib23)]推动了技能评估和场景识别,但它们侧重于理解而非闭环动作生成。目前尚无现有基准能同时在手术环境中评估视觉感知、语言指令跟随和动作生成。

为填补这一空白,我们提出SurgVLA-Bench,旨在探索VLA模型理解外科医生指令并在手术场景中执行精确干预的能力。这是首个专门为手术场景设计的VLA评估基准。基于SurRoL[24 (https://arxiv.org/html/2606.29247#bib.bib13)]平台,我们的基准涵盖从原子动作任务到复合手术程序片段的综合评估套件。

我们的主要贡献总结如下:

1.  我们提出SurgVLA-Bench,这是首个手术VLA模型基准,具有从原子动作到完整程序的层级任务分类体系,并基于包含手术器械和多器官解剖结构的模拟环境构建。
2.  我们构建了一个全面的标准化数据集,支持多种主流格式(RLDS[18 (https://arxiv.org/html/2606.29247#bib.bib25)]、LeRobot[7 (https://arxiv.org/html/2606.29247#bib.bib26)]等),便于研究社区直接采用和扩展。
3.  我们对四种代表性VLA模型[12 (https://arxiv.org/html/2606.29247#bib.bib2),20 (https://arxiv.org/html/2606.29247#bib.bib4),8 (https://arxiv.org/html/2606.29247#bib.bib8),2 (https://arxiv.org/html/2606.29247#bib.bib6)]进行基准测试,分析其在手术场景中的局限性,并识别未来研究的关键挑战。

## 2 基准构建

### 2.1 任务

手术过程本质上是层级化的:临床工作流程将基本动作组合成复杂操作,不同层级对能力提出不同要求。为系统评估VLA模型在手术场景中的表现并识别其能力瓶颈,我们设计了一个临床相关的层级评估系统,包含八个任务。根据复杂度,任务分为三个层级(图1 (https://arxiv.org/html/2606.29247#S2.F1))。设计遵循三个原则:(1)难度逐步递增;(2)覆盖典型手术操作;(3)支持独立评估VLA的不同能力维度。每个层级针对不同的能力:第一层级关注动作精度,第二层级关注目标区分和指令跟随,第三层级关注多步规划和空间定位。

参照图注图1:SurgVLA-Bench概览。左侧面板展示了微调和部署流程:预训练的VLA模型通过LoRA进行微调,并部署在SurRoL仿真环境中。右侧面板展示了层级任务分类体系,涵盖三个难度级别:原子任务、条件任务和复合任务。第一层级:原子任务。场景中仅包含一个目标物体,无干扰物,语言指令直接且无歧义。该层级主要评估动作精度和基本控制能力。包括三个任务:纱布拾取(T1-1)和针拾取(T1-2),模拟手术消耗品的基本抓取;以及电凝(T1-3),模拟对目标组织部位进行接触式电灼。

第二层级:条件任务。场景中包含干扰物,或者目标物体本身存在多个混淆因素,要求模型根据语言指令准确识别操作目标。该层级主要评估目标区分能力和指令跟随准确性。包括:纱布拾取(T2-1)和针拾取(T2-2),它们在对应的第一层级任务基础上,在场景中引入了视觉上相似的干扰物;以及血管夹闭(T2-3),模拟在多个候选部位中,对指定血管段放置止血夹。

第三层级:复合任务。模型必须完成完整的操作流程,将物体放置到指定的目标位置。该层级主要评估多步顺序执行能力和精确的空间定位能力。包括:拾取与放置(T3-1),要求抓取目标物体并将其转移到指定位置;以及止血(T3-2),模拟完整的止血流程,包括依次进行纱布抓取、运输并放置到器官表面的出血点上。

### 2.2 数据集构建

为支持SurgVLA-Bench的评估,我们构建了一个专门的手术任务数据集。与通用机器人领域不同(那里有现成的开源大规模数据集如Open X-Embodiment[18 (https://arxiv.org/html/2606.29247#bib.bib25)]可用于VLA模型训练和评估),手术领域目前缺乏适合此用途的标准化数据集。因此,我们基于SurRoL[24 (https://arxiv.org/html/2606.29247#bib.bib13)]仿真环境中的任务场景从头开始收集和构建数据集。

数据收集。我们收集了第2.1节中定义的八个任务的所有轨迹,按三个难度级别组织成三个数据集。以T3-2为例,数据收集过程如图2 (https://arxiv.org/html/2606.29247#S2.F2)所示。我们在预定义区域内随机放置目标,并根据物体的位置沿预设轨迹执行指定动作。每条轨迹包含RGB图像、深度图像、机器人自身状态以及相应的动作序列。为保持一致性,所有RGB图像以[3 × 224 × 224]的分辨率捕获。总计,我们在全部八个任务中收集了超过800条完整轨迹,包含约40,000个动作帧,每条轨迹都经过人工验证以确保动作质量。由于此阶段的主要目标是验证VLA模型在基准上的基本可行性,我们为每个任务采用了简洁且无歧义的指令描述(见图1 (https://arxiv.org/html/2606.29247#S2.F1)),确保语言指令与任务目标之间有清晰的对应关系。此外,我们开发了一个集成数据收集流水线,使未来的开发者能够根据需要扩展数据集规模。我们以LeRobot[7 (https://arxiv.org/html/2606.29247#bib.bib26)]、RLDS[18 (https://arxiv.org/html/2606.29247#bib.bib25)]和3D点云格式提供数据,以便不同VLA范式直接采用。

参照图注图2:数据采集流水线与数据集组成。夹爪状态表示。为缓解原始脉冲式夹爪信号的稀疏性,我们将夹爪动作从瞬时变化值转换为连续状态值(即持续输出闭合或开启信号),这显著提高了训练效率。

### 2.3 仿真环境

我们基于SurRoL仿真平台构建手术模拟场景。首先,我们整合了多个高保真解剖器官模型,包括肝脏、肾脏和静脉血管网络,并将其与SurRoL平台现有的器械模型相结合,构建多样化的手术场景。为增强解剖学真实感,我们确保所有器官模型保持准确的解剖比例。除了任务场景中使用的器官模型外,我们还提供了一个额外的腹腔器官模型库,覆盖主要的腹腔内器官,便于开发者未来进行扩展。

此外,SurRoL原生使用PyBullet[4 (https://arxiv.org/html/2606.29247#bib.bib34)]物理引擎,其接触检测主要针对刚体设计,对于模拟可变形物体的效果有限。因此,我们优化了抓取机制,以应对PyBullet在可变形物体方面的局限性。受真实世界实验启发,我们用一个任务特定的绑定机制取代了基于物理的接触检测,当从真实世界观测中推导出的空间和运动学条件同时满足时触发抓取,从而产生更真实地反映真实手术机器人行为的操作结果。

## 3 实验

### 3.1 实现细节

模型选择。为全面评估VLA模型在手术场景中的性能,我们选取了四个代表性的VLA模型作为基线,涵盖两种主流范式:OpenVLA[12 (https://arxiv.org/html/2606.29247#bib.bib2)],基于Prismatic-7B[10 (https://arxiv.org/html/2606.29247#bib.bib33)],代表自回归方法;π系列[8 (https://arxiv.org/html/2606.29247#bib.bib8),2 (https://arxiv.org/html/2606.29247#bib.bib6)]和SmolVLA[20 (https://arxiv.org/html/2606.29247#bib.bib4)](约0.5B参数)采用流匹配动作头,其中π₀.5添加了双层策略架构。架构细节总结于表1 (https://arxiv.org/html/2606.29247#S3.T1)。

表1:SurgVLA-Bench中评估的基线VLA模型的架构细节。实验设置。如图1 (https://arxiv.org/html/2606.29247#S2.F1)所示,我们为原子动作和模拟真实手术操作的任务设计了口语化的语言指令。指令采用自然的对话语言而非严格的医学术语表达,以促进LLM对手术场景的理解,从而最大化VLA模型中的指令跟随效果。

所有实验在4块NVIDIA A6000 GPU上进行。每个任务,每个模型执行50次独立试验。遵循先前研究[12 (https://arxiv.org/html/2606.29247#bib.bib2),20 (https://arxiv.org/html/2606.29247#bib.bib4),2 (https://arxiv.org/html/2606.29247#bib.bib6),8 (https://arxiv.org/html/2606.29247#bib.bib8)]建立的评估协议,我们报告成功率(SR)作为主要评估指标。评估采用在步数限制下的二元成功/失败判断,不设置时间约束。最大允许步数从100到300不等,具体取决于任务长度。所有评估均在静态随机初始条件下执行,即每次试验开始时,任务场景内的所有模型均被随机初始化到具有挑战性的位置。

相似文章

LabVLA:在科学实验室中落地视觉-语言-动作模型

Hugging Face Daily Papers

LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。

SmolVLA:一种经济高效的视觉-语言-动作模型

Papers with Code Trending

SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。