CLAP:通过语言-动作对齐实现从VLM到VLA的直接适配

arXiv cs.AI 论文

摘要

CLAP提出了一种方法,通过将自然语言动作描述前置到动作标记序列中,将预训练的视觉-语言模型(VLM)转换为视觉-语言-动作模型(VLA),无需改变架构即可保留语义能力。该方法在LIBERO上达到90.8%,并提升了鲁棒性。

arXiv:2607.08974v1 公告类型:跨域 摘要:视觉-语言-动作模型(VLA)继承了预训练VLM的语义能力,然而,在机器人数据上进行的大规模后训练和架构修改会极大地重塑主干网络,以至于难以分离VLM对控制的贡献。在不进行重大架构更改的情况下,直接将预训练的VLM转换为VLA,为理解VLM能力如何在模型规模间迁移提供了一条更清晰的路径。核心障碍是输出分布不匹配:将动作预测为裸数值标记序列会使生成偏离VLM预训练的语言分布,从而削弱我们试图保留的能力。为了解决这一问题,我们提出了CLAP(因果语言-动作预测),该方法将每个数值动作序列前置一个自然语言动作描述,在不修改主干架构的情况下,通过语言-动作规划因果地约束精确动作标记的预测。仅通过单轮微调,2B参数的CLAP在LIBERO上达到了90.8%(比VLA-0提高了14.9个百分点),并在语言、物体和空间扰动下提升了LIBERO-PRO上的鲁棒性。我们将发布0.8B、2B和4B参数的CLAP,作为来自单一VLM谱系的开源权重、多尺度紧凑VLA系列,从而实现对VLM到VLA能力迁移的受控分析。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:56

# CLAP:通过语言-动作接地实现从 VLM 到 VLA 的直接适配

来源:https://arxiv.org/html/2607.08974

Yuri Ishitoya,御茶水女子大学 & Jeremy Siburian¹¹footnotemark:1,²²footnotemark:2 东京大学 & Masashi Hamaya OMRON SINIC X Corp  
Kuniaki Saito OMRON SINIC X Corp\. & Cristian C\. Beltran\-Hernandez OMRON SINIC X Corp\. & Mai Nishimura¹¹footnotemark:1 OMRON SINIC X Corp  
\{masashi\.hamaya, kuniaki\.saito, cristian\.beltran, mai\.nishimura\}@sinicx\.com

###### 摘要

视觉-语言-动作模型(VLA)继承了预训练 VLM 的语义能力,然而在机器人数据上进行的大规模后训练以及架构修改可能会极大地改变主干网络,以至于难以分辨 VLM 对控制的实际贡献。通过最小的架构改动直接将预训练 VLM 转换为 VLA,提供了一条更透明的路径,用于理解 VLM 能力如何跨模型规模迁移。核心障碍在于输出分布不匹配:将动作预测为裸数值 token 序列使得生成远离 VLM 预训练的语言分布,从而削弱了我们希望保留的能力。为了解决这个问题,我们提出了 CLAP(因果语言-动作预测),它在每个数值动作序列前添加一个自然语言动作描述,以因果方式将精确的动作 token 预测建立在语言-动作计划之上,无需修改主干架构。仅通过单周期微调,2B 的 CLAP 在 LIBERO 上达到 90.8%(比 VLA-0 高 14.9 个百分点),并且在 LIBERO-PRO 上,面对语言、物体和空间扰动时表现出更强的鲁棒性。我们以 0.8B、2B 和 4B 规模释放了 CLAP,作为一个来自单一 VLM 谱系的开源权重、多尺度紧凑型 VLA 家族,从而支持对 VLM 到 VLA 能力迁移的可控分析。

> 关键词:视觉-语言-动作模型,机器人操作

## 1 引言

视觉-语言模型(VLM)的快速发展不断扩展着机器人感知和推理的能力,但将这些能力迁移到机器人控制仍然异常困难。视觉-语言-动作模型(VLA)处于视觉-语言建模和机器人学习的交叉点,通过在机器人演示上微调预训练 VLM 来实现这种迁移 [17, 3, 29]。最近的系统通过离散化动作 token、学习动作专家或扩散动作头改进了动作预测 [17, 14],但每增加一个组件,都使 VLA 在架构和训练分布上离底层 VLM 更远。这种架构和数据层面的复杂性使得很难分离出预训练 VLM 对控制的实际贡献,从而限制了系统性的能力分析以及更广泛 VLM 社区进步的迁移。

*怎样才能让 VLA 研究像 VLM 研究一样易于开展?* VLM 到 VLA 适配中的一个核心复杂性来源是*输出分布不匹配*:标准的 VLA 微调训练一个预训练用于生成语义结构语言的 VLM,让它转而生成诸如 `4 12 98 3 0 0` 这样的裸动作 token 序列。这些 token 几乎不包含预训练期间所见到的语言或空间结构,因此学习动作可能会退化支持语义泛化的表征。这种未解决的不匹配对于紧凑型 VLA 尤为重要,因为它们使用轻量级 VLM 主干以实现高效部署,但在微调过程中可能对分布偏移更敏感 [22, 27]。最近的无架构改动 VLM-to-VLA 工作为避免单独的动作专家提供了更干净的研究环境,但现有方法要么预测裸动作 token [9],要么用纯语言描述替代数值动作 [11]。这些选择在直接可执行性和与 VLM 预训练语言分布的对齐之间留下了权衡。

参照图注
图 1:CLAP 通过在数值动作 token 前添加自然语言动作描述,将预训练 VLM 直接转换为可部署的 VLA,使得每一步预测都更接近 VLM 的预训练分布。CLAP 无需动作专家或架构改动。

为了解决这种不匹配,我们提出了 CLAP(因果语言-动作预测),这是一种轻量级的 VLM-to-VLA 微调方案,它将动作预测重新定义为语言条件化的动作生成。CLAP 并非直接预测裸动作 token 或仅用语言描述替换动作,而是在单个自回归序列中同时生成两者:在预测离散数值动作 token 之前,模型首先生成一个自然语言动作描述,例如“向前移动,向右倾斜,并闭合夹爪”。由于整个序列是自回归生成的,因果注意力使得数值动作 token 依赖于前面的语言描述,使其成为一个条件化中间步骤而非辅助预测。CLAP 不需要动作专家、词汇修改、架构改动或手动标注,同时保留可执行的数值动作 token 以实现精确控制。我们使用 0.8B、2B 和 4B 参数的紧凑型 Qwen3.5 主干 [19],在操作、鲁棒性和能力迁移分析方面评估了 CLAP。在 LIBERO 上,2B 的 CLAP 通过单周期微调达到了 90.8% 的成功率,在相同条件下超过 VLA-0 14.9 个百分点,并接近完全训练的 VLA-0 的性能,表明语言-动作前缀显著提高了学习效率。在 LIBERO-PRO 上,CLAP 在指令、物体和空间扰动下提高了鲁棒性,表明前缀的益处不限于分布内模仿。在 VLABench 上,2B 主干在大多数能力维度上表现最强,同时也生成了最强的 CLAP 策略,表明在紧凑模型范围内,参数量本身并非决定迁移质量的唯一因素。综合这些评估,CLAP 不仅提供了一种高效的紧凑型 VLA 方案,而且为研究 VLM 能力如何迁移到机器人控制提供了一个可控环境。总之,我们的主要贡献是 **CLAP**:一种最小化的 VLM-to-VLA 方案,仅改变输出表示,联合生成语言-动作描述和动作 token,无需动作专家、词汇修改或架构改动。与轻量级设计一致,CLAP 在 8 个 GPU 上、6.5 小时内,在 0.8B、2B 和 4B 模型规模下均可在 LIBERO 上达到 ≈90% 的成功率。我们将在论文发表后释放权重和代码。

## 2 相关工作

#### 视觉-语言-动作模型与动作表示。
视觉-语言-动作(VLA)模型通过结合互联网规模的视觉-语言预训练与机器人演示上的行为克隆 [4, 33, 24],将预训练的视觉-语言模型(VLM)[13, 16, 1] 适配到机器人控制。一个核心设计选择是如何在 VLM 内或与 VLM 并列地表示低级动作。一种策略是将连续动作离散化为 token,将机器人控制视为自回归的下一 token 预测 [14, 9, 18]。另一种是添加专用的扩散或流匹配动作头以直接生成连续动作 [17, 3, 2]。CLAP 基于自回归方向,但改变了输出表示本身:不在动作 token 前预测裸离散动作 token,而是插入一个语言-动作前缀,无需添加动作专家。

#### 语言接地与中间推理。
先前的工作使用语言、可供性和中间推理痕迹来使机器人策略在语义上更具结构性。一条工作线是基于自然语言条件化操作策略或高层计划,通常通过学习到的可供性或具身多模态表征来接地指令 [23, 5, 12, 8]。最近的 VLA 方法将语言或类似痕迹的中间表示向动作预测进一步推进。VLM2VLA [11] 直接将动作表示为自然语言文本,改善了与 VLM 预训练分布的对齐,但限制了低级控制精度。具身推理方法如 ECoT [28]、ECoT-Lite [6] 和 TraceVLA [31] 依赖辅助中间表示,包括推理 token 和视觉痕迹,然后进行动作生成,但通常会增加额外的监督、提示或推理时间开销。LAP [29] 将语言-动作描述用作预训练信号,但最终动作生成仍依赖动作专家。相比之下,CLAP 将语言-动作描述直接放在最终自回归策略输出中,在那里它条件化后续离散动作 token,同时保留可执行的数值控制。

#### 能力保留。
在机器人动作数据上微调 VLM 可能会破坏预训练的表征,退化多模态理解、空间推理和泛化等能力 [7, 10]。一条工作线通过在策略学习期间隔离或保护 VLM 来解决这一问题。Knowledge Insulation [7] 阻止来自动作专家的梯度,FLOWER [21] 通过中间融合流变换器将动作生成与 VLM 解耦,GenVLA [10] 使用双编码器设计配合视觉-语言联合训练。这些方法改善了保留能力,但引入了额外的模块、训练目标、梯度阻断方案或联合训练数据。CLAP 则相反,它探讨是否可以通过仅改变输出表示,同时保持 VLM 架构和训练目标不变,来改善能力保留的 VLM-to-VLA 适配。

#### 紧凑型 VLA。
能力保留对于紧凑型 VLA 尤为重要,因为必须平衡高效部署与有限模型容量之间。SmolVLA [22]、TinyVLA [27] 和 VLA-Adapter [25] 通过轻量级主干、基于适配器的微调或专门的策略模块提高了效率。然而,它们要么专注于特定的模型规模,要么依赖于额外的策略/动作组件。相比之下,CLAP 在 0.8B、2B 和 4B 的 Qwen3.5 主干上应用相同的保持架构的方案,从而支持在紧凑尺度上对 VLM 到 VLA 迁移进行可控分析。

## 3 初步知识

给定图像观察 \(o\) 和自然语言指令 \(l\),自回归 VLA 通过预测动作序列来建模机器人策略 \(\pi_{\theta}\)。每个 \(h\) 步动作块 \(\bm{a} = (a_{1}, \dots, a_{h})\) 由 \(h\) 个连续的 7-DoF 命令组成,其中每个 \(a_{t} \in \mathbb{R}^{7}\) 编码末端执行器的平移、旋转和夹爪状态。遵循先前工作 [9],每个动作维度被离散化为 \(K=1000\) 个整数 bins,并使用 VLM 现有词汇表表示为文本 token。策略自回归地预测扁平化的动作 token 序列:

\[
\pi_{\theta}(a \mid o, l) = \prod_{i=1}^{7h} \pi_{\theta}(a^{(i)} \mid a^{(<i)}, o, l)
\tag{1}
\]

其中 \(a^{(i)}\) 是扁平化序列中的第 \(i\) 个动作 token。标准 VLA 微调(例如 VLA-0)[9] 直接优化这个目标。然而,由于裸动作 token 序列(如 `408 980 166 319 505 491 1000`)在语言结构上与 VLM 预训练分布相去甚远,这会驱使模型远离其预训练表示。我们在图 2 中可视化这一对比。

## 4 CLAP

CLAP 是一种保持架构的方案,它通过在离散动作 token 之前添加因果语言-动作描述来改变输出表示。整个序列是自回归生成的,因此动作 token 在语言描述的条件下产生。

#### 语言-动作模板。
对每个动作块,CLAP 使用一个固定模板来生成自然语言描述 \(d\),该模板同时编码意向运动与精确的数值目标。模板包含每个时间步的意向描述(例如 “向后移动 0.5 cm”)和概括性动作意图。然后数值动作 token 跟随其后。

> 用户指令:抓住立方体并将其放到盘子上。
> 语言-动作预测:向后移动 0.5 cm,向上移动 3.5 cm,向左移动 0.4 cm,向左倾斜 1 度,向后倾斜 1 度,逆时针旋转 3 度,张开夹爪 408 980 166 319 505 491 1000 407 980 159 312 496 486 1000 406 980 152 303 486 479 1000 406 981 150 300 489 480 1000 407 980 149 294 484 483 1000 408 980 146 289 482 480 1000 410 979 144 287 486 483 1000 412 978 137 277 484 479 1000

表 1:CLAP 输出序列示例。给定指令、系统消息和图像观察,CLAP 首先生成一个固定模板的语言-动作前缀,总结预期的 \(h\) 步运动,然后生成用于执行的离散数值动作 token。前缀提供了一个基于观察和指令的结构化中间变量,而数值 token 编码了每一步的精确 7-DoF 命令。

#### 联合生成与训练。
给定从模板派生的前缀,CLAP 训练模型预测一个拼接的序列:语言-动作描述 token 后接数值动作 token。我们优化标准的自回归交叉熵目标:

\[
\mathcal{L}_{\text{CLAP}} = -\mathbb{E}_{(o, l, a) \sim \mathcal{D}} \left[ \log \pi_{\theta}(\tilde{d} \mid o, l) + \log \pi_{\theta}(\tilde{a} \mid o, l, \tilde{d}) \right],
\tag{3}
\]

其中 \(\mathcal{D}\) 是机器人演示数据集,\(T\) 是固定模板。由于序列是自回归生成的,每个动作 token 因果地关注前面的语言-动作前缀,使得前缀成为一个条件化中间变量而非独立的辅助输出。CLAP 对语言 token 和动作 token 使用相同的 VLM 主干、分词器、输出头和交叉熵损失,不引入动作专家、辅助头或词汇扩展。

#### 动作掩码增强。
我们考虑一种可选的增强,它改变教师强制输入上下文而不改变 CLAP 目标序列。具体来说,我们随机将输入动作 token 的一个子集替换为“?”占位符,同时保留原始 token 作为预测目标。因此,模型必须从图像观察、指令、语言-动作前缀和剩余动作上下文中推断出被掩码的值。对于每个样本,掩码比例从 \(\mathrm{Uniform}(0, p_{\max})\) 中采样,有 40% 的概率不应用掩码。完整细节见附录。我们在第 5.2 节研究了掩码的效果;除非另有说明,CLAP 使用未掩码配置。

## 5 实验

### 5.1 实验设置

#### 基准测试。
我们在三个基准上评估 CLAP,分别针对 VLA 性能的不同方面:(1) 分布内操作,(2) 分布外鲁棒性,(3) VLM 能力迁移。

相似文章

LabVLA:在科学实验室中落地视觉-语言-动作模型

Hugging Face Daily Papers

LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。