超越英语:揭示视觉-语言-动作模型中的多语言差距

arXiv cs.CL 论文

摘要

本文首次系统研究了视觉-语言-动作(VLA)模型中的多语言指令跟随问题,揭示了当模型基于英语训练时,在其他语言上的性能显著下降。作者提出了多语言主成分对齐(MPCA)方法来缩小多语言性能差距。

arXiv:2606.15714v1 公告类型:新发布 摘要:视觉-语言-动作模型最近在大规模多模态数据上学习通用机器人策略方面展现了有前景的能力。然而,大多数现有的VLA系统主要使用英语指令进行训练和评估,其在其他语言中理解和执行指令的能力尚未被充分探索。尽管底层的大语言模型通常具备多语言能力,但这些多语言能力是否能在训练过程中迁移到VLA模型中仍不清楚。在这项工作中,我们首次系统研究了VLA模型中的多语言指令跟随问题。我们首先通过扩展现有基准并翻译其指令来构建多语言指令。基于这些指令,我们在模拟环境中的一系列任务上评估了几个代表性的VLA模型。实验揭示了一个显著的多语言差距:主要在英语指令上训练的模型,即使底层语言主干是多语言的,在评估其他语言时也会表现出显著的性能下降。我们提供了若干发现和分析来理解多语言差距。跨语言迁移行为分析表明,性能下降与指令理解和动作执行均相关。表示分析表明,多语言指令引起的表示偏移可能导致了多语言差距。受这些发现启发,我们进一步探索了提升VLA多语言性能的策略。我们提出了一种简单而有效的多语言微调方法——多语言主成分对齐(MPCA),该方法利用主成分分析获取主成分子空间并对齐投影后的多语言表示,有效缩小了多语言性能差距。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:50

# 超越英语:揭示视觉-语言-动作模型中的多语言差距

来源:https://arxiv.org/html/2606.15714

Hongliang Li (李洪亮),Jiarui Cao (曹嘉瑞),Yang Jiang (江洋),Haonan Wen (文浩男),Kaiyu Huang (黄凯宇),Shengnan Guo (郭晟南),Huaiyu Wan (万怀宇)

北京交通大学

hanyangchen@bjtu\.edu\.cn (https://arxiv.org/html/2606.15714v1/mailto:[email protected])

guoshn@bjtu\.edu\.cn (https://arxiv.org/html/2606.15714v1/mailto:[email protected])

\(2026年6月14日\)

###### 摘要

视觉-语言-动作(VLA)模型近期在从大规模多模态数据中学习通用机器人策略方面展现出了有前景的能力。然而,现有大多数VLA系统主要基于英语指令进行训练和评估,它们在理解并执行其他语言指令方面的能力很大程度上尚未被探索。尽管底层的大语言模型通常具备多语言能力,但这些多语言能力在训练过程中是否能迁移至VLA仍不清楚。在这项工作中,我们首次对VLA模型中的多语言指令跟随进行了系统性研究。我们首先通过将现有基准测试的指令进行翻译来构建多语言指令。利用这些指令,我们在模拟环境中对多个具有代表性的VLA模型进行了一系列任务评估。我们的实验揭示了一个显著的多语言差距:主要基于英语指令训练的模型,在评估其他语言时表现出明显的性能下降,即使底层语言骨干模型具有多语言能力。我们提出若干发现和分析,以理解这一多语言差距。跨语言迁移行为分析表明,性能下降与指令理解和动作执行均相关。表征分析提示,多语言指令引起的表征偏移可能是导致多语言差距的因素之一。受这些发现的启发,我们进一步探索了改善VLA中多语言性能的策略。我们提出了一种简单而有效的多语言微调方法——多语言主成分对齐(MPCA),该方法利用主成分分析获取主成分子空间并对齐投影后的多语言表征,有效减少了多语言性能差距。我们的实验表明,MPCA可以有效提升VLA中的多语言性能,展示了其作为增强具身智能体多语言鲁棒性的实际解决方案的潜力。  
\correspondence 陈汉阳,郭晟南

参见图注

图1:VLA多语言指令跟随的评估阶段示意图。我们首先基于现有机器人基准测试构建多语言指令变体,然后进行综合评估和分析,以揭示当前VLA系统中的多语言差距,最后探索改善VLA中多语言性能的策略。

## 1 引言

视觉-语言-动作模型(VLA)近年来已成为构建通用机器人策略的一种有前景的范式\(team2024octo;kim2024openvla;black2024pi\_0;black2025pi\_;kim2025fine;cen2025rynnvla\)。通过将视觉感知、自然语言理解和动作生成集成在一个统一框架中,VLA使得机器人能够执行基于自然语言指令的复杂任务。基于视觉-语言模型(VLM),VLA将多模态理解扩展至动作生成。近期VLM的进展\(hurst2024gpt;team2024gemini;wang2024qwen2;bai2025qwen3\)通过大规模多模态预训练进一步强化了这一基础,提升了跨任务的泛化能力。因此,VLA已成为开发可扩展且灵活的具身智能体的重要研究方向。

尽管取得了这些进展,现有大多数VLA研究主要关注提升英语指令下的指令跟随能力\(karnik2024embodied;zhang2025vlabench;xu2025seeing\)和视觉接地能力\(fei2025libero;zhou2025libero\)。在训练和评估中,绝大多数VLA基准测试和数据集\(mees2022calvin;liu2023libero;li2023behavior;nasiriany2024robocasa;li2024evaluating;chen2025robotwin\)采用英语作为默认指令语言。然而,这种设定忽略了实际部署中的一个重要挑战:在全球化环境中运行的机器人必须能够理解用不同语言表达的指令。尽管许多VLA依赖多语言大语言模型作为骨干,但这些多语言能力在训练过程中是否能迁移至VLA仍不清楚。特别是,语言令牌与机器人动作之间的对齐过程可能隐式地将模型偏向英语指令,导致当指令以其他语言给出时性能下降。这引发了一个重要但尚未被充分探索的问题:在与机器人动作对齐后,VLA是否真的保留了多语言理解能力?

为了解决这一问题,有必要对VLA中的多语言指令跟随进行系统性评估。在这项工作中,我们通过三个关键阶段研究具身系统中的多语言能力,如图1 (https://arxiv.org/html/2606.15714#S0.F1)所示。

\(1\) **多语言数据集构建**:评估多语言泛化需要构建跨多种语言的指令数据,以模拟多语言交互场景。虽然底层语言模型可能具备多语言知识,但通过语言条件策略学习,这些知识是否能有效迁移至动作空间仍不确定。因此,我们通过构建多语言指令变体来扩展现有机器人数据集,从而直接比较模型在不同语言下的行为。  
\(2\) **多语言评估与分析**:除了简单测量任务成功率外,分析VLA在多语言指令下的结果可以揭示语言表示如何与动作策略交互。我们将特别考察性能在不同维度上的变化,并研究在不同语言输入下表示是否保持一致。  
\(3\) **多语言性能提升**:基于多语言评估获得的见解,我们可以进一步探索改善VLA中多语言性能的策略。

基于这些阶段,我们引入了一个针对VLA的多语言评估框架。具体来说,我们通过将现有机器人操作基准测试的指令翻译成多种语言来构建多语言指令集。我们的设计侧重于两种多语言交互设定。第一种设定是**多语言指令**,指令被翻译成不同语言,同时保留其原始语义,从而实现对多语言泛化的受控评估。第二种设定是**代码切换指令**,指令包含多语言混合表达,这在多语言通信场景中常见。这些设定使我们能够系统研究当语言输入偏离现有基准测试中常用的仅英语假设时,VLA的行为表现。

利用这一框架,我们在两个机器人基准测试LIBERO\(liu2023libero\)和SimplerEnv\(li2024evaluating\)上对多个代表性VLA模型进行了全面的实证研究。我们的实验揭示了一个明显的多语言差距:主要基于英语指令训练的模型,在评估其他语言时表现出明显的性能下降。此外,我们分析了不同基础模型、套件、交互设定和动作头设计下的多语言性能,并从模型行为和表示的角度进行了讨论。我们的发现表明,多语言泛化是当前VLA系统中一个被忽视的重要方面,并为改善VLA的多语言泛化提供了见解。基于这些见解和分析,我们进一步探索了改善VLA中多语言性能的策略。我们还提出了一种简单有效的多语言微调方法——多语言主成分对齐(MPCA),该方法利用主成分分析(PCA)获取主成分子空间并对齐投影后的多语言表征,有效减少了多语言性能差距。

我们的贡献总结如下:  
\(1\) 首次对VLA模型中的多语言指令跟随进行了系统性研究,引入了一个多语言评估框架,通过多语言指令变体扩展了现有机器人基准测试。  
\(2\) 在多个VLA模型、套件和多语言设定下进行了全面实验,揭示了当前VLA系统中的显著多语言差距。  
\(3\) 从行为和表示两个角度分析了多语言性能,为理解多语言差距的根本原因和潜在改进方向提供了见解。  
\(4\) 提出了一种简单有效的多语言微调方法MPCA,有效提升了VLA中的多语言性能。

## 2 相关工作

**视觉-语言-动作模型。** VLA模型的快速发展得益于大规模预训练和架构创新,产生了具有强大英语指令跟随和视觉接地能力的策略。早期方法如RT-1\(brohan2022rt\)和Octo\(team2024octo\),率先在大量机器人数据集上训练端到端Transformer策略,为通用操作奠定了基础。后续范式\(kim2024openvla;black2024pi\_0;black2025pi\_;kim2025fine;cen2025rynnvla;bjorck2025gr00t\)越来越多地利用预训练VLM作为骨干,通过动作离散化\(kim2024openvla;kim2025fine\)或基于扩散的连续动作专家\(black2024pi\_0;wen2024diffusion\)进行具身控制的微调。为了减轻灾难性遗忘并在策略适应过程中保留基础模型先验,近期工作探索了参数高效微调\(torne2026mem\)、将高层推理与低层控制解耦的双系统架构\(bjorck2025gr00t\),以及利用外部数据协同训练\(bu2025univla;cen2025worldvla;lian2026bayesianvla\)。这些架构在熟悉环境中表现出色的零样本泛化能力,擅长空间推理、物体接地以及执行基于自然语言指令的复杂操作序列。然而,尽管利用了多语言VLM骨干,当代VLA训练流程仍然绝大多数是单语的,这可能使语言到动作的对齐过程偏向英语,导致在评估非英语指令时性能下降。我们的工作证明了这种多语言差距的存在,并在当前VLA系统中对其进行了分析。

**VLA评估基准。** VLA模型的评估基准已从静态任务完成指标逐步扩展到跨越视觉、运动和环境维度的系统性鲁棒性分析。先前的基准如CALVIN\(mees2022calvin\)和LIBERO\(liu2023libero\)建立了语言条件操作的标准环境。为了暴露隐藏的脆弱性,近期基准\(fei2025libero;zhou2025libero;chen2025robotwin;wang2025vlatest\)自动化了扰动生成,并引入了多维评估协议。这些基准系统评估了模型对摄像机视角变化、物体布局变化、光照变化、机器人初始状态扰动和传感器噪声的鲁棒性,揭示了当代VLA对空间和视觉分布偏移的高度敏感性。然而,在语言鲁棒性方面,现有评估\(fei2025libero;wang2025vlatest\)通常将扰动限制在英语释义或指令复杂度变化上。虽然这些研究证实了VLA可以处理英语内部的语义变化,但它们隐式假设语言理解一旦训练完成就是与语言无关的。然而,这一假设忽略了多语言指令跟随的现实需求。这种遗漏在具身评估中创造了一个关键缺口:没有多语言评估,无法量化跨语言的性能下降,限制了实际部署。我们的工作通过系统评估VLA中的多语言指令跟随来填补这一缺口,揭示了显著的多语言差距,并为根本原因和潜在解决方案提供了见解。

## 3 VLA多语言评估框架

在本节中,我们介绍针对VLA的多语言评估框架,该框架包含两个关键组件:\(1\) 多语言指令构建流程,用于为现有机器人基准测试生成多语言指令变体;\(2\) 多语言评估适配器,能够将多语言指令无缝集成到评估过程中。该框架使我们能够在受控且一致的条件下系统性评估VLA模型的多语言泛化能力。

### 3.1 多语言指令构建

#### 3.1.1 多语言设定设计

**扩展语言范围。** 遵循大多数多语言LLM和VLM的先前工作\(thellmann2024towards;yong2025state;luo2026lost\),我们选择中文、法语、俄语和阿拉伯语作为评估目标语言,涵盖高资源语言(英语和中文)和低资源语言(法语、俄语和阿拉伯语),分属不同语系和文字系统。

**引入多样化的多语言交互设定。** 我们在本文中考虑两种多语言交互设定:\(1\) 多语言指令:直接翻译成不同语言,同时保留其原始语义;\(2\) 代码切换指令:包含多语言混合表达的指令,这在多语言通信场景中常见。这些设定使我们能够系统研究当语言输入偏离现有基准测试中常用的仅英语假设时,VLA的行为表现。

#### 3.1.2 指令生成流程

为了构建多语言指令变体,我们从现有基准测试中提供的原始英语指令开始。对于多语言指令设定,我们使用标准机器翻译系统(即Cloud Translation API)将英语指令翻译成每个目标语言。对于代码切换指令设定,我们使用LLM首先进行命名实体识别,识别原始英语指令及其翻译版本中的关键动词和名词。基于这些对齐,LLM然后将翻译指令中的相应关键短语替换为原始英语指令中的短语,从而产生代码切换指令。为确保生成指令的质量,我们采用LLM作为评判员,评估原始英语指令与代码切换指令之间的语义一致性。该流程使我们能够系统生成多语言指令变体,同时控制语义等价性,从而对VLA模型的多语言泛化进行严格评估。

### 3.2 多语言评估适配器

为了实现不同VLA模型间简单且公平的多语言性能评估,我们提供了一个多语言评估适配器。

相似文章

Drop-Then-Recovery: 视觉-语言-动作模型究竟有多冗余?

Hugging Face Daily Papers

本文研究了视觉-语言-动作(VLA)模型中的冗余现象,发现语言主干在机器人操作任务中高度冗余,而视觉和动作路径则更为关键。作者提出了 Drop-Then-Recovery(DTR)和 GateProbe 方法,用于量化并剪枝不必要的模块。实验表明,移除一半的大语言模型(LLM)模块甚至能提升模型性能。

LabVLA:在科学实验室中落地视觉-语言-动作模型

Hugging Face Daily Papers

LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。