APT:动作专家预训练提升视觉-语言-动作策略的指令泛化能力

Hugging Face Daily Papers 论文

摘要

研究人员提出APT,一种两阶段训练方法,先在视觉-动作对上预训练动作专家,再整合语言条件,显著提升视觉-语言-动作策略在分布外指令上的泛化能力。

视觉-语言-动作(VLA)模型将预训练的视觉-语言模型(VLM)与连续动作专家耦合,实现了强大的操作性能,但在分布外(OOD)语言指令上的泛化能力仍然较差。一个已知挑战是VLA数据的结构性不平衡,其中语言的多样性远低于视觉和动作内容,导致策略容易依赖视觉捷径。虽然离散动作方法通过视觉-语言联合训练缓解了这一问题,但连续动作专家缺乏此类保护:它们从随机初始化开始,完全从不平衡数据中学习,产生噪声梯度,破坏VLM并无法利用其语言能力。我们从贝叶斯角度出发,将策略分解为与语言无关的视觉-动作(VA)先验和语言条件下的VLA似然,并提出APT,一种强调动作专家预训练(Action expert PreTraining)的两阶段训练方法。在第一阶段,动作专家作为VA先验,在冻结VLM的视觉-动作对上进行预训练,绕过了语言不平衡问题。在第二阶段,通过门控融合机制注入语言标记,该机制整合VLM特征的同时保留了已学习的视觉运动先验。APT适用于主流VLA架构,包括π和GR00T风格架构。大量实验验证了APT在未见指令和组合任务上的一致提升。项目页面:https://xukechun.github.io/papers/APT/
查看原文
查看缓存全文

缓存时间: 2026/06/15 12:58

论文页面 - APT:动作专家预训练提升视觉-语言-动作策略的指令泛化能力

来源:https://huggingface.co/papers/2606.12366

摘要

研究者针对视觉-语言-动作模型泛化能力不足的问题,提出APT(动作专家预训练)方法。该两阶段训练方法在集成语言条件之前,先利用视觉-动作对预训练动作专家,从而提升模型对分布外指令的执行性能。

视觉-语言-动作(VLA)模型将预训练的视觉-语言模型与连续动作专家相结合,在操作任务上取得了强劲表现,但面对分布外语言指令时泛化能力仍然薄弱。已知的一个挑战是VLA数据中的结构不平衡——语言内容的多样性远低于视觉和动作内容,导致策略容易依赖视觉捷径。尽管离散动作方法通过视觉-语言协同训练缓解了这一问题,但连续动作专家缺乏此类保护:它们从随机初始化开始,完全从不平衡数据中学习,产生噪声梯度,不仅破坏了视觉-语言模型(VLM)的表征,也未能发挥其语言能力。我们从贝叶斯视角出发,将策略分解为与语言无关的视觉-动作(VA)先验和语言条件化的VLA似然,并提出了APT,一种强调动作专家预训练的两阶段训练方法。在第一阶段,动作专家作为VA先验,在冻结的VLM基础上基于视觉-动作对进行预训练,从而绕过语言不平衡问题。在第二阶段,通过门控融合机制注入语言标记,该机制在保留已学视觉运动先验的同时融合VLM特征。APT可应用于主流VLA架构,包括π和GR00T风格架构。大量实验验证了APT在未见指令和组合任务上的一致性能提升。项目页面:https://xukechun.github.io/papers/APT/

查看arXiv页面 (https://arxiv.org/abs/2606.12366)查看PDF (https://arxiv.org/pdf/2606.12366)项目页面 (https://xukechun.github.io/papers/APT/)GitHub (https://github.com/xukechun/APT)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.12366)

在你的智能体中获取这篇论文:

hf papers read 2606.12366

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

没有模型链接这篇论文

请在模型的README.md中引用 arxiv.org/abs/2606.12366 以便从此页面链接。

引用本文的数据集0

没有数据集链接这篇论文

请在数据集的README.md中引用 arxiv.org/abs/2606.12366 以便从此页面链接。

引用本文的Spaces0

没有Space链接这篇论文

请在Space的README.md中引用 arxiv.org/abs/2606.12366 以便从此页面链接。

包含本文的收藏集0

没有收藏集包含这篇论文

请将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection)以便从此页面链接。

相似文章

先学移动再学做事:面向VLA的任务无关预训练

Hugging Face Daily Papers

任务无关预训练(TAP)将VLA训练分解为从无标签交互数据中进行的自监督运动技能学习,然后是轻量级的语言接地,以最少的专家演示实现了强大的性能。它匹配或超越了在数百万条专家轨迹上训练的模型,同时对真实世界扰动具有鲁棒性。