APT:动作专家预训练提升视觉-语言-动作策略的指令泛化能力
摘要
研究人员提出APT,一种两阶段训练方法,先在视觉-动作对上预训练动作专家,再整合语言条件,显著提升视觉-语言-动作策略在分布外指令上的泛化能力。
查看缓存全文
缓存时间: 2026/06/15 12:58
论文页面 - APT:动作专家预训练提升视觉-语言-动作策略的指令泛化能力
来源:https://huggingface.co/papers/2606.12366
摘要
研究者针对视觉-语言-动作模型泛化能力不足的问题,提出APT(动作专家预训练)方法。该两阶段训练方法在集成语言条件之前,先利用视觉-动作对预训练动作专家,从而提升模型对分布外指令的执行性能。
视觉-语言-动作(VLA)模型将预训练的视觉-语言模型与连续动作专家相结合,在操作任务上取得了强劲表现,但面对分布外语言指令时泛化能力仍然薄弱。已知的一个挑战是VLA数据中的结构不平衡——语言内容的多样性远低于视觉和动作内容,导致策略容易依赖视觉捷径。尽管离散动作方法通过视觉-语言协同训练缓解了这一问题,但连续动作专家缺乏此类保护:它们从随机初始化开始,完全从不平衡数据中学习,产生噪声梯度,不仅破坏了视觉-语言模型(VLM)的表征,也未能发挥其语言能力。我们从贝叶斯视角出发,将策略分解为与语言无关的视觉-动作(VA)先验和语言条件化的VLA似然,并提出了APT,一种强调动作专家预训练的两阶段训练方法。在第一阶段,动作专家作为VA先验,在冻结的VLM基础上基于视觉-动作对进行预训练,从而绕过语言不平衡问题。在第二阶段,通过门控融合机制注入语言标记,该机制在保留已学视觉运动先验的同时融合VLM特征。APT可应用于主流VLA架构,包括π和GR00T风格架构。大量实验验证了APT在未见指令和组合任务上的一致性能提升。项目页面:https://xukechun.github.io/papers/APT/
查看arXiv页面 (https://arxiv.org/abs/2606.12366)查看PDF (https://arxiv.org/pdf/2606.12366)项目页面 (https://xukechun.github.io/papers/APT/)GitHub (https://github.com/xukechun/APT)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.12366)
在你的智能体中获取这篇论文:
hf papers read 2606.12366
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型链接这篇论文
请在模型的README.md中引用 arxiv.org/abs/2606.12366 以便从此页面链接。
引用本文的数据集0
没有数据集链接这篇论文
请在数据集的README.md中引用 arxiv.org/abs/2606.12366 以便从此页面链接。
引用本文的Spaces0
没有Space链接这篇论文
请在Space的README.md中引用 arxiv.org/abs/2606.12366 以便从此页面链接。
包含本文的收藏集0
没有收藏集包含这篇论文
请将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection)以便从此页面链接。
相似文章
检索,而非重新训练:在测试时将视觉语言动作模型扩展到新任务
本文介绍了一种检索增强的视觉-语言-动作策略,通过使用预训练模型和索引演示,消除了每个任务的微调,实现了高效的跨本体泛化和测试时的任务适应。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。
PolicyTrim: 提升视觉-语言-动作模型的本征策略效率
PolicyTrim是一种基于强化学习的后训练框架,能将视觉-语言-动作模型的动作块利用率提升3倍,并将物理执行步骤减少51.4%,实现高达5.83倍的部署加速。
World Pilot: 使用世界动作先验引导视觉-语言-动作模型
World Pilot 通过融入来自世界动作模型的动态场景演变和轨迹先验来增强视觉-语言-动作模型,在操作任务上实现了最先进的零样本性能。
先学移动再学做事:面向VLA的任务无关预训练
任务无关预训练(TAP)将VLA训练分解为从无标签交互数据中进行的自监督运动技能学习,然后是轻量级的语言接地,以最少的专家演示实现了强大的性能。它匹配或超越了在数百万条专家轨迹上训练的模型,同时对真实世界扰动具有鲁棒性。