打破视觉-行动捷径:可泛化机器人基础模型的潜在接口训练 (LIT)

Hugging Face Daily Papers 论文

摘要

本文提出潜在接口训练(LIT),一种两阶段策略,通过姿态监督的潜在接口缓解视觉-行动捷径,以增强机器人基础模型的泛化能力。

机器人基础模型在分布内表现出色,但常在视觉分布偏移下性能退化。在从预训练视觉表示学习生成动作时,模型可能利用与训练分布内示范动作相关的任务无关视觉线索。当这些关联在分布偏移下改变时,此类视觉-行动捷径会削弱泛化能力。缓解这些捷径需要约束视觉信息在动作生成中的使用,同时保留任务相关的空间信息。我们提出潜在接口训练(LIT),一种与框架无关的两阶段策略,首先建立无图像的空间目标条件动作先验,然后通过姿态监督的潜在接口约束视觉条件。第一阶段训练动作专家,根据语言、机器人状态和每个示范动作块的终端SE(3)末端执行器姿态生成动作块,学习与视觉线索无关的目标导向动作生成。第二阶段引入一个潜在接口,聚合视觉和语义表示,作为预训练动作专家的唯一视觉条件路径。该接口通过监督重构先前用于条件化第一阶段的终端姿态,鼓励其保留动作生成所需的目标相关空间信息。在四种视觉-语言-动作和世界-动作架构(Pi0.5、MolmoAct2、FAST-WAM和ImageWAM)上,LIT将LIBERO-Plus的总成功率提高3.87至10.70个百分点,同时保持或提升平均LIBERO成功率。真实世界评估显示,在未见过的相机配置、光照变化和干扰物下,三个任务聚合成功率提高13.30至16.70个百分点。
查看原文
查看缓存全文

缓存时间: 2026/09/14 02:32

论文页面 - 打破视觉-动作捷径:面向通用机器人基础模型的潜接口训练

来源:https://huggingface.co/papers/2609.12641

摘要

LIT通过首先训练不依赖图像的姿态条件动作先验,然后通过一个姿态监督的潜接口约束视觉输入,该接口保留空间目标信息,从而提升机器人动作的泛化能力。

机器人基础模型在分布内表现强劲,但在视觉分布偏移下往往性能下降。当从预训练视觉表示学习生成动作时,模型可能利用在训练分布中与示范动作相关的、与任务无关的视觉线索。此类视觉-动作捷径(https://huggingface.co/papers?q=vision-action%20shortcuts)会在分布偏移导致这些相关性改变时削弱泛化能力。缓解这些捷径需要约束视觉信息在动作生成中的使用方式,同时保留任务相关的空间信息。我们提出了潜接口训练(https://huggingface.co/papers?q=Latent%20Interface%20Training)(LIT),这是一个与框架无关的两阶段策略:首先建立一个无图像的、以空间目标为条件的动作先验(https://huggingface.co/papers?q=spatial-goal-conditioned%20action%20prior),然后通过一个姿态监督的潜接口约束视觉条件。第一阶段训练动作专家生成基于语言、机器人状态以及每个示范动作块终端SE(3)末端执行器姿态(https://huggingface.co/papers?q=SE(3)%20end-effector%20pose)的动作块(https://huggingface.co/papers?q=action%20chunks),学习与视觉线索无关的目标导向动作生成。第二阶段引入一个聚合视觉和语义表示的潜接口,作为预训练动作专家唯一的视觉条件通路。该接口通过监督重建第一阶段使用的终端姿态进行训练,鼓励其保留动作生成所需的目标相关空间信息。在四种视觉-语言-动作和世界-动作架构(Pi0.5、MolmoAct2、FAST-WAM和ImageWAM)上,LIT将LIBERO-Plus整体成功率提升了3.87至10.70个百分点,同时保持或提高了LIBERO的平均成功率。现实世界评估显示,在未见过的相机配置、光照变化和干扰物条件下,三个任务的聚合成功率提升了13.30至16.70个百分点。

查看arXiv页面(https://arxiv.org/abs/2609.12641)查看PDF(https://arxiv.org/pdf/2609.12641)项目页面(https://magiclab-nus.github.io/LIT/?v=37955c5)GitHub24(https://github.com/MAGICLAB-NUS/LIT)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.12641)

在您的代理中获取此论文:

hf papers read 2609\.12641

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文。

在模型README.md中引用arxiv.org/abs/2609.12641以从本页面链接。

引用此论文的数据集0

无数据集链接此论文。

在数据集README.md中引用arxiv.org/abs/2609.12641以从本页面链接。

引用此论文的Spaces0

无Space链接此论文。

在Space README.md中引用arxiv.org/abs/2609.12641以从本页面链接。

包含此论文的收藏0

无收藏包含此论文。

将此论文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。

相似文章

从基础到应用:在实践中改进VLA模型

Papers with Code Trending

本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。