打破视觉-行动捷径:可泛化机器人基础模型的潜在接口训练 (LIT)
摘要
本文提出潜在接口训练(LIT),一种两阶段策略,通过姿态监督的潜在接口缓解视觉-行动捷径,以增强机器人基础模型的泛化能力。
查看缓存全文
缓存时间: 2026/09/14 02:32
论文页面 - 打破视觉-动作捷径:面向通用机器人基础模型的潜接口训练
来源:https://huggingface.co/papers/2609.12641
摘要
LIT通过首先训练不依赖图像的姿态条件动作先验,然后通过一个姿态监督的潜接口约束视觉输入,该接口保留空间目标信息,从而提升机器人动作的泛化能力。
机器人基础模型在分布内表现强劲,但在视觉分布偏移下往往性能下降。当从预训练视觉表示学习生成动作时,模型可能利用在训练分布中与示范动作相关的、与任务无关的视觉线索。此类视觉-动作捷径(https://huggingface.co/papers?q=vision-action%20shortcuts)会在分布偏移导致这些相关性改变时削弱泛化能力。缓解这些捷径需要约束视觉信息在动作生成中的使用方式,同时保留任务相关的空间信息。我们提出了潜接口训练(https://huggingface.co/papers?q=Latent%20Interface%20Training)(LIT),这是一个与框架无关的两阶段策略:首先建立一个无图像的、以空间目标为条件的动作先验(https://huggingface.co/papers?q=spatial-goal-conditioned%20action%20prior),然后通过一个姿态监督的潜接口约束视觉条件。第一阶段训练动作专家生成基于语言、机器人状态以及每个示范动作块终端SE(3)末端执行器姿态(https://huggingface.co/papers?q=SE(3)%20end-effector%20pose)的动作块(https://huggingface.co/papers?q=action%20chunks),学习与视觉线索无关的目标导向动作生成。第二阶段引入一个聚合视觉和语义表示的潜接口,作为预训练动作专家唯一的视觉条件通路。该接口通过监督重建第一阶段使用的终端姿态进行训练,鼓励其保留动作生成所需的目标相关空间信息。在四种视觉-语言-动作和世界-动作架构(Pi0.5、MolmoAct2、FAST-WAM和ImageWAM)上,LIT将LIBERO-Plus整体成功率提升了3.87至10.70个百分点,同时保持或提高了LIBERO的平均成功率。现实世界评估显示,在未见过的相机配置、光照变化和干扰物条件下,三个任务的聚合成功率提升了13.30至16.70个百分点。
查看arXiv页面(https://arxiv.org/abs/2609.12641)查看PDF(https://arxiv.org/pdf/2609.12641)项目页面(https://magiclab-nus.github.io/LIT/?v=37955c5)GitHub24(https://github.com/MAGICLAB-NUS/LIT)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.12641)
在您的代理中获取此论文:
hf papers read 2609\.12641
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文。
在模型README.md中引用arxiv.org/abs/2609.12641以从本页面链接。
引用此论文的数据集0
无数据集链接此论文。
在数据集README.md中引用arxiv.org/abs/2609.12641以从本页面链接。
引用此论文的Spaces0
无Space链接此论文。
在Space README.md中引用arxiv.org/abs/2609.12641以从本页面链接。
包含此论文的收藏0
无收藏包含此论文。
将此论文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。
相似文章
@robotsdigest: 机器人策略常常因为一个令人惊讶的简单原因而失败:它们从训练图像中学习捷径。LIT, Latent …
Latent Interface Training (LIT) 通过先在无视觉输入的情况下教授动作,然后使用姿态监督的潜在接口来保留动作所需的几何结构,从而解决机器人策略从训练图像中学习捷径的问题。
InternVLA-A1.5: 统一理解、潜在预见与行动以实现组合泛化
InternVLA-A1.5 将预训练的视觉语言模型与潜在空间中的未来预测相结合,以实现具有组合泛化和长视界执行能力的高效机器人操作,在模拟基准测试中取得了最先进的结果。
从基础到应用:在实践中改进VLA模型
本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。
面向机器人操作的视觉-语言-动作模型中的双潜在记忆
LaMem-VLA提出了一种原生于潜在记忆的框架,将短期和长期历史经验直接整合到视觉-语言-动作推理中,从而在长周期机器人操作任务上实现更优性能。
N_0-VTLA:利用潜在触觉标记扩展视觉-触觉-语言-动作模型
介绍了N_0-VTLA,一种面向高接触操作的视觉-触觉-语言-动作基础模型,具备大规模触觉预训练和基于优势的离线策略改进功能,在真实机器人和仿真基准测试中表现优异。