@robotsdigest: 机器人策略常常因为一个令人惊讶的简单原因而失败:它们从训练图像中学习捷径。LIT, Latent …
摘要
Latent Interface Training (LIT) 通过先在无视觉输入的情况下教授动作,然后使用姿态监督的潜在接口来保留动作所需的几何结构,从而解决机器人策略从训练图像中学习捷径的问题。
机器人策略常常因为一个令人惊讶的简单原因而失败:它们从训练图像中学习捷径。
LIT, Latent Interface Training, 直接解决了这个问题。它首先教导动作专家在不看图像的情况下达到空间目标,然后通过姿态监督的潜在接口强制引入视觉信息,以保留动作所需的几何结构。
查看缓存全文
缓存时间: 2026/09/13 05:07
机器人策略常因一个令人意外的简单原因而失效:它们从训练图像中学习到了捷径。
LIT(潜接口训练)方法直接针对这一问题。它首先训练动作专家在不依赖图像的情况下完成空间目标,随后通过姿态监督的潜接口强制视觉信息传递,同时维持动作所需的空间几何关系。
相似文章
打破视觉-行动捷径:可泛化机器人基础模型的潜在接口训练 (LIT)
本文提出潜在接口训练(LIT),一种两阶段策略,通过姿态监督的潜在接口缓解视觉-行动捷径,以增强机器人基础模型的泛化能力。
@aimalysheva: 潜在行为正当时,尤其在机器人领域:不再预测机器人的实际关节指令或游戏…
潜在行为在机器人领域越来越受关注,它使得从无动作标签的无标注视频中学习成为可能。DeepMind和FAIR的最新论文展示了从受控游戏环境到野外互联网视频的进展,有望实现模仿学习的可扩展训练。
LaWAM:面向高效动力学感知机器人策略的潜在世界动作模型
LaWAM通过预测紧凑的潜在视觉子目标而非昂贵的视频生成,实现了高效的机器人控制,相比像素空间世界动作模型,成功率可达最先进水平,同时延迟降低高达24倍。
LLMs帮助机器人理解模糊指令并聚焦关键细节
MIT CSAIL研究人员开发了掩码逆强化学习(Masked IRL),利用大型语言模型澄清机器人的模糊指令并聚焦环境关键细节,从而减少对大量演示数据的需求。
@HuggingPapers:用于机器人策略学习的几何动作模型,复用几何基础模型作为感知的骨干网络…
几何动作模型将几何基础模型用于机器人策略学习,在LIBERO-Plus上达到85.5%的准确率,推理仅需6.9毫秒,比基线模型快55倍。