InSight:通过可操控的VLA实现自主技能获取

Hugging Face Daily Papers 论文

摘要

InSight提出了一种框架,用于在视觉-语言-动作(VLA)模型中实现自主技能获取。该框架通过在原始动作层面实现可操控性,并利用VLM引导的数据飞轮生成演示,从而在没有人类演示的情况下完成诸如翻转方块和倒水等操作任务。

视觉-语言-动作(VLA)模型可以从演示中学习操作技能,但其能力受限于训练数据中的技能。我们提出InSight,一个通过使VLA在原始动作层面(例如,“将夹爪移动到碗边”,“向上抬起”,“倒瓶子”)可操控来解锁自主技能获取的框架。InSight包含两个主要阶段:(1)一个自动化分割流程,通过VLM计划分解和末端执行器姿态将演示分割成带标签的原始动作,以实现VLA原始动作的可操控性;(2)一个VLM引导的数据飞轮,用于识别完成新任务所需的缺失原始动作,自主尝试使用VLM提出的低级控制进行缺失原始动作的演示,并自动标记、存储和整合成功的演示到VLA训练集中。我们在仿真和真实世界的操作任务中评估InSight,包括翻转方块、关闭抽屉、扫除、扭转和倒水,这些目标技能均无人类演示。一旦学习完成,这些原始动作可以被组合以执行新的长时域任务,无需额外的人类演示。我们的研究结果表明,原始动作的可操控性为VLA策略的持续技能获取提供了实用基础。项目网站:https://insight-vla.github.io。
查看原文
查看缓存全文

缓存时间: 2026/06/24 21:50

论文页面 - InSight:通过可操控的VLA实现自主技能获取

来源:https://huggingface.co/papers/2606.24884 发布于6月23日

·

由https://huggingface.co/maggi3wang提交

Maggie (https://huggingface.co/maggi3wang)于6月24日

摘要

InSight通过原始动作层面的可操控性与自动化演示生成,实现了视觉-语言-动作模型的自主技能获取。

视觉-语言-动作(VLA)模型能够通过演示学习操作技能,但其能力受限于训练数据中包含的技能。我们提出了InSight框架,该框架通过在原始动作层面(例如“将夹爪移至碗处”、“向上抬起”、“倾倒瓶子”)使VLA具备可操控性,从而解锁自主技能获取的能力。InSight包含两个主要阶段:(1)一个自动化分割管道(https://huggingface.co/papers?q=automated%20segmentation%20pipeline),该管道通过VLM计划分解(https://huggingface.co/papers?q=VLM%20plan%20decomposition)和末端执行器位姿(https://huggingface.co/papers?q=end-effector%20poses)将演示划分为带标签的原始动作,从而实现VLA原始动作的可操控性;(2)一个VLM引导的数据飞轮(https://huggingface.co/papers?q=VLM-guided%20data%20flywheel),它能够识别完成新任务所缺失的原始动作,自动尝试使用VLM提出的低级控制(https://huggingface.co/papers?q=low-level%20control)来演示缺失的原始动作,并自动对成功的演示进行标记、存储和集成到VLA训练集中。我们在模拟和真实世界的操作任务上评估了InSight,包括翻转方块、关闭抽屉、清扫、扭转和倾倒,这些任务均无需任何目标技能的人工演示。一旦这些原始动作被习得,它们可以组合起来执行新颖的长时段任务,而无需额外的人工演示。我们的研究结果表明,原始动作的可操控性为VLA策略中的持续技能获取(https://huggingface.co/papers?q=continual%20skill%20acquisition)提供了实用基础。项目网站:https://insight-vla.github.io/。

查看arXiv页面(https://arxiv.org/abs/2606.24884)查看PDF(https://arxiv.org/pdf/2606.24884)项目页面(https://insight-vla.github.io/)GitHub6(https://github.com/insight-vla/insight)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.24884)

在你的智能体中获取这篇论文:

hf papers read 2606.24884

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

请在你的模型README.md中引用arxiv.org/abs/2606.24884以从本页面链接。

引用此论文的数据集0

没有数据集关联此论文

请在你的数据集README.md中引用arxiv.org/abs/2606.24884以从本页面链接。

引用此论文的Space0

没有Space关联此论文

请在你的Space README.md中引用arxiv.org/abs/2606.24884以从本页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中以从本页面链接。

相似文章

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。

HiVLA: 一种以视觉接地为中心的分层具身操作系统

Hugging Face Daily Papers

HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

LabVLA:在科学实验室中落地视觉-语言-动作模型

Hugging Face Daily Papers

LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。