InSight:通过可操控的VLA实现自主技能获取
摘要
InSight提出了一种框架,用于在视觉-语言-动作(VLA)模型中实现自主技能获取。该框架通过在原始动作层面实现可操控性,并利用VLM引导的数据飞轮生成演示,从而在没有人类演示的情况下完成诸如翻转方块和倒水等操作任务。
查看缓存全文
缓存时间: 2026/06/24 21:50
论文页面 - InSight:通过可操控的VLA实现自主技能获取
来源:https://huggingface.co/papers/2606.24884 发布于6月23日
·
由https://huggingface.co/maggi3wang提交
Maggie (https://huggingface.co/maggi3wang)于6月24日
摘要
InSight通过原始动作层面的可操控性与自动化演示生成,实现了视觉-语言-动作模型的自主技能获取。
视觉-语言-动作(VLA)模型能够通过演示学习操作技能,但其能力受限于训练数据中包含的技能。我们提出了InSight框架,该框架通过在原始动作层面(例如“将夹爪移至碗处”、“向上抬起”、“倾倒瓶子”)使VLA具备可操控性,从而解锁自主技能获取的能力。InSight包含两个主要阶段:(1)一个自动化分割管道(https://huggingface.co/papers?q=automated%20segmentation%20pipeline),该管道通过VLM计划分解(https://huggingface.co/papers?q=VLM%20plan%20decomposition)和末端执行器位姿(https://huggingface.co/papers?q=end-effector%20poses)将演示划分为带标签的原始动作,从而实现VLA原始动作的可操控性;(2)一个VLM引导的数据飞轮(https://huggingface.co/papers?q=VLM-guided%20data%20flywheel),它能够识别完成新任务所缺失的原始动作,自动尝试使用VLM提出的低级控制(https://huggingface.co/papers?q=low-level%20control)来演示缺失的原始动作,并自动对成功的演示进行标记、存储和集成到VLA训练集中。我们在模拟和真实世界的操作任务上评估了InSight,包括翻转方块、关闭抽屉、清扫、扭转和倾倒,这些任务均无需任何目标技能的人工演示。一旦这些原始动作被习得,它们可以组合起来执行新颖的长时段任务,而无需额外的人工演示。我们的研究结果表明,原始动作的可操控性为VLA策略中的持续技能获取(https://huggingface.co/papers?q=continual%20skill%20acquisition)提供了实用基础。项目网站:https://insight-vla.github.io/。
查看arXiv页面(https://arxiv.org/abs/2606.24884)查看PDF(https://arxiv.org/pdf/2606.24884)项目页面(https://insight-vla.github.io/)GitHub6(https://github.com/insight-vla/insight)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.24884)
在你的智能体中获取这篇论文:
hf papers read 2606.24884
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
请在你的模型README.md中引用arxiv.org/abs/2606.24884以从本页面链接。
引用此论文的数据集0
没有数据集关联此论文
请在你的数据集README.md中引用arxiv.org/abs/2606.24884以从本页面链接。
引用此论文的Space0
没有Space关联此论文
请在你的Space README.md中引用arxiv.org/abs/2606.24884以从本页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中以从本页面链接。
相似文章
IntentVLA: 针对混叠机器人操作的短期意图建模
IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。
HiVLA: 一种以视觉接地为中心的分层具身操作系统
HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
LabVLA:在科学实验室中落地视觉-语言-动作模型
LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。
AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。