标签
InSight提出了一种框架,用于在视觉-语言-动作(VLA)模型中实现自主技能获取。该框架通过在原始动作层面实现可操控性,并利用VLM引导的数据飞轮生成演示,从而在没有人类演示的情况下完成诸如翻转方块和倒水等操作任务。