SIEVE:面向VLA模型模仿学习的结构感知数据选择方法

Hugging Face Daily Papers 论文

摘要

SIEVE是一种面向视觉-语言-动作模仿学习的结构感知数据选择方法,能够识别可复用的视觉运动基元和转换接口,仅使用50%的演示数据和训练步骤即可超越全数据训练。

视觉-语言-动作(VLA)模型通常通过在大规模机器人演示数据集上进行模仿学习来训练,但由于冗余、噪声和覆盖不均,数据量越多并不一定带来更好的策略。现有的数据选择方法通常是在轨迹级别或状态-动作级别评估演示,忽略了构成长时域行为的可复用结构。在本文中,我们提出SIEVE——一种面向VLA模仿学习的结构感知数据选择方法。SIEVE将演示视为可复用基元和转换接口的组合。它首先从分割后的轨迹中发现视觉运动基元,然后通过最大化回报递减条件下的复用感知结构暴露,为组合模式分配选择预算。最后,在每个组合模式桶内选择中心轨迹,以保留核心、稳定且适合模仿的演示。在多个数据集、基准测试和VLA模型上的实验表明,SIEVE持续优于竞争性的数据选择基线。值得注意的是,SIEVE仅使用50%的演示数据和50%的训练步骤就能超越全数据训练,这表明通过基元和转换捕获的可复用结构是高效VLA模仿学习的重要信号。
查看原文
查看缓存全文

缓存时间: 2026/07/08 02:47

论文页面 - SIEVE:面向VLA模型模仿学习的结构感知数据选择方法

来源:https://huggingface.co/papers/2607.06442

摘要

SIEVE 是一种结构感知的数据选择方法,面向视觉-语言-动作模仿学习,能够识别可复用的视觉运动基元与过渡接口,从而提升策略学习效率。

视觉-语言-动作(VLA)模型通常通过模仿学习 (https://huggingface.co/papers?q=imitation%20learning) 在大规模机器人演示数据集上进行训练,但由于存在冗余、噪声以及覆盖不均等问题,更多的数据并不必然带来更优的策略。现有的数据选择 (https://huggingface.co/papers?q=data%20selection) 方法往往在轨迹层面或状态-动作层面评估演示数据,忽略了构成长时域行为的可复用结构。本文提出 SIEVE,一种面向 VLA 模仿学习 (https://huggingface.co/papers?q=imitation%20learning) 的结构感知数据选择 (https://huggingface.co/papers?q=data%20selection) 方法。SIEVE 将演示数据视为可复用基元与过渡接口 (https://huggingface.co/papers?q=transition%20interfaces) 的组合。它首先从分割后的轨迹中发掘视觉运动基元 (https://huggingface.co/papers?q=visuo-motor%20primitives),然后通过最大化考虑可复用性的结构暴露 (https://huggingface.co/papers?q=structural%20exposure)(在边际收益递减 (https://huggingface.co/papers?q=diminishing%20returns) 条件下)来为组合模式 (https://huggingface.co/papers?q=composition%20patterns) 分配选择预算。最后,在每个组合模式桶内选择中心轨迹 (https://huggingface.co/papers?q=medoid%20trajectories),以保留中心化、稳定且适合模仿的演示数据。在多个数据集、基准测试和 VLA 模型上的实验表明,SIEVE 持续优于竞争性数据选择 (https://huggingface.co/papers?q=data%20selection) 基线方法。值得注意的是,SIEVE 仅使用 50% 的演示数据和 50% 的训练步数即可超越全数据训练的效果,这表明通过基元和过渡所捕获的可复用结构是高效 VLA 模仿学习 (https://huggingface.co/papers?q=imitation%20learning) 的重要信号。

查看 arXiv 页面 (https://arxiv.org/abs/2607.06442)查看 PDF (https://arxiv.org/pdf/2607.06442)GitHub (https://github.com/ChangtiWu/SIEVE)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.06442)

在您的 agent 中获取此论文:

hf papers read 2607\.06442

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.06442,以便在此页面建立链接。

引用此论文的数据集0

无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.06442,以便在此页面建立链接。

引用此论文的 Spaces0

无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.06442,以便在此页面建立链接。

包含此论文的收藏0

无收藏包含此论文

请将此论文添加到收藏 (https://huggingface.co/new-collection) 中,以便在此页面建立链接。

相似文章

InSight:通过可操控的VLA实现自主技能获取

Hugging Face Daily Papers

InSight提出了一种框架,用于在视觉-语言-动作(VLA)模型中实现自主技能获取。该框架通过在原始动作层面实现可操控性,并利用VLM引导的数据飞轮生成演示,从而在没有人类演示的情况下完成诸如翻转方块和倒水等操作任务。

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。

分层优势加权:面向稀疏回合结果的VLA在线强化学习微调

Hugging Face Daily Papers

本文提出分层优势加权行为克隆(HABC),用于利用具有稀疏二进制回合结果的在线强化学习微调视觉-语言-动作(VLA)策略。HABC通过自适应评价器头和干预感知的信用分配将可行性和效率目标分离,显著提高了接触密集型双手操作任务的成功率。