SIEVE:面向VLA模型模仿学习的结构感知数据选择方法
摘要
SIEVE是一种面向视觉-语言-动作模仿学习的结构感知数据选择方法,能够识别可复用的视觉运动基元和转换接口,仅使用50%的演示数据和训练步骤即可超越全数据训练。
查看缓存全文
缓存时间: 2026/07/08 02:47
论文页面 - SIEVE:面向VLA模型模仿学习的结构感知数据选择方法
来源:https://huggingface.co/papers/2607.06442
摘要
SIEVE 是一种结构感知的数据选择方法,面向视觉-语言-动作模仿学习,能够识别可复用的视觉运动基元与过渡接口,从而提升策略学习效率。
视觉-语言-动作(VLA)模型通常通过模仿学习 (https://huggingface.co/papers?q=imitation%20learning) 在大规模机器人演示数据集上进行训练,但由于存在冗余、噪声以及覆盖不均等问题,更多的数据并不必然带来更优的策略。现有的数据选择 (https://huggingface.co/papers?q=data%20selection) 方法往往在轨迹层面或状态-动作层面评估演示数据,忽略了构成长时域行为的可复用结构。本文提出 SIEVE,一种面向 VLA 模仿学习 (https://huggingface.co/papers?q=imitation%20learning) 的结构感知数据选择 (https://huggingface.co/papers?q=data%20selection) 方法。SIEVE 将演示数据视为可复用基元与过渡接口 (https://huggingface.co/papers?q=transition%20interfaces) 的组合。它首先从分割后的轨迹中发掘视觉运动基元 (https://huggingface.co/papers?q=visuo-motor%20primitives),然后通过最大化考虑可复用性的结构暴露 (https://huggingface.co/papers?q=structural%20exposure)(在边际收益递减 (https://huggingface.co/papers?q=diminishing%20returns) 条件下)来为组合模式 (https://huggingface.co/papers?q=composition%20patterns) 分配选择预算。最后,在每个组合模式桶内选择中心轨迹 (https://huggingface.co/papers?q=medoid%20trajectories),以保留中心化、稳定且适合模仿的演示数据。在多个数据集、基准测试和 VLA 模型上的实验表明,SIEVE 持续优于竞争性数据选择 (https://huggingface.co/papers?q=data%20selection) 基线方法。值得注意的是,SIEVE 仅使用 50% 的演示数据和 50% 的训练步数即可超越全数据训练的效果,这表明通过基元和过渡所捕获的可复用结构是高效 VLA 模仿学习 (https://huggingface.co/papers?q=imitation%20learning) 的重要信号。
查看 arXiv 页面 (https://arxiv.org/abs/2607.06442)查看 PDF (https://arxiv.org/pdf/2607.06442)GitHub (https://github.com/ChangtiWu/SIEVE)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.06442)
在您的 agent 中获取此论文:
hf papers read 2607\.06442
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.06442,以便在此页面建立链接。
引用此论文的数据集0
无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.06442,以便在此页面建立链接。
引用此论文的 Spaces0
无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.06442,以便在此页面建立链接。
包含此论文的收藏0
无收藏包含此论文
请将此论文添加到收藏 (https://huggingface.co/new-collection) 中,以便在此页面建立链接。
相似文章
InSight:通过可操控的VLA实现自主技能获取
InSight提出了一种框架,用于在视觉-语言-动作(VLA)模型中实现自主技能获取。该框架通过在原始动作层面实现可操控性,并利用VLM引导的数据飞轮生成演示,从而在没有人类演示的情况下完成诸如翻转方块和倒水等操作任务。
IntentVLA: 针对混叠机器人操作的短期意图建模
IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。
EventVLA: 事件驱动的视觉证据记忆用于长时域视觉-语言-动作策略
EventVLA 提出了一种稀疏视觉证据记忆框架用于长时域机器人操作,相较于最先进的记忆增强型VLA,平均成功率提升了40%。
StableVLA:迈向无需额外数据的稳健视觉-语言-动作模型
本文为视觉-语言-动作(VLA)模型引入了一种信息瓶颈适配器(IB-Adapter),旨在提升模型在未见过的视觉干扰下的鲁棒性,且无需额外数据,在极小的参数开销下实现了高达30%的性能提升。
分层优势加权:面向稀疏回合结果的VLA在线强化学习微调
本文提出分层优势加权行为克隆(HABC),用于利用具有稀疏二进制回合结果的在线强化学习微调视觉-语言-动作(VLA)策略。HABC通过自适应评价器头和干预感知的信用分配将可行性和效率目标分离,显著提高了接触密集型双手操作任务的成功率。