像世界模型一样思考,像VLA一样行动:将世界模型表示蒸馏到紧凑的机器人策略中
摘要
本文介绍了THAW-VLA,一种将世界模型表示蒸馏到视觉-语言-动作模型中的方法,用于机器人学,增强了在模拟和真实硬件上的鲁棒性和性能,而不会增加推理开销。
查看缓存全文
缓存时间: 2026/09/22 07:28
论文页面 - 像世界模型一样思考,像VLA一样行动:将世界模型表征蒸馏到紧凑的机器人策略中
来源:https://huggingface.co/papers/2609.24682
摘要
视觉-语言-动作(VLA)模型将观测映射到动作时,其优化目标并未考虑世界如何响应,因此其鲁棒性主要受限于数据覆盖范围。世界模型恰恰包含了这种缺失的优化目标,并因此具有更好的基础性,然而将未来状态向前滚动需要数秒的决策时间,这使其无法应用于控制回路。我们证明这两者是可以分离的。世界模型对物理场景的认知存在于其内部特征中;生成未来状态仅仅是产生这些特征的优化目标,因此这种基础性可以被继承,而生成机制则可以摒弃。我们在常规的VLA训练中加入了一个特征对齐项:在训练前,一个冻结的世界模型在训练帧上运行一次并缓存结果,学生模型则学习与该缓存保持一致。训练时无需加载教师模型,投影器在训练后即被丢弃,最终部署的策略与未蒸馏的基线完全相同,在消费级RTX 5090上运行仅需32毫秒、占用1.86GB内存,因此所有性能提升均归因于表征能力,而非额外容量或测试时计算。一个0.8B参数的学生模型在LIBERO上达到97.9%的准确率,在RoboCasa-GR1人形机器人操作任务上从48.2%提升至50.5%,且相同的目标可迁移至真实硬件,适用于单臂和双臂平台。这种提升在学生模型规模、骨干网络、对齐层和教师模型变化时依然存在,表明这是一种广泛适用的表征先验,而非特定两个网络之间的脆弱对齐。 项目页面:https://thaw-vla.trung-dt.com/
查看arXiv页面 (https://arxiv.org/abs/2609.24682) 查看PDF (https://arxiv.org/pdf/2609.24682) 项目页面 (https://thaw-vla.trung-dt.com/) GitHub0 (https://github.com/trungdt880/THAW-VLA) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.24682)
在您的智能体中获取此论文:
hf papers read 2609.24682
没有最新的CLI? curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2609.24682 以从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2609.24682 以从本页面链接。
引用此论文的Space0
没有Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2609.24682 以从本页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
τ_0-VLA:基于世界模型引导的测试时计算的分层机器人基础模型
分层视觉-语言-动作模型通过世界模型引导的测试时搜索扩展计算,用于高级子任务决策,从而提升长期机器人操作的性能。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
LaWAM:面向高效动力学感知机器人策略的潜在世界动作模型
LaWAM通过预测紧凑的潜在视觉子目标而非昂贵的视频生成,实现了高效的机器人控制,相比像素空间世界动作模型,成功率可达最先进水平,同时延迟降低高达24倍。
机器人需要的不仅仅是VLA和世界模型
本文立场论文认为,推进机器人智能需要将非结构化的行为数据通过专门的接口进行整合,用于标注、具身映射、世界建模和奖励推断,而不是仅仅依赖扩展视觉-语言-动作(VLA)模型和世界模型。
SmolVLA:一种经济高效的视觉-语言-动作模型
SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。