像世界模型一样思考,像VLA一样行动:将世界模型表示蒸馏到紧凑的机器人策略中

Hugging Face Daily Papers 论文

摘要

本文介绍了THAW-VLA,一种将世界模型表示蒸馏到视觉-语言-动作模型中的方法,用于机器人学,增强了在模拟和真实硬件上的鲁棒性和性能,而不会增加推理开销。

视觉-语言-动作(VLA)模型将观察映射到动作,没有考虑世界响应的目标,因此其鲁棒性主要受限于数据覆盖范围。世界模型恰恰携带了这一缺失的目标,并且在基础性上更好,但向前推演未来需要每个决策几秒钟,这使得它们无法用于控制回路。我们证明这两者可以分离。世界模型关于物理场景的知识存在于其内部特征中;生成未来只是产生这些特征的目标,因此基础性可以被继承,而生成机制可以被舍弃。我们在普通VLA训练中添加一个特征对齐项:一个冻结的世界模型运行一次训练帧并缓存,学生模型学习与该缓存一致。训练过程中不加载教师模型,训练后丢弃投影器,部署的策略与未蒸馏的基线相同,在消费级RTX~5090上运行时间为32毫秒,内存为1.86GB,因此所有增益都归因于表示本身,而不是增加的容量或测试时计算。一个0.8B的学生模型在LIBERO上达到97.9%,在RoboCasa-GR1人形操作上从48.2%提升到50.5%,并且相同的目标适用于真实硬件,包括单臂和双臂平台。增益在学生规模、骨干网络、对齐层和教师变化后依然存在,表明这是一个广泛表示先验,而不是两个特定网络之间的脆弱对齐。项目页面:https://thaw-vla.trung-dt.com/。
查看原文
查看缓存全文

缓存时间: 2026/09/22 07:28

论文页面 - 像世界模型一样思考,像VLA一样行动:将世界模型表征蒸馏到紧凑的机器人策略中

来源:https://huggingface.co/papers/2609.24682

摘要

视觉-语言-动作(VLA)模型将观测映射到动作时,其优化目标并未考虑世界如何响应,因此其鲁棒性主要受限于数据覆盖范围。世界模型恰恰包含了这种缺失的优化目标,并因此具有更好的基础性,然而将未来状态向前滚动需要数秒的决策时间,这使其无法应用于控制回路。我们证明这两者是可以分离的。世界模型对物理场景的认知存在于其内部特征中;生成未来状态仅仅是产生这些特征的优化目标,因此这种基础性可以被继承,而生成机制则可以摒弃。我们在常规的VLA训练中加入了一个特征对齐项:在训练前,一个冻结的世界模型在训练帧上运行一次并缓存结果,学生模型则学习与该缓存保持一致。训练时无需加载教师模型,投影器在训练后即被丢弃,最终部署的策略与未蒸馏的基线完全相同,在消费级RTX 5090上运行仅需32毫秒、占用1.86GB内存,因此所有性能提升均归因于表征能力,而非额外容量或测试时计算。一个0.8B参数的学生模型在LIBERO上达到97.9%的准确率,在RoboCasa-GR1人形机器人操作任务上从48.2%提升至50.5%,且相同的目标可迁移至真实硬件,适用于单臂和双臂平台。这种提升在学生模型规模、骨干网络、对齐层和教师模型变化时依然存在,表明这是一种广泛适用的表征先验,而非特定两个网络之间的脆弱对齐。 项目页面:https://thaw-vla.trung-dt.com/

查看arXiv页面 (https://arxiv.org/abs/2609.24682) 查看PDF (https://arxiv.org/pdf/2609.24682) 项目页面 (https://thaw-vla.trung-dt.com/) GitHub0 (https://github.com/trungdt880/THAW-VLA) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.24682)

在您的智能体中获取此论文:

hf papers read 2609.24682

没有最新的CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型的README.md中引用 arxiv.org/abs/2609.24682 以从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集的README.md中引用 arxiv.org/abs/2609.24682 以从本页面链接。

引用此论文的Space0

没有Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2609.24682 以从本页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

机器人需要的不仅仅是VLA和世界模型

Hugging Face Daily Papers

本文立场论文认为,推进机器人智能需要将非结构化的行为数据通过专门的接口进行整合,用于标注、具身映射、世界建模和奖励推断,而不是仅仅依赖扩展视觉-语言-动作(VLA)模型和世界模型。

SmolVLA:一种经济高效的视觉-语言-动作模型

Papers with Code Trending

SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。