InternW0-Δ:使用超过20,000小时开放数据连接预测动力学与动作的世界动作模型
摘要
InternW0-Δ是一个统一的世界动作模型,使用Mixture-of-Transformers框架整合视觉动力学、语义、几何和动作,在超过20,000小时的机器人操作开放数据上预训练。它在仿真和真实机器人中展示出强大性能,并将开源。
查看缓存全文
缓存时间: 2026/09/28 04:02
论文页面 - InternW0-Δ:一个连接预测动力学与动作的世界行动模型,基于20K+小时的开放数据
来源:https://huggingface.co/papers/2609.31394 发布于9月25日
#2 每日论文 (https://huggingface.co/papers/date/2026-09-28) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
世界行动模型(WAMs)联合建模视觉动力学与动作生成,以实现通用机器人操控。一个核心挑战是将来自大规模预训练模型的先验知识——包括视觉动力学、场景语义、几何与运动——整合到一个统一的框架中,用于机器人动作生成。我们推出了InternW0-Δ,一个在异构语料库上进行预训练的统一WAM,其性能在仿真基准测试和真实机器人平台上超越了先前的方法。InternW0-Δ在混合Transformer(MoT)框架内结合了预训练的视觉动力学、场景级语义、4D几何与运动先验以及动作生成。一个预训练的视频专家与动作专家在冻结VLM提供的语义指导下进行交互,同时一个预训练的4D基础模型通过仅训练蒸馏注入几何与运动先验。我们进一步引入了“因果印记”,它从仅训练的未来监督中学习与未来相关的场景变化,并在推理时无需未来视频展开即可直接向动作专家提供预测性表示。为了进行大规模联合训练,我们构建了一个包含机器人演示、UMI数据、以自我为中心的人类演示和Ego2Robot数据的异构语料库,这些数据在共同的状态-动作表示下进行了策划与对齐。生成的语料库包含超过20K小时的处理后训练数据,据我们所知,这是同类中最大的开源语料库。我们在此语料库上对InternW0-Δ进行了预训练,并展示了其在仿真基准测试和真实机器人平台上的强大性能。在许可允许的情况下,我们将开源训练代码、模型权重、基础设施、数据处理流程和处理后的数据。项目页面:https://internrobotics.github.io/InternW0-Delta/
查看arXiv页面 (https://arxiv.org/abs/2609.31394) 查看PDF (https://arxiv.org/pdf/2609.31394) 项目页面 (https://internrobotics.github.io/InternW0-Delta/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.31394)
在您的代理中获取本文:
hf papers read 2609.31394
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型链接此论文
在模型的README.md中引用arxiv.org/abs/2609.31394,即可从本页面链接。
引用本文的数据集0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2609.31394,即可从本页面链接。
引用本文的Spaces0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2609.31394,即可从本页面链接。
包含本文的合集0
没有合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection) 即可从本页面链接。
相似文章
InternW0:用于高效真实世界交互的基础物理世界模型
InternW0是来自Shanghai AI Laboratory的基础物理世界模型,联合学习视觉动态与机器人控制以实现高效的真实世界交互,在异质数据上训练,并在科学任务上进行评估。
WorldDiT:统一的世界与动作建模扩散架构
WorldDiT是一种统一的扩散变换器架构,它将动作生成与视觉世界建模相结合,在LIBERO仿真套件上取得了强劲性能,且无需依赖大型预训练视觉语言模型。
τ_0-WM: 用于机器人操作的统一视频-动作世界模型
τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。
世界-动作交互模型的DAWN
本文介绍了DAWN,一种用于世界-动作交互模型(WAIMs)的潜在生成基线,通过递归细化联合建模场景演化与动作生成,在自动驾驶场景中实现了强大的长时域规划性能。
Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models (29 minute read)
Dyna-2 is a world-action model pre-trained on over a million hours of human video, showing scaling laws on human data and a human-to-robot transfer scaling law for zero-shot robot performance.