InternW0:用于高效真实世界交互的基础物理世界模型

Hugging Face Daily Papers 论文

摘要

InternW0是来自Shanghai AI Laboratory的基础物理世界模型,联合学习视觉动态与机器人控制以实现高效的真实世界交互,在异质数据上训练,并在科学任务上进行评估。

物理智能不仅需要预测世界可能如何演变:预测必须在世界持续变化时保持可操作性。我们推出了InternW0,这是Shanghai AI Laboratory的InternW物理世界模型系列的首个实例,它围绕全模态接口、异步多频率处理以及在部分观察和外部影响下的局部物理建模构建。InternW0通过带有流匹配的非对称视频-动作架构联合学习未来视觉动态和连续机器人控制。一个高容量视频专家提供更长期的预测上下文,而一个轻量级动作专家在更快的时间尺度上操作。InternW0不是为每个动作更新重新生成未来,而是重用分层K/V,并通过观察条件上下文路由将其适应到新观察到的状态。特定领域接口和软提示支持异质体现,而接触感知后训练结合了力和触觉信号以用于接触丰富的操作。我们在大约7200小时的异质机器人和自我中心数据上训练InternW0,包括EgoLab,一个275小时的真实实验室自我中心数据集。评估涵盖模拟基准和现实世界的科学任务,包括一个15阶段的金属-有机框架合成工作流程和一个5阶段的接触和力感知灵巧操作,用于通用定量移液。这些结果推动了可扩展、异步和科学原生的物理世界模型,以实现通用且高效的真实世界交互。
查看原文
查看缓存全文

缓存时间: 2026/09/24 03:39

论文页面 - InternW0:用于高效真实世界交互的基础物理世界模型

来源:https://huggingface.co/papers/2609.27656 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

物理智能不仅需要预测世界可能如何演变,还需要在世界持续变化时保持预测的可操作性。我们推出了 InternW0,这是上海人工智能实验室 InternW 物理世界模型系列的首个实例,它围绕全模态接口、异步多频率处理以及在部分观测和外部影响下的局部物理建模而构建。InternW0 通过一种采用流匹配的非对称视频-动作架构,联合学习未来视觉动态和连续机器人控制。一个高容量的视频专家提供更长期的预测上下文,而一个轻量级的动作专家则以更快的时间尺度运行。InternW0 不必为每次动作更新重新生成未来,而是重用逐层的 K/V,并通过基于观测的上下文路由将其适应到新观测到的状态。特定领域的接口和软提示支持异构的具身形态,而接触感知后训练则将力和触觉信号融入到接触丰富的操作任务中。我们在大约 7,200 小时的异构机器人和自我中心数据上训练了 InternW0,其中包括 EgoLab——一个时长 275 小时的真实实验室自我中心数据集。评估涵盖了仿真基准和真实世界的科学任务,包括一个 15 阶段的金属有机框架合成工作流,以及一个 5 阶段的、接触和力感知的通用定量移液灵巧操作。这些结果推动了可扩展、异步且科学原生的物理世界模型的发展,以实现通用高效的现实世界交互。

查看 arXiv 页面 (https://arxiv.org/abs/2609.27656)查看 PDF (https://arxiv.org/pdf/2609.27656)项目页面 (https://internrobotics.github.io/internw0/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.27656)

通过您的智能体获取此论文:

hf papers read 2609.27656

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.27656 以将其链接到此页面。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.27656 以将其链接到此页面。

引用此论文的 Space 0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2609.27656 以将其链接到此页面。

包含此论文的收藏夹0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章

面向机器人控制的上下文世界建模

Hugging Face Daily Papers

本文介绍了上下文世界建模(ICWM),这是一个使机器人策略能够从自身生成的交互中推断系统变量的框架,通过将系统识别视为一个上下文自适应问题,无需参数更新即可适应新的配置。在模拟和真实世界实验中,它在处理新的相机视角时优于标准的VLA基线。

世界模型与物理AI教程

arXiv cs.AI

本教程提供了一个统一的框架,将多种世界建模方法整合在一起,用于物理AI,涵盖了显式世界模型和隐式世界模型及其在预测、推理和规划中的作用。

τ_0-WM: 用于机器人操作的统一视频-动作世界模型

Hugging Face Daily Papers

τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。

World in World: 用世界模型探索世界

Hugging Face Daily Papers

本文介绍了 World in World,这是一个无需训练的接口,可以通过使用对应引导查询和基于证据的注意力指导,在冻结的自回归视频世界模型中实现灵活的相机和时间控制。