ZimaBlue: 通过可扩展的视频预训练进化可泛化的世界行动模型

Hugging Face Daily Papers 论文

摘要

ZimaBlue 引入了一个可扩展框架,从大规模自我中心视频中学习可泛化的世界行动模型,通过三阶段课程和慢-快架构,显著提升了零样本机器人操作能力。

机器人操作面临一个基本的扩展挑战:稳健的泛化需要广泛的物理经验,但带动作标签的机器人轨迹收集昂贵且多样性有限。自我中心视频提供了一个更具扩展性的具身体验来源,捕捉了跨不同环境的物体交互、接触动态、工具使用和长期行为。核心挑战是如何将这种丰富但无动作的经验转化为有效的机器人控制。我们引入 ZimaBlue,一个从大规模视频中学习可泛化的世界行动模型(WAMs)的可扩展框架。ZimaBlue 遵循一个三阶段训练课程:首先在大规模人类和机器人自我中心视频上进行因果具身体验视频预训练,然后通过带有统一动作表示的视频-动作中期训练将学到的视觉动态应用于异构机器人轨迹,最后将模型专门化到目标机器人以进行部署。为了使生成式 WAMs 在实时控制中实用,ZimaBlue 进一步采用了异步的慢-快双系统架构,其中高容量的慢世界模型提供可泛化的时空表示,而轻量级的快分支在 NVIDIA RTX 4090 上实现 30 Hz 的动作预测。在真实机器人零样本评估中,仅从目标机器人数据扩展到超过 120,000 小时的具身体验视频,成功率从 36.1% 提升到 77.8%。ZimaBlue 在多个基准测试中表现出色,在未见任务上尤其有显著提升。
查看原文
查看缓存全文

缓存时间: 2026/09/02 03:44

论文页面 - ZimaBlue:通过可扩展的视频预训练进化出可泛化的世界动作模型

来源:https://huggingface.co/papers/2609.00188
发布于 8月 31日

#3 每日热门论文 (https://huggingface.co/papers/date/2026-09-02)
作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

ZimaBlue 通过三阶段课程学习和慢-快架构,从大规模以自我为中心的视频中学习可泛化的世界动作模型,显著提升了零样本机器人操作能力。

机器人操作面临一个基本的规模化挑战:鲁棒的泛化需要广泛的身体经验,但带有动作标签的机器人轨迹数据采集成本高昂且多样性有限。以自我为中心的视频提供了一种更具扩展性的具身体验来源,捕捉了跨多样环境中的物体交互、接触动力学、工具使用和长程行为。核心挑战是如何将这种丰富但无动作的经验转化为有效的机器人控制。我们提出了 ZimaBlue,一个从大规模视频中学习可泛化世界动作模型(WAMs)的可扩展框架。ZimaBlue 遵循三阶段训练课程:首先在大规模人类和机器人以自我为中心的视频上进行因果性具身体验预训练,然后通过视频-动作中期训练,利用统一的动作表示,将学习到的视觉动态与异构机器人轨迹进行关联,最后将模型专门化以部署到目标机器人。为了使生成式 WAMs 能够用于实时控制,ZimaBlue 进一步采用了异步慢-快双系统架构,其中高容量的慢世界模型提供可泛化的时空表征,而轻量级的快分支可在 NVIDIA RTX 4090 上实现 30 Hz 的动作预测。在真实机器人零样本评估中,仅从目标机器人数据扩展到超过 120,000 小时的具身体验视频,成功率从 36.1% 提升到 77.8%。ZimaBlue 在多个基准测试中均表现出色,尤其是在未见任务上取得了显著提升。

查看 arXiv 页面 (https://arxiv.org/abs/2609.00188)查看 PDF (https://arxiv.org/pdf/2609.00188)项目主页 (https://zimablue-wam.github.io/)GitHub3 (https://github.com/ZimaBlue-WAM/ZimaBlue)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.00188)

通过您的 Agent 获取此论文:

hf papers read 2609\.00188

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.00188 即可从本页面链接该模型。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.00188 即可从本页面链接该数据集。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.00188 即可从本页面链接该 Space。

包含此论文的合集0

没有合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 即可从本页面链接该合集。

相似文章

EgoPhys:从第一人称视频学习可变形物体的通用物理模型

Hugging Face Daily Papers

EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。

MiniWorld:从零训练视频世界模型的民主化

Hugging Face Daily Papers

MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。