ZimaBlue: 通过可扩展的视频预训练进化可泛化的世界行动模型
摘要
ZimaBlue 引入了一个可扩展框架,从大规模自我中心视频中学习可泛化的世界行动模型,通过三阶段课程和慢-快架构,显著提升了零样本机器人操作能力。
查看缓存全文
缓存时间: 2026/09/02 03:44
论文页面 - ZimaBlue:通过可扩展的视频预训练进化出可泛化的世界动作模型
来源:https://huggingface.co/papers/2609.00188
发布于 8月 31日
#3 每日热门论文 (https://huggingface.co/papers/date/2026-09-02)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
ZimaBlue 通过三阶段课程学习和慢-快架构,从大规模以自我为中心的视频中学习可泛化的世界动作模型,显著提升了零样本机器人操作能力。
机器人操作面临一个基本的规模化挑战:鲁棒的泛化需要广泛的身体经验,但带有动作标签的机器人轨迹数据采集成本高昂且多样性有限。以自我为中心的视频提供了一种更具扩展性的具身体验来源,捕捉了跨多样环境中的物体交互、接触动力学、工具使用和长程行为。核心挑战是如何将这种丰富但无动作的经验转化为有效的机器人控制。我们提出了 ZimaBlue,一个从大规模视频中学习可泛化世界动作模型(WAMs)的可扩展框架。ZimaBlue 遵循三阶段训练课程:首先在大规模人类和机器人以自我为中心的视频上进行因果性具身体验预训练,然后通过视频-动作中期训练,利用统一的动作表示,将学习到的视觉动态与异构机器人轨迹进行关联,最后将模型专门化以部署到目标机器人。为了使生成式 WAMs 能够用于实时控制,ZimaBlue 进一步采用了异步慢-快双系统架构,其中高容量的慢世界模型提供可泛化的时空表征,而轻量级的快分支可在 NVIDIA RTX 4090 上实现 30 Hz 的动作预测。在真实机器人零样本评估中,仅从目标机器人数据扩展到超过 120,000 小时的具身体验视频,成功率从 36.1% 提升到 77.8%。ZimaBlue 在多个基准测试中均表现出色,尤其是在未见任务上取得了显著提升。
查看 arXiv 页面 (https://arxiv.org/abs/2609.00188)查看 PDF (https://arxiv.org/pdf/2609.00188)项目主页 (https://zimablue-wam.github.io/)GitHub3 (https://github.com/ZimaBlue-WAM/ZimaBlue)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.00188)
通过您的 Agent 获取此论文:
hf papers read 2609\.00188
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.00188 即可从本页面链接该模型。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.00188 即可从本页面链接该数据集。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.00188 即可从本页面链接该 Space。
包含此论文的合集0
没有合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection) 即可从本页面链接该合集。
相似文章
@HuggingPapers:将视频预训练扩展到12万小时 ZimaBlue将视频缩放视为实现可泛化世界行动模型的途径……
将视频预训练扩展到12万小时,可将世界行动模型在真实机器人上的零样本成功率从36.1%提升至77.8%,实现更快的动作预测。
Zero-WAM:基于人类视频的上下文世界-动作建模,用于开放任务泛化
Zero-WAM 是一个因果视频-动作模型,通过基于上下文的人类视频指导,实现对未见过任务的零样本机器人操作,并利用 HumanGen 数据集和未来块预测目标来提高泛化能力。
EgoPhys:从第一人称视频学习可变形物体的通用物理模型
EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。
MiniWorld:从零训练视频世界模型的民主化
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。
世界模型自蒸馏:训练世界模型解决通用任务
一个可扩展的框架结合了自蒸馏和强化学习,将任务解决能力从视觉语言模型迁移到视频扩散模型,无需标注的任务-视频数据。