ShadowDancer:通过从视频及其阴影学习统一动力学表征,教会视频世界模型任意动作

Hugging Face Daily Papers 论文

摘要

ShadowDancer 提出了一种方法,通过从视频及其阴影中学习统一的动力学表征,实现交互式视频世界模型的任意动作、帧级控制,从而在没有标签或运动估计器的情况下实现可迁移的动作控制。实验表明,与基线相比,动作迁移和展开性能均有提升。

我们提出了 ShadowDancer,一种实现交互式视频世界模型任意动作、帧级控制的新方法。障碍在于表征层面:现有接口要么松散地编码动作,将动作如何展开留给模型即兴发挥;要么通过服务于单一动力学家族且难以获取的结构化信号精确编码动作,因此跨多样动力学的精确控制仍然不切实际。演示视频是自然的补救措施,可以逐帧指定任意动力学;然而,视频只能通过一种特定的外观(即底层动力学的一个单一阴影)来展示其动力学,因此从演示中学习的动作难以迁移到新场景。ShadowDancer 通过两项关键创新解决这一问题:(1) 阴影对(shadow pairs),即在独立重采样的外观下重放相同动力学的视频对,由我们的 Shadow Library 大规模构建,因此一个动力学家族恰好在其可构建此类视频对时变得可控;(2) 跨阴影预测(cross-shadow prediction),通过从另一个阴影预测一个阴影来学习动作,从而通过构造丢弃配对中重新采样的任何内容,保留的内容则成为动作,产生一个统一的动力学表征,驱动块因果世界模型。任何演示片段因此成为可复用的动作资产,可在新环境中重放,无需动作标签、运动估计器或微调。实验表明,在多种动力学家族上,与强潜在动作和交互式世界模型基线相比,动作迁移和长时间动作展开性能均有提升,在展开比较中平均盲胜率为 86%。我们在 https://ShadowDancer-1.github.io 展示视频结果。
查看原文
查看缓存全文

缓存时间: 2026/07/31 09:53

论文页面 - ShadowDancer:通过从视频及其阴影学习统一动态表示,教会视频世界模型任意动作

来源:https://huggingface.co/papers/2607.28362

摘要

我们提出了ShadowDancer,一种新颖的方法,用于交互式视频世界模型的任意动作、帧级控制。障碍在于表示层面:现有接口要么松散地编码动作,让模型即兴发挥其展开方式;要么通过服务于单一系列且难以获取的结构化信号精确编码动作,因此跨多种动态的精确控制仍然不切实际。演示视频是自然的补救措施,逐帧指定任意动态;然而视频仅通过一种特定的外观来展示其动态,即底层动态的单个阴影,因此从演示中学习的动作难以迁移到新场景。ShadowDancer通过两个关键创新解决这个问题:(1)影子对,即在独立重新采样的外观下重放相同动态的视频对,由我们的ShadowLibrary大规模构建,使得一个动态系列只有在能够构造这样的对时才变得可控;(2)跨阴影预测,通过从一个阴影预测另一个阴影来学习动作,这样配对重新采样的内容在构造上被丢弃,而保留的内容则成为动作,产生一个统一的动态表示,驱动一个块因果世界模型。任何演示片段因此成为可复用的动作资产,可以在没有动作标签、运动估计器或微调的情况下在新环境中重放。实验表明,与强大的潜在动作和交互式世界模型基线相比,在多种动态系列中,动作迁移和长动作展开均得到改善,在展开比较中平均盲测胜率为86%。我们在 https://ShadowDancer-1.github.io 展示视频结果。

查看 arXiv 页面 (https://arxiv.org/abs/2607.28362)查看 PDF (https://arxiv.org/pdf/2607.28362)项目页面 (https://shadowdancer-1.github.io/)GitHub6 (https://github.com/AlayaLab/ShadowDancer)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28362)

在您的 agent 中获取这篇论文:

hf papers read 2607\.28362

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.28362,即可从此页面链接到它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.28362,即可从此页面链接到它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.28362,即可从此页面链接到它。

包含此论文的收藏集1

相似文章

Masked Visual Actions:统一世界建模

Hugging Face Daily Papers

介绍了Masked Visual Actions,一种像素空间控制接口,将动作表示为部分揭示的轨迹,使得单个模型能够充当前向动力学模型、恢复机器人行为,并仅用15小时的训练数据支持基于模型的规划和逆向建模。

从动作到世界建模的可迁移动态先验学习

Hugging Face Daily Papers

本文介绍了A2World,一种基于扩散的世界模型,在大规模机器人操作数据上预训练,以学习可迁移的动态先验。该模型可适配为真实世界模拟器(A2World-sim)用于策略评估,或视频-动作联合预测模型(A2World-policy)用于动作预测,展示了在模拟器中心和策略中心的机器人学习中的优势。

τ_0-WM: 用于机器人操作的统一视频-动作世界模型

Hugging Face Daily Papers

τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。