ShadowDancer:通过从视频及其阴影学习统一动力学表征,教会视频世界模型任意动作
摘要
ShadowDancer 提出了一种方法,通过从视频及其阴影中学习统一的动力学表征,实现交互式视频世界模型的任意动作、帧级控制,从而在没有标签或运动估计器的情况下实现可迁移的动作控制。实验表明,与基线相比,动作迁移和展开性能均有提升。
查看缓存全文
缓存时间: 2026/07/31 09:53
论文页面 - ShadowDancer:通过从视频及其阴影学习统一动态表示,教会视频世界模型任意动作
来源:https://huggingface.co/papers/2607.28362
摘要
我们提出了ShadowDancer,一种新颖的方法,用于交互式视频世界模型的任意动作、帧级控制。障碍在于表示层面:现有接口要么松散地编码动作,让模型即兴发挥其展开方式;要么通过服务于单一系列且难以获取的结构化信号精确编码动作,因此跨多种动态的精确控制仍然不切实际。演示视频是自然的补救措施,逐帧指定任意动态;然而视频仅通过一种特定的外观来展示其动态,即底层动态的单个阴影,因此从演示中学习的动作难以迁移到新场景。ShadowDancer通过两个关键创新解决这个问题:(1)影子对,即在独立重新采样的外观下重放相同动态的视频对,由我们的ShadowLibrary大规模构建,使得一个动态系列只有在能够构造这样的对时才变得可控;(2)跨阴影预测,通过从一个阴影预测另一个阴影来学习动作,这样配对重新采样的内容在构造上被丢弃,而保留的内容则成为动作,产生一个统一的动态表示,驱动一个块因果世界模型。任何演示片段因此成为可复用的动作资产,可以在没有动作标签、运动估计器或微调的情况下在新环境中重放。实验表明,与强大的潜在动作和交互式世界模型基线相比,在多种动态系列中,动作迁移和长动作展开均得到改善,在展开比较中平均盲测胜率为86%。我们在 https://ShadowDancer-1.github.io 展示视频结果。
查看 arXiv 页面 (https://arxiv.org/abs/2607.28362)查看 PDF (https://arxiv.org/pdf/2607.28362)项目页面 (https://shadowdancer-1.github.io/)GitHub6 (https://github.com/AlayaLab/ShadowDancer)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28362)
在您的 agent 中获取这篇论文:
hf papers read 2607\.28362
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.28362,即可从此页面链接到它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.28362,即可从此页面链接到它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.28362,即可从此页面链接到它。
包含此论文的收藏集1
相似文章
Masked Visual Actions:统一世界建模
介绍了Masked Visual Actions,一种像素空间控制接口,将动作表示为部分揭示的轨迹,使得单个模型能够充当前向动力学模型、恢复机器人行为,并仅用15小时的训练数据支持基于模型的规划和逆向建模。
ZimaBlue: 通过可扩展的视频预训练进化可泛化的世界行动模型
ZimaBlue 引入了一个可扩展框架,从大规模自我中心视频中学习可泛化的世界行动模型,通过三阶段课程和慢-快架构,显著提升了零样本机器人操作能力。
Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning
Introduces Latent Dynamics Reasoning (LDR), a video world model that integrates kinematic dynamics in a structured latent space, enabling extrapolation of learned dynamics far beyond training distributions while using far fewer parameters and running much faster than video diffusion baselines.
从动作到世界建模的可迁移动态先验学习
本文介绍了A2World,一种基于扩散的世界模型,在大规模机器人操作数据上预训练,以学习可迁移的动态先验。该模型可适配为真实世界模拟器(A2World-sim)用于策略评估,或视频-动作联合预测模型(A2World-policy)用于动作预测,展示了在模拟器中心和策略中心的机器人学习中的优势。
τ_0-WM: 用于机器人操作的统一视频-动作世界模型
τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。