Motion Beyond Morphology:从抽象运动表示引导跨类别运动迁移

Hugging Face Daily Papers 论文

摘要

介绍了 Motion Beyond Morphology,一个通过学习抽象运动表示来在不同形态物体间迁移运动的框架,以及用于跨类别运动迁移的新 OpenVMT 数据集和基准。

视频运动迁移旨在利用参考视频中的动态来动画化目标物体。现有方法在很大程度上依赖于固定的结构对应关系,而当参考物体和目标物体在形态、关节结构或变形机制上存在显著差异时,这种对应关系变得难以定义。我们提出了 Motion Beyond Morphology 这一视角,旨在超越固定的结构对应关系进行运动迁移,通过保留在不同目标形态下仍有意义的动态来实现。为此,我们提出了一个两阶段框架。第一阶段学习互补的多粒度抽象运动视图,并利用它们引导跨类别视频对,以保留跨不同形态的可迁移动态。第二阶段将这些监督内化为直接的参考视频条件生成,从而在推理时无需显式运动提取。我们还引入了 OpenVMT-Dataset 和 OpenVMT-Bench,用于训练和评估图像条件和文本条件下的运动迁移,涵盖 Same、Near 和 Far 类别差距,并计划在论文接收后发布。大量实验证明了最先进的运动保真度和目标保持性能。项目主页:https://miniz233.github.io/MotionBeyondMorphology/
查看原文
查看缓存全文

缓存时间: 2026/08/04 09:38

论文页面 - Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations

来源: https://huggingface.co/papers/2608.01628

摘要

视频运动迁移旨在利用参考视频的动态来动画化目标对象。现有方法很大程度上依赖于固定的结构对应关系,而当参考对象与目标对象在形态、关节结构或变形机制上差异显著时,这种对应关系就会变得不明确。我们提出了 Motion Beyond Morphology(形态之外的动态迁移)这一视角,旨在超越固定的结构对应关系进行运动迁移,通过保留在不同目标形态下仍然有意义的动态来实现。为实现这一目标,我们提出了一个两阶段框架。第一阶段学习互补的多粒度抽象运动视图,并利用这些视图引导构建跨类别视频对,从而在多样化的形态之间保留可迁移的动态。第二阶段将这些监督内化为直接的参考视频条件生成,从而在推理时无需显式提取运动信息。我们还引入了 OpenVMT-Dataset 和 OpenVMT-Bench,用于在 Same、Near 和 Far 类别差距下训练和评估图像与文本条件的运动迁移,并计划在论文被接收后发布这两项资源。大量实验证明了我们在运动保真度和目标保留方面达到了最先进的性能。项目页面:https://miniz233.github.io/MotionBeyondMorphology/

查看 arXiv 页面 查看 PDF 项目页面 GitHub0 添加到收藏

在您的 agent 中获取此论文:

hf papers read 2608\.01628

尚未安装最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

暂无模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2608.01628,即可从此页面链接到它。

引用此论文的数据集 0

暂无数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.01628,即可从此页面链接到它。

引用此论文的 Spaces 0

暂无 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2608.01628,即可从此页面链接到它。

包含此论文的收藏 0

暂无收藏包含此论文

将此论文添加到收藏即可从此页面链接到它。

相似文章

Motion4Motion:推理时的跨主体运动迁移

Hugging Face Daily Papers

Motion4Motion 是一个无需训练的运动迁移框架,它从视频中建模运动流而不是依赖骨架结构,从而在推理时实现跨物种(例如,从人类到动物)的运动迁移。

MolmoMotion:语言引导的3D运动预测

Hugging Face Blog

MolmoMotion是一种新的语言引导的3D运动预测模型,它从视频帧和动作描述中预测未来的3D点轨迹,性能优于现有方法。同时,该模型还发布了一个大型数据集(MolmoMotion-1M)和一个基准(PointMotionBench)。

AnyMo:基于掩码建模的任意模态条件运动生成扩展

Hugging Face Daily Papers

本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。

语义运动锚点:弥合共语手势中的运动与意义

arXiv cs.CL

本文提出语义运动锚点,即共语手势检索与合成中手势运动的自然语言抽象。该方法将3D手势离散化为身体-手部运动基元,并将其与转录文本对齐,在文本到手势检索和生成中的用户偏好方面取得了显著提升。