OmniHumanoid: 流式跨实体视频生成与无需配对自适应

Hugging Face Daily Papers 论文

摘要

OmniHumanoid是一个框架,通过分解运动迁移和实体特定自适应,利用非配对数据和分支隔离注意力减少干扰,实现可扩展的跨实体视频生成。

跨实体视频生成旨在在不同人形实体之间迁移运动,例如从人到机器人以及机器人到机器人,从而为具身智能实现可扩展的数据生成。在此设置中的一个主要挑战是,运动动力学在不同实体之间部分可迁移,而外观和形态仍是实体特有的。现有方法通常将这些因素纠缠在一起,且许多方法需要每个目标实体的配对数据,这限制了向新机器人的可扩展性。我们提出OmniHumanoid,一个将可迁移运动学习与实体特定自适应分解的框架。我们的方法从跨越多个实体的运动对齐配对视频中学习共享的运动迁移模型,同时通过轻量级实体特定适配器仅使用非配对视频适应新实体。为了减少运动迁移与实体自适应之间的干扰,我们进一步引入了一种分支隔离注意力设计,将运动条件与实体特定调制分开。此外,我们构建了一个合成跨实体数据集,该数据集使用各种人形资产、场景和视点渲染出运动对齐的配对视频。在合成和真实世界基准上的实验表明,OmniHumanoid在实现强运动保真度和实体一致性的同时,能够无需重新训练共享运动模型即可可扩展地适应未见的人形实体。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:24

论文页面 - OmniHumanoid:基于无配对自适应的流式跨具身视频生成

来源:https://huggingface.co/papers/2605.12038

摘要

OmniHumanoid 通过将运动迁移与具身自适应进行分解,实现了跨具身视频生成,从而能够利用非配对数据,可扩展地适配新的类人机器人形态。

跨具身视频生成(https://huggingface.co/papers?q=Cross-embodiment%20video%20generation)旨在将动作在不同类人机器人形态(https://huggingface.co/papers?q=humanoid%20embodiments)之间进行迁移,例如从人到机器人、从机器人到机器人,从而为具身智能实现可扩展的数据生成。该设置面临的一个主要挑战是:运动动力学在不同形态之间部分可迁移,而外观和形态则具有具身特异性。现有方法常常将这些因素混杂在一起,且许多方法要求每个目标形态都有配对数据,这限制了向新机器人的可扩展性。我们提出了 OmniHumanoid,一个将可迁移运动学习与具身自适应(https://huggingface.co/papers?q=embodiment-specific%20adaptation)相分解的框架。我们的方法从覆盖多种形态的运动对齐配对视频(https://huggingface.co/papers?q=motion-aligned%20paired%20videos)中学习共享的运动迁移(https://huggingface.co/papers?q=motion%20transfer)模型,同时仅需利用非配对视频,通过轻量级具身自适应模块来适配新形态。为了减少运动迁移(https://huggingface.co/papers?q=motion%20transfer)与具身自适应之间的干扰,我们进一步引入了分支隔离注意力(https://huggingface.co/papers?q=branch-isolated%20attention)设计,将运动条件与具身特异性调制分离开来。此外,我们构建了一个合成跨具身数据集(https://huggingface.co/papers?q=synthetic%20cross-embodiment%20dataset),其中包含在多种类人物资、场景和视角下渲染的运动对齐配对视频(https://huggingface.co/papers?q=motion-aligned%20paired%20videos)。在合成和真实世界基准上的实验表明,OmniHumanoid 实现了高运动保真度(https://huggingface.co/papers?q=motion%20fidelity)和具身一致性(https://huggingface.co/papers?q=embodiment%20consistency),同时无需重新训练共享运动模型,即可实现向未见过的类人机器人形态(https://huggingface.co/papers?q=humanoid%20embodiments)的可扩展适配。

查看 arXiv 页面(https://arxiv.org/abs/2605.12038)查看 PDF(https://arxiv.org/pdf/2605.12038)GitHub1(https://github.com/showlab/OmniHumanoid)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.12038)

引用本论文的模型0

暂无模型引用本论文

请在模型 README.md 中引用 arxiv.org/abs/2605.12038 以从本页面链接。

引用本论文的数据集0

暂无数据集引用本论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.12038 以从本页面链接。

引用本论文的空间0

暂无 Space 引用本论文

请在 Space README.md 中引用 arxiv.org/abs/2605.12038 以从本页面链接。

包含本论文的收藏集0

暂无收藏集包含本论文

请将本论文添加到一个收藏集(https://huggingface.co/new-collection)以从本页面链接。

相似文章

AnyMo:基于掩码建模的任意模态条件运动生成扩展

Hugging Face Daily Papers

本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。