OmniHumanoid: 流式跨实体视频生成与无需配对自适应
摘要
OmniHumanoid是一个框架,通过分解运动迁移和实体特定自适应,利用非配对数据和分支隔离注意力减少干扰,实现可扩展的跨实体视频生成。
查看缓存全文
缓存时间: 2026/05/18 06:24
论文页面 - OmniHumanoid:基于无配对自适应的流式跨具身视频生成
来源:https://huggingface.co/papers/2605.12038
摘要
OmniHumanoid 通过将运动迁移与具身自适应进行分解,实现了跨具身视频生成,从而能够利用非配对数据,可扩展地适配新的类人机器人形态。
跨具身视频生成(https://huggingface.co/papers?q=Cross-embodiment%20video%20generation)旨在将动作在不同类人机器人形态(https://huggingface.co/papers?q=humanoid%20embodiments)之间进行迁移,例如从人到机器人、从机器人到机器人,从而为具身智能实现可扩展的数据生成。该设置面临的一个主要挑战是:运动动力学在不同形态之间部分可迁移,而外观和形态则具有具身特异性。现有方法常常将这些因素混杂在一起,且许多方法要求每个目标形态都有配对数据,这限制了向新机器人的可扩展性。我们提出了 OmniHumanoid,一个将可迁移运动学习与具身自适应(https://huggingface.co/papers?q=embodiment-specific%20adaptation)相分解的框架。我们的方法从覆盖多种形态的运动对齐配对视频(https://huggingface.co/papers?q=motion-aligned%20paired%20videos)中学习共享的运动迁移(https://huggingface.co/papers?q=motion%20transfer)模型,同时仅需利用非配对视频,通过轻量级具身自适应模块来适配新形态。为了减少运动迁移(https://huggingface.co/papers?q=motion%20transfer)与具身自适应之间的干扰,我们进一步引入了分支隔离注意力(https://huggingface.co/papers?q=branch-isolated%20attention)设计,将运动条件与具身特异性调制分离开来。此外,我们构建了一个合成跨具身数据集(https://huggingface.co/papers?q=synthetic%20cross-embodiment%20dataset),其中包含在多种类人物资、场景和视角下渲染的运动对齐配对视频(https://huggingface.co/papers?q=motion-aligned%20paired%20videos)。在合成和真实世界基准上的实验表明,OmniHumanoid 实现了高运动保真度(https://huggingface.co/papers?q=motion%20fidelity)和具身一致性(https://huggingface.co/papers?q=embodiment%20consistency),同时无需重新训练共享运动模型,即可实现向未见过的类人机器人形态(https://huggingface.co/papers?q=humanoid%20embodiments)的可扩展适配。
查看 arXiv 页面(https://arxiv.org/abs/2605.12038)查看 PDF(https://arxiv.org/pdf/2605.12038)GitHub1(https://github.com/showlab/OmniHumanoid)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.12038)
引用本论文的模型0
暂无模型引用本论文
请在模型 README.md 中引用 arxiv.org/abs/2605.12038 以从本页面链接。
引用本论文的数据集0
暂无数据集引用本论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.12038 以从本页面链接。
引用本论文的空间0
暂无 Space 引用本论文
请在 Space README.md 中引用 arxiv.org/abs/2605.12038 以从本页面链接。
包含本论文的收藏集0
暂无收藏集包含本论文
请将本论文添加到一个收藏集(https://huggingface.co/new-collection)以从本页面链接。
相似文章
Ex-Omni-2D:具有原生视觉呈现的表现力全模态对话模型
Ex-Omni-2D 是一个全模态对话框架,通过视觉思维计划和蒸馏流式视频生成器,生成协调一致的文本、语音和参考条件视频响应,实现了实用的质量-效率权衡。
OmniVAE:具有跨模态对齐的音频-视频VAE,用于联合生成
OmniVAE是一种联合训练的音频-视频VAE,使用分段级对比学习和特征蒸馏来对齐潜在空间,从而提升文本到音频-视频生成中的联合生成质量和同步性。
Light-Omni:带长期记忆的智能体视频理解中反射优先于推理
Light-Omni是一个多模态智能体框架,用于高效视频理解,通过双上下文状态(全局状态和参数化潜在状态)避免迭代推理,实现更快更准确的处理,并显著提升速度和节省内存。
OmniDirector: 通用多镜头相机克隆,无需交叉配对数据
一个统一的框架,通过网格运动视频和多模态扩散变换器实现相机运动克隆,无需交叉配对数据即可实现导演级别的控制。
AnyMo:基于掩码建模的任意模态条件运动生成扩展
本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。