MoZoo:释放视频扩散在动物毛发与肌肉模拟中的威力
摘要
MoZoo 是一个生成式扩散模型,能够从粗糙网格合成高保真动物视频,采用了新颖的注意力机制和合成到真实的数据管道。
查看缓存全文
缓存时间: 2026/05/29 03:00
论文页面 - MoZoo: 在动物毛发和肌肉模拟中释放视频扩散模型的潜力
来源: https://huggingface.co/papers/2605.13857
摘要
MoZoo 利用扩散模型,通过新颖的注意力机制和合成到真实的数据流水线,从粗糙网格生成高保真动物视频。
创作电影级动物特效需要对肌肉和毛发动力学进行精确建模,这在传统制作流程中既费时又计算成本高昂。尽管生成式扩散模型 (https://huggingface.co/papers?q=generative%20diffusion%20models) 在多种艺术工作流中展现出潜力,但它们在动物高保真模拟方面的能力尚未被充分挖掘。我们提出 MoZoo,一种生成式动力学求解器,它绕过传统细化步骤,在多模态引导下从粗糙网格合成高保真动物视频。我们提出角色感知 RoPE (RAR-RoPE),通过基于角色的索引重映射 (https://huggingface.co/papers?q=role-based%20index%20remapping) 来同步运动对齐 (https://huggingface.co/papers?q=motion%20alignment),同时通过固定的时间偏移 (https://huggingface.co/papers?q=temporal%20offsets) 解耦参考信息。作为补充,非对称解耦注意力 (https://huggingface.co/papers?q=Asymmetric%20Decoupled%20Attention) 对潜在序列 (https://huggingface.co/papers?q=latent%20sequence) 进行划分,以强制实现单向信息流,有效防止特征干扰 (https://huggingface.co/papers?q=feature%20interference) 并提高计算效率。为了解决高质量训练数据稀缺的问题,我们引入了 MoZoo-Data,一个合成到真实流水线 (https://huggingface.co/papers?q=synthetic-to-real%20pipeline),它利用渲染引擎 (https://huggingface.co/papers?q=rendering%20engine) 和逆映射方法 (https://huggingface.co/papers?q=inverse%20mapping%20approach) 构建了一个大规模配对准序列数据集。此外,我们还建立了 MoZooBench,一个包含 120 个网格-视频对 (https://huggingface.co/papers?q=mesh-video%20pairs) 的综合基准 (https://huggingface.co/papers?q=comprehensive%20benchmark)。实验结果表明,MoZoo 能够在多种动物骨架和布局下实现高保真毛发模拟 (https://huggingface.co/papers?q=fur%20simulation),并保持优越的时间与结构一致性 (https://huggingface.co/papers?q=structural%20consistency)。
查看arXiv页面 (https://arxiv.org/abs/2605.13857)查看PDF (https://arxiv.org/pdf/2605.13857)项目页面 (https://orange-3dv-team.github.io/MoZoo/)GitHub85 (https://github.com/Orange-3DV-Team/MoZoo)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.13857)
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.13857 可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.13857 可从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.13857 可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 可从此页面链接。
相似文章
robbyant/lingbot-video-moe-30b-a3b
LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。
MoVerse: 实时视频世界建模与全景高斯脚手架
MoVerse 通过创建360°全景图和3D高斯脚手架,从单张图像生成实时交互式视频,利用基于扩散的技术实现高效渲染。
Kirin:基于野外视频的动物运动生成
Kirin通过从野外视频重建3D动物运动来创建AiM3D数据集,并生成基于文本和图像条件的运动以动画化3D网格。
AnyMo:基于掩码建模的任意模态条件运动生成扩展
本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。
MiniWorld:从零训练视频世界模型的民主化
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。