MoZoo:释放视频扩散在动物毛发与肌肉模拟中的威力

Hugging Face Daily Papers 论文

摘要

MoZoo 是一个生成式扩散模型,能够从粗糙网格合成高保真动物视频,采用了新颖的注意力机制和合成到真实的数据管道。

电影级动物特效的创作需要精确模拟肌肉和毛发动态,这一过程在传统生产流程中既劳动密集又计算密集。尽管生成式扩散模型在多种艺术工作流中展现出潜力,但其在高保真动物模拟方面的能力尚未得到充分利用。我们提出了 MoZoo,一个生成式动力学求解器,通过多模态引导从粗网格合成高保真动物视频,绕过了传统细化步骤。我们提出了角色感知旋转位置编码(RAR-RoPE),它利用基于角色的索引重映射来同步运动对齐,同时通过固定时间偏移解耦参考信息。互补地,非对称解耦注意力对潜在序列进行划分,以强制单向信息流,有效防止特征干扰并提高计算效率。为解决高质量训练数据稀缺的问题,我们引入了 MoZoo-Data,一个合成到真实的数据流水线,利用渲染引擎和逆映射方法构建大规模配对序列数据集。此外,我们建立了 MoZooBench,一个包含120组网格-视频对的全面基准。实验结果表明,MoZoo 在多样的动物骨架与布局下实现了高保真毛发模拟,保持了卓越的时间与结构一致性。
查看原文
查看缓存全文

缓存时间: 2026/05/29 03:00

论文页面 - MoZoo: 在动物毛发和肌肉模拟中释放视频扩散模型的潜力

来源: https://huggingface.co/papers/2605.13857

摘要

MoZoo 利用扩散模型,通过新颖的注意力机制和合成到真实的数据流水线,从粗糙网格生成高保真动物视频。

创作电影级动物特效需要对肌肉和毛发动力学进行精确建模,这在传统制作流程中既费时又计算成本高昂。尽管生成式扩散模型 (https://huggingface.co/papers?q=generative%20diffusion%20models) 在多种艺术工作流中展现出潜力,但它们在动物高保真模拟方面的能力尚未被充分挖掘。我们提出 MoZoo,一种生成式动力学求解器,它绕过传统细化步骤,在多模态引导下从粗糙网格合成高保真动物视频。我们提出角色感知 RoPE (RAR-RoPE),通过基于角色的索引重映射 (https://huggingface.co/papers?q=role-based%20index%20remapping) 来同步运动对齐 (https://huggingface.co/papers?q=motion%20alignment),同时通过固定的时间偏移 (https://huggingface.co/papers?q=temporal%20offsets) 解耦参考信息。作为补充,非对称解耦注意力 (https://huggingface.co/papers?q=Asymmetric%20Decoupled%20Attention) 对潜在序列 (https://huggingface.co/papers?q=latent%20sequence) 进行划分,以强制实现单向信息流,有效防止特征干扰 (https://huggingface.co/papers?q=feature%20interference) 并提高计算效率。为了解决高质量训练数据稀缺的问题,我们引入了 MoZoo-Data,一个合成到真实流水线 (https://huggingface.co/papers?q=synthetic-to-real%20pipeline),它利用渲染引擎 (https://huggingface.co/papers?q=rendering%20engine) 和逆映射方法 (https://huggingface.co/papers?q=inverse%20mapping%20approach) 构建了一个大规模配对准序列数据集。此外,我们还建立了 MoZooBench,一个包含 120 个网格-视频对 (https://huggingface.co/papers?q=mesh-video%20pairs) 的综合基准 (https://huggingface.co/papers?q=comprehensive%20benchmark)。实验结果表明,MoZoo 能够在多种动物骨架和布局下实现高保真毛发模拟 (https://huggingface.co/papers?q=fur%20simulation),并保持优越的时间与结构一致性 (https://huggingface.co/papers?q=structural%20consistency)。

查看arXiv页面 (https://arxiv.org/abs/2605.13857)查看PDF (https://arxiv.org/pdf/2605.13857)项目页面 (https://orange-3dv-team.github.io/MoZoo/)GitHub85 (https://github.com/Orange-3DV-Team/MoZoo)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.13857)

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.13857 可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.13857 可从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.13857 可从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 可从此页面链接。

相似文章

robbyant/lingbot-video-moe-30b-a3b

Hugging Face Models Trending

LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。

AnyMo:基于掩码建模的任意模态条件运动生成扩展

Hugging Face Daily Papers

本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。

MiniWorld:从零训练视频世界模型的民主化

Hugging Face Daily Papers

MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。