UniMate:一个统一模型,用于动画化多样骨架

Hugging Face Daily Papers 论文

摘要

UniMate是一个统一的扩散变换器模型,能够从文本和绑定了3D资产为多样骨架生成关节运动,无需针对每个骨架进行重新训练。它利用拓扑感知注意力和一个大型精选数据集。

近年来,自动绑骨技术的进步已能大规模提供动画就绪的3D资产,但生成驱动它们的动作仍然是一个瓶颈。现有的学习动画器受拓扑约束:它们依赖于特定类别的模板,或需要在推理时对每个骨架进行微调并提供参考动作。我们提出UniMate,一个统一的基础模型,能够从绑定了3D资产和文本提示为任意骨架合成关节运动,无需测试时优化或针对每个骨架的重新训练。UniMate引入了一个拓扑感知的扩散变换器,通过三种机制将骨架拓扑整合到注意力机制中:(1) 基于成对关节关系和测地距离的图感知注意力偏差;(2) 一种谱旋转位置嵌入,通过图拉普拉斯算子将RoPE推广到任意运动树;(3) 一个全局拓扑条件器,从静止姿势骨架中通过注意力池化得到。我们还策划了UniML3D,包含13,006个动作序列,涵盖双足、四足、鸟类、海洋、昆虫、蛇形和关节刚体对象,具有统一的规范化和文本配对。基于此数据集训练,UniMate在质量、泛化能力和效率上超越了最先进的基线,并支持零样本跨拓扑迁移、插值、扩展和文本引导编辑。我们的项目页面可在 https://linzhanmou.com/unimate/ 访问。
查看原文
查看缓存全文

缓存时间: 2026/09/07 16:17

论文页面 - UniMate:一个用于驱动多样化骨骼动画的统一模型

来源:https://huggingface.co/papers/2609.05415

摘要

UniMate 是一个统一的扩散 Transformer 模型,能够根据文本提示和已绑定的 3D 资产,为任意骨骼生成关节运动,且无需针对每个骨骼进行重新训练。它采用拓扑感知注意力和经过精心整理的大规模动作数据集实现这一目标。

近年来,自动绑定技术的进步已能大规模生产可用于动画的 3D 资产,然而为这些资产生成驱动动作仍然是一个瓶颈。现有的学习型动画生成器受限于拓扑结构:它们依赖特定类别的模板,或需要在推理时对每个骨骼进行微调并提供参考动作。我们提出了 UniMate,一个统一的基础模型,能够根据已绑定的 3D 资产和文本提示,为任意骨骼合成关节运动,无需测试时优化或针对每个骨骼的重新训练。UniMate 引入了一种拓扑感知扩散 Transformer,通过三种机制将骨骼拓扑信息融入注意力计算:(1) 基于成对关节关系和测地距离的图感知注意力偏置;(2) 谱旋转位置嵌入,通过图拉普拉斯算子将旋转位置嵌入推广到任意运动学树;(3) 从静止姿态骨骼中通过注意力池化得到的全局拓扑条件。我们还整理了 UniML3D 数据集,包含 13,006 个动作序列,涵盖双足、四足、鸟类、海洋生物、昆虫类、蛇形以及可动的刚体等类型,并进行了统一的规范化与文本配对。基于该数据集训练的 UniMate,在质量、泛化能力和效率方面均超越了现有基准模型,并支持零样本跨拓扑迁移、插值、扩展和文本引导编辑。我们的项目主页可通过 https://linzhanmou.com/unimate/ 访问。

查看 arXiv 页面 (https://arxiv.org/abs/2609.05415) 查看 PDF (https://arxiv.org/pdf/2609.05415) 项目主页 (https://linzhanmou.com/unimate/) GitHub49 (https://github.com/Friedrich-M/UniMate) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.05415)

在你的代理中获取这篇论文:

hf papers read 2609.05415

没有最新版本的 CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

没有模型链接到本文。

在模型的 README.md 中引用 arxiv.org/abs/2609.05415 即可从本页链接到该模型。

引用本文的数据集4

Linzhan/Truebones-ZOO-Annotations 查看器 • 31分钟前更新 • 3.62k • 1.36k (https://huggingface.co/datasets/Linzhan/Truebones-ZOO-Annotations)

Linzhan/Mixamo-Animations-Characters 查看器 • 31分钟前更新 • 2.56k • 1.22k • 1 (https://huggingface.co/datasets/Linzhan/Mixamo-Animations-Characters)

Linzhan/Objaverse-XL-Rigged-Animated 查看器 • 31分钟前更新 • 23.6k • 186 (https://huggingface.co/datasets/Linzhan/Objaverse-XL-Rigged-Animated)

Linzhan/Objaverse-XL-Rigged-Animated-Renders 查看器 • 31分钟前更新 • 4 • 63 (https://huggingface.co/datasets/Linzhan/Objaverse-XL-Rigged-Animated-Renders)

引用本文的空间0

没有空间链接到本文。

在空间的 README.md 中引用 arxiv.org/abs/2609.05415 即可从本页链接到该空间。

包含本文的收藏集1

相似文章

UniMesh:统一3D网格理解与生成

Hugging Face Daily Papers

UniMesh通过单一模型,借助Mesh Head、链式网格迭代编辑和自省纠错机制,同时完成3D网格生成与理解任务。

Wan-Animate-2:拓展角色动画模型的应用边界

Reddit r/LocalLLaMA

Wan-Animate-2 是一个全新的端到端角色动画框架,它在重新设计的 Diffusion Transformer 中直接输入驱动视频,实现高保真动作生成和身份保持。它还推出了一个轻量级变体,用于实时流式动画,并已发布开源权重。

MUGEN:用于高效运动理解与生成的统一框架

arXiv cs.LG

MUGEN 提出了一个统一的运动-语言框架,避免了离散码本和迭代解码,使用带有连续潜变量槽位的单一自适应长度自编码器以及一次性生成,在 HumanML3D 和 SnapMoGen 基准上实现了高效、高质量的文本到运动与运动到文本性能。