Kirin:基于野外视频的动物运动生成

Hugging Face Daily Papers 论文

摘要

Kirin通过从野外视频重建3D动物运动来创建AiM3D数据集,并生成基于文本和图像条件的运动以动画化3D网格。

理解动物运动对于建模动物行为和生物力学至关重要,然而,由于高质量运动数据的稀缺,该领域的进展远落后于人类运动研究。虽然人类运动可以在受控环境中捕获,但对于大多数动物物种来说这并不实际,导致数据集规模小且领域受限,限制了下游应用如动画。为了解决这一挑战,我们引入了Kirin,一个从视频重建运动、大规模学习运动先验并生成可直接应用于动画资产的逼真运动的框架。使用大量野外动物视频,我们重建3D运动序列并与标题配对以创建AiM3D,这是第一个为四足动物提供对齐的视频-文本-运动元组的大规模数据集。基于此数据集,我们开发了一个视觉引导的运动生成模型,该模型以文本和图像为条件,指导在多种动物物种中生成逼真运动。最后,通过利用现成的图像到3D模型,我们使用生成的运动自动绑定和动画化3D网格,生成可渲染的动画动物。总之,我们的数据集和框架为大规模、基于文本和图像条件的动物运动生成和动画建立了新的基础。项目页面:https://kirin-ani.github.io/。
查看原文
查看缓存全文

缓存时间: 2026/09/03 03:50

论文页面 - Kirin:基于野外视频的动物运动生成

来源:https://huggingface.co/papers/2609.01823

摘要

Kirin 通过从视频中重建3D动物运动来构建大规模数据集,并生成可基于文本和图像条件的运动,用于驱动3D网格动画。

理解动物运动对于建模动物行为和生物力学至关重要,但由于高质量运动数据的稀缺,该领域的进展远落后于人类运动研究。虽然人类运动可以在受控环境中捕捉,但这对大多数动物物种而言并不实际,导致数据集规模小且领域受限,从而制约了动画等下游应用。为解决这一挑战,我们推出了Kirin——一个从视频中重建运动、大规模学习运动先验(https://huggingface.co/papers?q=motion%20priors)并生成可直接应用于动画资产的逼真运动的框架。利用大量野外动物视频,我们重建了3D运动序列,并将其与文本描述配对,创建了AiM3D——首个为四足动物(https://huggingface.co/papers?q=quadruped%20animals)提供对齐的视频-文本-运动三元组的大规模数据集。基于此数据集,我们开发了一个视觉引导运动生成(https://huggingface.co/papers?q=visual-guided%20motion%20generation)模型,该模型以文本和图像为条件,引导生成跨多种动物物种的逼真运动。最后,通过利用现成的图像转3D模型,我们使用生成的运动自动绑定并驱动3D网格,产出可直接渲染的动画动物。总体而言,我们的数据集和框架为大规模、基于文本和图像条件的动物运动生成与动画奠定了新基础。项目主页:https://kirin-ani.github.io/\。

查看arXiv页面(https://arxiv.org/abs/2609.01823)查看PDF(https://arxiv.org/pdf/2609.01823)项目主页(https://kirin-ani.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.01823)

在你的代理中获取本文:

hf papers read 2609\.01823

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型README.md中引用arxiv.org/abs/2609.01823以从本页面链接。

引用本文的数据集0

无数据集链接本文

在数据集README.md中引用arxiv.org/abs/2609.01823以从本页面链接。

引用本文的空间0

无空间链接本文

在空间README.md中引用arxiv.org/abs/2609.01823以从本页面链接。

包含本文的收藏0

无收藏包含本文

将本文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。

相似文章

SAM 3D Animal:基于提示的野外动物三维重建

Hugging Face Daily Papers

SAM 3D Animal提出了一个基于提示的框架,用于从单张野外图像中进行多动物三维重建,该框架基于SMAL+模型,在多个数据集上取得了最先进的结果。