BLARM:基于潜在刚性运动基元混合的视频驱动3D对象动画化

Hugging Face Daily Papers 论文

摘要

BLARM是一种前馈方法,通过混合潜在刚性运动基元从单目视频动画化3D网格,实现无需显式骨架的时序连贯动画。

我们介绍了BLARM,一种视频驱动的3D网格动画的前馈方法。给定一个单目视频和静态对象网格,BLARM预测一个时序连贯的动画网格,其运动遵循视频。不依赖显式骨架或直接回归高维顶点运动,我们使用一组紧凑的学习型、时变刚性运动分量和时不变的顶点到分量的蒙皮权重来表示动画。这产生了一个低维变形空间,无需骨骼、笼子、蒙皮权重或骨架注释。我们的架构通过分解的时空注意力,将几何导出的变形潜在变量条件化到视频特征上,然后解码由预测蒙皮权重混合的刚体变换。通过轨迹重建、熵正则化和运动感知对比学习训练,BLARM产生准确且时序稳定的动画,同时从单目视频中恢复紧凑、可解释的运动结构。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:54

论文页面 - BLARM:通过混合潜在刚性运动基元从视频动画化3D物体

来源:https://huggingface.co/papers/2608.31113

摘要

BLARM利用学习到的刚性运动分量和蒙皮权重,从单目视频预测时间上连贯的3D网格动画,无需显式骨骼绑定。

我们介绍了BLARM,一种用于视频驱动3D网格动画的前馈方法。给定单目视频和静态物体网格,BLARM预测一个时间上连贯的动画网格,其运动遵循视频。我们并非依赖显式骨骼绑定或直接回归高维顶点运动,而是使用一个紧凑的、学习到的时间变化刚性运动分量和时间不变的顶点到分量蒙皮权重集合来表示动画。这产生了一个低维的变形空间,无需骨架、笼子、蒙皮权重或骨骼绑定标注。我们的架构通过分解式时空注意力,将几何导出的变形潜变量条件化于视频特征,然后解码由预测蒙皮权重混合的刚性变换。通过轨迹重建、熵正则化和运动感知对比学习进行训练,BLARM在从单目视频恢复紧凑、可解释的运动结构的同时,生成准确且时间稳定的动画。

查看 arXiv 页面 (https://arxiv.org/abs/2608.31113) 查看 PDF (https://arxiv.org/pdf/2608.31113) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.31113)

引用本文的模型0

没有链接到本文的模型

在模型 README.md 中引用 arxiv.org/abs/2608.31113 以从此页面链接它。

引用本文的数据集0

没有链接到本文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2608.31113 以从此页面链接它。

引用本文的 Spaces0

没有链接到本文的 Space

在 Space README.md 中引用 arxiv.org/abs/2608.31113 以从此页面链接它。

包含本文的收藏集0

没有包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

MolmoMotion:语言引导的3D运动预测

Hugging Face Blog

MolmoMotion是一种新的语言引导的3D运动预测模型,它从视频帧和动作描述中预测未来的3D点轨迹,性能优于现有方法。同时,该模型还发布了一个大型数据集(MolmoMotion-1M)和一个基准(PointMotionBench)。