BLARM:基于潜在刚性运动基元混合的视频驱动3D对象动画化
摘要
BLARM是一种前馈方法,通过混合潜在刚性运动基元从单目视频动画化3D网格,实现无需显式骨架的时序连贯动画。
查看缓存全文
缓存时间: 2026/09/01 11:54
论文页面 - BLARM:通过混合潜在刚性运动基元从视频动画化3D物体
来源:https://huggingface.co/papers/2608.31113
摘要
BLARM利用学习到的刚性运动分量和蒙皮权重,从单目视频预测时间上连贯的3D网格动画,无需显式骨骼绑定。
我们介绍了BLARM,一种用于视频驱动3D网格动画的前馈方法。给定单目视频和静态物体网格,BLARM预测一个时间上连贯的动画网格,其运动遵循视频。我们并非依赖显式骨骼绑定或直接回归高维顶点运动,而是使用一个紧凑的、学习到的时间变化刚性运动分量和时间不变的顶点到分量蒙皮权重集合来表示动画。这产生了一个低维的变形空间,无需骨架、笼子、蒙皮权重或骨骼绑定标注。我们的架构通过分解式时空注意力,将几何导出的变形潜变量条件化于视频特征,然后解码由预测蒙皮权重混合的刚性变换。通过轨迹重建、熵正则化和运动感知对比学习进行训练,BLARM在从单目视频恢复紧凑、可解释的运动结构的同时,生成准确且时间稳定的动画。
查看 arXiv 页面 (https://arxiv.org/abs/2608.31113) 查看 PDF (https://arxiv.org/pdf/2608.31113) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.31113)
引用本文的模型0
没有链接到本文的模型
在模型 README.md 中引用 arxiv.org/abs/2608.31113 以从此页面链接它。
引用本文的数据集0
没有链接到本文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2608.31113 以从此页面链接它。
引用本文的 Spaces0
没有链接到本文的 Space
在 Space README.md 中引用 arxiv.org/abs/2608.31113 以从此页面链接它。
包含本文的收藏集0
没有包含本文的收藏集
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
@yoheinakajima:一个人的模糊是另一个人的运动数据,用以解码
介绍了Blur2Vid,一种从运动模糊图像生成视频的方法,发表于SIGGRAPH Asia 2025。
GRAIL: 基于3D资产和视频先验的人形机器人运动操控生成
GRAIL利用3D资产和视频基础模型生成多样的人形机器人操作与移动数据,实现了有效的仿真到现实迁移,在真实世界中取得了高成功率。
ARDY: 混合表示的自回归扩散用于交互式人体运动生成
ARDY 引入了一个流式生成框架,用于实时、高保真度的 3D 人体运动生成,通过文本和运动学约束进行控制,采用混合表示和两阶段自回归 Transformer 去噪器。
BridgeVLA++:面向三维操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
MolmoMotion:语言引导的3D运动预测
MolmoMotion是一种新的语言引导的3D运动预测模型,它从视频帧和动作描述中预测未来的3D点轨迹,性能优于现有方法。同时,该模型还发布了一个大型数据集(MolmoMotion-1M)和一个基准(PointMotionBench)。