4DAnyone:从普通单目视频创建4D人物

Hugging Face Daily Papers 论文

摘要

4DAnyone通过生成多视角一致视频并将其提升到4D高斯溅射,从单目视频重建4D人物,并使用参考和目标上下文设计来解决扩展瓶颈。

我们提出4DAnyone,这是一个通过生成重建级多视角一致视频并将其提升到4D高斯溅射(4DGS)来从未校准的单目视频重建4D人物的框架。现有的相机控制视频扩散模型可以合成合理的视角新视频,但在扩展到4DGS重建所需的数十个目标视角时,无法保持一致性。我们将此失败识别为有界注意力上下文问题:当目标视角超过单个DiT前向传播的能力时,必须将其分组,暴露出两个耦合的瓶颈。在参考上下文方面,对所有先前生成视角的条件设置增长为O(N),削弱了跨视角外观指导。在目标上下文方面,不相交的组无法直接交换信息,导致全局结构漂移。4DAnyone通过两个互补设计解决这两个瓶颈:参考上下文打包(RCP)将不断增长的参考视角压缩到固定长度的混合分辨率上下文中,参考上下文复杂度为O(1);而目标上下文路由(TCR)在去噪过程中旋转目标视角分组,以在高噪声步骤中跨组共享上下文,并在低噪声步骤中稳定细节。我们进一步使用内部游戏引擎构建了MVGameHuman数据集,并将其与光场和野外视频数据集结合用于训练。在DNA-Rendering和DyMVHumans上的实验表明,4DAnyone在视角新视频质量和下游4DGS重建方面均优于现有方法,并具有强大的野外泛化能力。有关视频结果和源代码,请访问我们的项目页面:https://4danyone.github.io。
查看原文
查看缓存全文

缓存时间: 2026/08/21 04:08

论文页面 - 4DAnyone:从任意单目视频创建4D人物

来源:https://huggingface.co/papers/2608.20335

摘要

4DAnyone通过生成多视角一致性视频并将其提升至4D高斯泼溅重建单目视频中的人物,利用参考与目标上下文设计解决了扩展瓶颈。

我们提出4DAnyone,一种从未经校准的单目视频重建4D人物的框架。该方法通过生成重建级多视角一致性视频,并将其提升至4D高斯泼溅(4DGS)来实现目标。现有相机控制视频扩散模型能生成合理的新视角视频,但当扩展至4DGS重建所需的数十个目标视角时,无法保持一致性。我们发现这一失败源于“有界注意力上下文“问题:当目标视角数量超过单次DiT前向传播的容量时,必须分组处理,从而暴露出两个耦合瓶颈。在参考上下文方面,基于所有已生成视角的条件控制复杂度呈O(N)增长,削弱了跨视角外观引导能力;在目标上下文方面,不相交的分组无法直接交换信息,导致全局结构漂移。4DAnyone通过两个互补设计解决上述瓶颈:参考上下文打包将不断增长的参考视角压缩为固定长度的混合分辨率上下文,使参考上下文复杂度降为O(1);目标上下文路由在去噪过程中轮转目标视角分组,在高噪声步骤共享跨分组上下文,在低噪声步骤稳定细节。我们进一步使用自研游戏引擎构建MVGameHuman数据集,并结合光场和野外视频数据集进行训练。DNA-Rendering和DyMVHumans上的实验表明,4DAnyone在新视角视频质量和下游4DGS重建方面均优于现有方法,并具有强大的野外泛化能力。项目主页提供视频结果与源代码:https://4danyone.github.io。

查看arXiv页面 (https://arxiv.org/abs/2608.20335) | 查看PDF (https://arxiv.org/pdf/2608.20335) | 项目主页 (https://4danyone.github.io/) | GitHub20 (https://github.com/ant-research/4DAnyone) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.20335)

通过智能助手获取本文:
hf papers read 2608.20335

尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型1

AntResearch/4DAnyone 视频到视频 • 约1小时前更新 • 1 (https://huggingface.co/AntResearch/4DAnyone)

引用本文的数据集0

暂无关联数据集
在数据集的README.md中引用 arxiv.org/abs/2608.20335 即可从本页关联。

引用本文的Space0

暂无关联Space
在Space的README.md中引用 arxiv.org/abs/2608.20335 即可从本页关联。

包含本文的收藏0

暂无包含本文的收藏
将本文添加至收藏 (https://huggingface.co/new-collection) 即可从本页关联。

相似文章

Lift4D:协调单视角3D估计用于野外4D重建

Hacker News Top

Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。

从低重叠拍摄进行4D人体-场景重建

Hugging Face Daily Papers

提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。

超越像素:从视频先验到4D世界

Hugging Face Daily Papers

本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。

从实况画面重建不同视角

Reddit r/singularity

4D Gaussian Splatting 是一种将平面2D图像转换为三维空间数据的技术,能够从实况画面重建不同视角。