4DAnyone:从普通单目视频创建4D人物
摘要
4DAnyone通过生成多视角一致视频并将其提升到4D高斯溅射,从单目视频重建4D人物,并使用参考和目标上下文设计来解决扩展瓶颈。
查看缓存全文
缓存时间: 2026/08/21 04:08
论文页面 - 4DAnyone:从任意单目视频创建4D人物
来源:https://huggingface.co/papers/2608.20335
摘要
4DAnyone通过生成多视角一致性视频并将其提升至4D高斯泼溅重建单目视频中的人物,利用参考与目标上下文设计解决了扩展瓶颈。
我们提出4DAnyone,一种从未经校准的单目视频重建4D人物的框架。该方法通过生成重建级多视角一致性视频,并将其提升至4D高斯泼溅(4DGS)来实现目标。现有相机控制视频扩散模型能生成合理的新视角视频,但当扩展至4DGS重建所需的数十个目标视角时,无法保持一致性。我们发现这一失败源于“有界注意力上下文“问题:当目标视角数量超过单次DiT前向传播的容量时,必须分组处理,从而暴露出两个耦合瓶颈。在参考上下文方面,基于所有已生成视角的条件控制复杂度呈O(N)增长,削弱了跨视角外观引导能力;在目标上下文方面,不相交的分组无法直接交换信息,导致全局结构漂移。4DAnyone通过两个互补设计解决上述瓶颈:参考上下文打包将不断增长的参考视角压缩为固定长度的混合分辨率上下文,使参考上下文复杂度降为O(1);目标上下文路由在去噪过程中轮转目标视角分组,在高噪声步骤共享跨分组上下文,在低噪声步骤稳定细节。我们进一步使用自研游戏引擎构建MVGameHuman数据集,并结合光场和野外视频数据集进行训练。DNA-Rendering和DyMVHumans上的实验表明,4DAnyone在新视角视频质量和下游4DGS重建方面均优于现有方法,并具有强大的野外泛化能力。项目主页提供视频结果与源代码:https://4danyone.github.io。
查看arXiv页面 (https://arxiv.org/abs/2608.20335) | 查看PDF (https://arxiv.org/pdf/2608.20335) | 项目主页 (https://4danyone.github.io/) | GitHub20 (https://github.com/ant-research/4DAnyone) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.20335)
通过智能助手获取本文:
hf papers read 2608.20335
尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型1
AntResearch/4DAnyone 视频到视频 • 约1小时前更新 • 1 (https://huggingface.co/AntResearch/4DAnyone)
引用本文的数据集0
暂无关联数据集
在数据集的README.md中引用 arxiv.org/abs/2608.20335 即可从本页关联。
引用本文的Space0
暂无关联Space
在Space的README.md中引用 arxiv.org/abs/2608.20335 即可从本页关联。
包含本文的收藏0
暂无包含本文的收藏
将本文添加至收藏 (https://huggingface.co/new-collection) 即可从本页关联。
相似文章
Lift4D:协调单视角3D估计用于野外4D重建
Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。
从低重叠拍摄进行4D人体-场景重建
提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。
ReViV:从单目第一人称视频中重建观看者与场景的四维动态
ReViV是一个统一的整体性第一人称4D重建框架,它通过掩码生成式第一人称Transformer,从单目RGB视频中同时重建观看者(身体、手、视线)和场景(深度、相机轨迹)的动态,实现了最先进的准确性和效率。
超越像素:从视频先验到4D世界
本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。
从实况画面重建不同视角
4D Gaussian Splatting 是一种将平面2D图像转换为三维空间数据的技术,能够从实况画面重建不同视角。