Stream4D:用于流式自回归扩散视频模型的4D一致性
摘要
Stream4D通过引入动态4D重建奖励和运动先验来增强流式自回归扩散视频模型,以保持连贯运动并减少几何漂移。
查看缓存全文
缓存时间: 2026/08/27 07:19
论文页面 - Stream4D:流式自回归扩散视频模型的4D一致性
来源:https://huggingface.co/papers/2608.19556
摘要
Stream4D 通过用动态4D重建奖励和运动先验替代静态3D评鉴器,改进了自回归视频生成,从而保持连贯运动并减少几何漂移。
流式自回归扩散模型 (https://huggingface.co/papers?q=autoregressive%20diffusion%20models) 能够实现实时、长时程的视频生成,但其训练目标优化的是局部帧预测,而非一个连贯世界的几何和动力学:长时间的生成会积累几何漂移,并退化为静态或不自然的运动。近期的双向方法使用基于3D高斯溅射 (https://huggingface.co/papers?q=3D%20Gaussian-Splatting) 重建的奖励信号来解决这个问题。然而,单一刚性的3D重建无法建模动态场景,因此该评鉴器会将真实的物体运动视为重建误差进行惩罚,并通过冻结视频来最大化奖励。这种捷径在自回归设置中尤其有害,因为每个片段都可能传播已经静态化的配置。在这项工作中,我们提出了 Stream4D,它用一个前馈的4D重建奖励 (https://huggingface.co/papers?q=feed-forward%204D%20reconstruction%20reward) 替代了静态评鉴器,该奖励显式建模场景动态,允许连贯运动获得高一致性奖励。为进一步指导运动幅度和质量,我们添加了一个运动先验 (https://huggingface.co/papers?q=motion%20prior),它奖励自然的场景流 (https://huggingface.co/papers?q=scene-flow) 幅度,同时惩罚抖动和非刚性伪影。我们最终的方案将这两个项与一个轻量级的感知锚点 (https://huggingface.co/papers?q=perceptual%20anchor) 相结合。在各种自回归视频骨干网络和不同的生成时程下,Stream4D 提升了4D重建 (https://huggingface.co/papers?q=4D%20reconstruction) 质量,更有效地保持了运动,并获得了更高的人类偏好度。项目主页:https://banyuanhao.github.io/Stream44D/
查看arXiv页面 (https://arxiv.org/abs/2608.19556)查看PDF (https://arxiv.org/pdf/2608.19556)项目主页 (https://banyuanhao.github.io/Stream4D/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.19556)
在您的智能助手中获取本文:
hf papers read 2608\.19556
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接此论文
在模型的README.md中引用arxiv.org/abs/2608.19556以将其链接到此页面。
引用本文的数据集0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2608.19556以将其链接到此页面。
引用本文的Space0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2608.19556以将其链接到此页面。
包含本文的收藏夹0
没有收藏夹包含此论文
将本文添加到收藏夹 (https://huggingface.co/new-collection)以将其链接到此页面。
相似文章
MV-Forcing:通过4D基底的时空自强迫实现长时间多视角视频生成
MV-Forcing 提出了一种扩散框架,结合时间自回归和视角自回归,生成动态场景的长时间多视角一致视频。通过使用4D几何桥梁和时空蒸馏,实现基于少步学生模型的任意长度视频生成。
Flex-Forcing:迈向统一的自回归与双向视频扩散模型
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AnyRecon 提出了一种可扩展框架,利用具备持久场景记忆与几何感知条件的视频扩散模型,从任意稀疏输入进行 3D 重建。
Stream-R1:流式视频生成的可靠性-困惑度感知奖励蒸馏
Stream-R1 提出了一种针对流式视频生成的可靠性-困惑度感知奖励蒸馏框架,通过自适应加权监督信号来提升视觉和动态质量,且不增加额外的计算开销。
流式力控视频生成
StreamForce 是一种因果统一视频生成模型,通过蒸馏流水线和自回归架构,为时变力提供实时、基于物理的响应,在力的遵循度和运动真实性方面达到了最先进的性能。