Stream4D:用于流式自回归扩散视频模型的4D一致性

Hugging Face Daily Papers 论文

摘要

Stream4D通过引入动态4D重建奖励和运动先验来增强流式自回归扩散视频模型,以保持连贯运动并减少几何漂移。

流式自回归扩散模型实现了实时、长期视频生成,但它们的训练目标优化的是局部帧预测,而非连贯世界的几何与动力学:长时间的生成会累积几何漂移,并退化为静态或不自然的运动。最近的双向方法利用基于3D Gaussian-Splatting重建的奖励信号来解决这个问题。然而,单一的刚性3D重建无法建模动态场景,因此这种批评器将真实的物体运动作为重建错误进行惩罚,并通过冻结视频来最大化奖励。这种捷径在AR(自回归)设置中尤其有害,因为每个片段都可能传播已经静态的配置。在这项工作中,我们提出了Stream4D,它用一个前馈4D重建奖励替代了静态批评器,该奖励显式建模场景动力学,允许连贯运动获得高一致性奖励。为了进一步指导运动幅度和质量,我们添加了一个运动先验,该先验奖励自然的场景流幅度,同时惩罚抖动和非刚性伪影。我们最终的方案将这两个项与一个轻量级感知锚点相结合。在各种自回归视频骨干和生成跨度上,Stream4D提高了4D重建质量,更有效地保留了运动,并实现了更高的人类对齐偏好。项目页面:https://banyuanhao.github.io/Stream4D/
查看原文
查看缓存全文

缓存时间: 2026/08/27 07:19

论文页面 - Stream4D:流式自回归扩散视频模型的4D一致性

来源:https://huggingface.co/papers/2608.19556

摘要

Stream4D 通过用动态4D重建奖励和运动先验替代静态3D评鉴器,改进了自回归视频生成,从而保持连贯运动并减少几何漂移。

流式自回归扩散模型 (https://huggingface.co/papers?q=autoregressive%20diffusion%20models) 能够实现实时、长时程的视频生成,但其训练目标优化的是局部帧预测,而非一个连贯世界的几何和动力学:长时间的生成会积累几何漂移,并退化为静态或不自然的运动。近期的双向方法使用基于3D高斯溅射 (https://huggingface.co/papers?q=3D%20Gaussian-Splatting) 重建的奖励信号来解决这个问题。然而,单一刚性的3D重建无法建模动态场景,因此该评鉴器会将真实的物体运动视为重建误差进行惩罚,并通过冻结视频来最大化奖励。这种捷径在自回归设置中尤其有害,因为每个片段都可能传播已经静态化的配置。在这项工作中,我们提出了 Stream4D,它用一个前馈的4D重建奖励 (https://huggingface.co/papers?q=feed-forward%204D%20reconstruction%20reward) 替代了静态评鉴器,该奖励显式建模场景动态,允许连贯运动获得高一致性奖励。为进一步指导运动幅度和质量,我们添加了一个运动先验 (https://huggingface.co/papers?q=motion%20prior),它奖励自然的场景流 (https://huggingface.co/papers?q=scene-flow) 幅度,同时惩罚抖动和非刚性伪影。我们最终的方案将这两个项与一个轻量级的感知锚点 (https://huggingface.co/papers?q=perceptual%20anchor) 相结合。在各种自回归视频骨干网络和不同的生成时程下,Stream4D 提升了4D重建 (https://huggingface.co/papers?q=4D%20reconstruction) 质量,更有效地保持了运动,并获得了更高的人类偏好度。项目主页:https://banyuanhao.github.io/Stream44D/

查看arXiv页面 (https://arxiv.org/abs/2608.19556)查看PDF (https://arxiv.org/pdf/2608.19556)项目主页 (https://banyuanhao.github.io/Stream4D/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.19556)

在您的智能助手中获取本文:

hf papers read 2608\.19556

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型链接此论文

在模型的README.md中引用arxiv.org/abs/2608.19556以将其链接到此页面。

引用本文的数据集0

没有数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2608.19556以将其链接到此页面。

引用本文的Space0

没有Space链接此论文

在Space的README.md中引用arxiv.org/abs/2608.19556以将其链接到此页面。

包含本文的收藏夹0

没有收藏夹包含此论文

将本文添加到收藏夹 (https://huggingface.co/new-collection)以将其链接到此页面。

相似文章

Flex-Forcing:迈向统一的自回归与双向视频扩散模型

Hugging Face Daily Papers

介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。

流式力控视频生成

Hugging Face Daily Papers

StreamForce 是一种因果统一视频生成模型,通过蒸馏流水线和自回归架构,为时变力提供实时、基于物理的响应,在力的遵循度和运动真实性方面达到了最先进的性能。