FlashRender:通过相机控制的视频均值流实现几步生成式渲染

Hugging Face Daily Papers 论文

摘要

FlashRender是一个几步生成式渲染框架,通过对齐表示和使用均值流目标来加速视频合成,在显著降低采样成本的同时,达到与多步方法相当的质量。

我们提出FlashRender,这是一个几步生成式渲染框架,能在几秒钟内沿着目标相机轨迹重新渲染源视频。我们将采样步骤相关的相机控制识别为现有多种步生成式渲染模型中离散化误差的一个显著表现,并表明解决这种不一致性可以显著降低去噪轨迹曲率,从而促进后续步骤蒸馏。为此,我们引入了表示转换与对齐(RETA),它通过冻结的视觉几何模型将隐藏的源视频表示与目标视频特征对齐。这直接编码了源视频流中的几何变换,实现了采样步骤一致的相机控制。然后,我们在由RETA诱导的较低曲率的去噪轨迹上,使用MeanFlow目标微调模型,使模型能更有效地处理离散化误差。最后,我们应用on-policy流图蒸馏来校正固定几步采样下的自回滚误差。大量实验表明,RETA、MeanFlow和on-policy流图蒸馏在几步生成式渲染中扮演互补角色。它们共同使我们的方法在视频质量和几何一致性方面与多步基线相匹配,同时采样成本降低25倍,并在目标相机轨迹超出分布时实现更优的相机可控性。
查看原文
查看缓存全文

缓存时间: 2026/09/04 03:55

论文页面 - FlashRender:通过相机控制视频均值流实现少步生成式渲染

来源:https://huggingface.co/papers/2609.03563

摘要

FlashRender通过表示对齐、均值流目标以及在策略蒸馏来加速生成式视频渲染,从而实现高质量的少步相机控制合成。

我们提出FlashRender(https://huggingface.co/papers?q=FlashRender),这是一个少步生成式渲染(https://huggingface.co/papers?q=generative%20rendering)框架,能够在数秒内沿目标相机轨迹重新拍摄源视频。我们识别出采样步长依赖的相机控制(https://huggingface.co/papers?q=sampling-step-dependent%20camera%20control)是现有少步生成式渲染(https://huggingface.co/papers?q=generative%20rendering)模型中离散化误差(https://huggingface.co/papers?q=discretization%20error)的一个显著表现,并证明解决此不一致性可显著降低去噪轨迹曲率,便于后续的步蒸馏。为此,我们引入表示变换与对齐(Representation Transformation and Alignment, RETA)(https://huggingface.co/papers?q=Representation%20Transformation%20and%20Alignment%20(RETA)),该方法将隐藏的源视频表示与来自冻结视觉几何模型(https://huggingface.co/papers?q=visual%20geometry%20model)的目标视频特征进行对齐。这直接在源视频流中编码了几何变换,实现了采样步长一致的相机控制。随后,我们在由RETA诱导的较低曲率去噪轨迹上,使用均值流目标(MeanFlow objective)(https://huggingface.co/papers?q=MeanFlow%20objective)对模型进行微调,使模型能更有效地解决离散化误差(https://huggingface.co/papers?q=discretization%20error)。最后,我们应用在策略流图蒸馏(on-policy flow map distillation)(https://huggingface.co/papers?q=on-policy%20flow%20map%20distillation)以在固定少步采样(few-step sampling)(https://huggingface.co/papers?q=few-step%20sampling)下纠正自展开误差。大量实验表明,RETA、MeanFlow和在策略流图蒸馏(on-policy flow map distillation)(https://huggingface.co/papers?q=on-policy%20flow%20map%20distillation)在少步生成式渲染(generative rendering)(https://huggingface.co/papers?q=generative%20rendering)中扮演互补角色。它们共同使我们的方法在视频质量和几何一致性上匹配多步基线,同时采样成本降低25倍,并实现了优越的相机可控性,即使在超出分布范围的目标相机轨迹下也是如此。

查看arXiv页面(https://arxiv.org/abs/2609.03563)查看PDF(https://arxiv.org/pdf/2609.03563)项目页面(https://byeongjun-park.github.io/FlashRender/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.03563)

在您的代理中获取此论文:

hf papers read 2609\.03563

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.03563以从本页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.03563以从本页面链接。

引用此论文的空间0

无空间链接此论文

在空间README.md中引用arxiv.org/abs/2609.03563以从本页面链接。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。

相似文章

以游戏速度运行的生成式世界渲染器

Hugging Face Daily Papers

本文介绍了 AlayaRenderer-Flash,这是一种实时生成式世界渲染器,通过使用少步自回归流式模型和轻量级蒸馏编解码器,将渲染速度从 0.56 FPS 提升到 31.54 FPS,实现了与物理引擎的交互式游玩。

灵活视频扩散(3分钟阅读)

TLDR AI

Flex-Forcing提出了一个统一的视频扩散框架,支持自回归和双向生成模式,为视频生成任务提供灵活的控制。

流式力控视频生成

Hugging Face Daily Papers

StreamForce 是一种因果统一视频生成模型,通过蒸馏流水线和自回归架构,为时变力提供实时、基于物理的响应,在力的遵循度和运动真实性方面达到了最先进的性能。