FlashRender:通过相机控制的视频均值流实现几步生成式渲染
摘要
FlashRender是一个几步生成式渲染框架,通过对齐表示和使用均值流目标来加速视频合成,在显著降低采样成本的同时,达到与多步方法相当的质量。
查看缓存全文
缓存时间: 2026/09/04 03:55
论文页面 - FlashRender:通过相机控制视频均值流实现少步生成式渲染
来源:https://huggingface.co/papers/2609.03563
摘要
FlashRender通过表示对齐、均值流目标以及在策略蒸馏来加速生成式视频渲染,从而实现高质量的少步相机控制合成。
我们提出FlashRender(https://huggingface.co/papers?q=FlashRender),这是一个少步生成式渲染(https://huggingface.co/papers?q=generative%20rendering)框架,能够在数秒内沿目标相机轨迹重新拍摄源视频。我们识别出采样步长依赖的相机控制(https://huggingface.co/papers?q=sampling-step-dependent%20camera%20control)是现有少步生成式渲染(https://huggingface.co/papers?q=generative%20rendering)模型中离散化误差(https://huggingface.co/papers?q=discretization%20error)的一个显著表现,并证明解决此不一致性可显著降低去噪轨迹曲率,便于后续的步蒸馏。为此,我们引入表示变换与对齐(Representation Transformation and Alignment, RETA)(https://huggingface.co/papers?q=Representation%20Transformation%20and%20Alignment%20(RETA)),该方法将隐藏的源视频表示与来自冻结视觉几何模型(https://huggingface.co/papers?q=visual%20geometry%20model)的目标视频特征进行对齐。这直接在源视频流中编码了几何变换,实现了采样步长一致的相机控制。随后,我们在由RETA诱导的较低曲率去噪轨迹上,使用均值流目标(MeanFlow objective)(https://huggingface.co/papers?q=MeanFlow%20objective)对模型进行微调,使模型能更有效地解决离散化误差(https://huggingface.co/papers?q=discretization%20error)。最后,我们应用在策略流图蒸馏(on-policy flow map distillation)(https://huggingface.co/papers?q=on-policy%20flow%20map%20distillation)以在固定少步采样(few-step sampling)(https://huggingface.co/papers?q=few-step%20sampling)下纠正自展开误差。大量实验表明,RETA、MeanFlow和在策略流图蒸馏(on-policy flow map distillation)(https://huggingface.co/papers?q=on-policy%20flow%20map%20distillation)在少步生成式渲染(generative rendering)(https://huggingface.co/papers?q=generative%20rendering)中扮演互补角色。它们共同使我们的方法在视频质量和几何一致性上匹配多步基线,同时采样成本降低25倍,并实现了优越的相机可控性,即使在超出分布范围的目标相机轨迹下也是如此。
查看arXiv页面(https://arxiv.org/abs/2609.03563)查看PDF(https://arxiv.org/pdf/2609.03563)项目页面(https://byeongjun-park.github.io/FlashRender/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.03563)
在您的代理中获取此论文:
hf papers read 2609\.03563
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.03563以从本页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.03563以从本页面链接。
引用此论文的空间0
无空间链接此论文
在空间README.md中引用arxiv.org/abs/2609.03563以从本页面链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。
相似文章
以游戏速度运行的生成式世界渲染器
本文介绍了 AlayaRenderer-Flash,这是一种实时生成式世界渲染器,通过使用少步自回归流式模型和轻量级蒸馏编解码器,将渲染速度从 0.56 FPS 提升到 31.54 FPS,实现了与物理引擎的交互式游玩。
Dynamic-in-Few-Step: 统一动态计算与少步蒸馏的高效视频生成
本文提出了一种针对视频扩散模型的后训练加速框架,将动态结构稀疏化与少步蒸馏相结合,在保持生成质量的同时实现了显著加速。
灵活视频扩散(3分钟阅读)
Flex-Forcing提出了一个统一的视频扩散框架,支持自回归和双向生成模式,为视频生成任务提供灵活的控制。
流式力控视频生成
StreamForce 是一种因果统一视频生成模型,通过蒸馏流水线和自回归架构,为时变力提供实时、基于物理的响应,在力的遵循度和运动真实性方面达到了最先进的性能。
RhymeFlow: 基于异步去噪流调度的视频生成无训练加速方法
RhymeFlow通过跨帧解耦去噪轨迹来加速视频生成的扩散变换器,利用关键帧锚定和潜在轨迹投影减少计算开销,同时保持视觉质量。