SoL-Refiner:光速一步精炼用于高分辨率视频

Hugging Face Daily Papers 论文

摘要

SoL-Refiner 是一个一步视频精炼器,通过单个去噪步骤将低分辨率视频输出转换为4K分辨率,实现了显著的速度提升并在质量指标上超越了现有的精炼器。

高分辨率视频生成成本高昂,因为其成本随着时空标记数量的增加而迅速增长。一个实用的替代方案是先生成较低分辨率的视频,然后应用精炼器,但传统的多步精炼引入了第二个采样瓶颈。我们推出了 SoL-Refiner,这是一个一步视频精炼器,通过单个去噪步骤将低分辨率模型输出转换为4K视频。我们的三阶段方法结合了高分辨率持续训练、强化学习(RL)后训练和最终的单步蒸馏。我们引入了 Refiner-Bench,这是一个从不同视频生成器的输出构建的视频精炼基准,并使用共享输入协议在大约2K输出分辨率下比较精炼器。在2K分辨率下,单步 SoL-Refiner 在 VBench 和 UniPercept 平均分上超越了所有外部精炼器,而在3840 × 2176分辨率下,它在两项指标上均优于三步 LTX-2.3 Refiner。通过完整的加速栈,SoL-Refiner 在我们的2K延迟设置中实现了相对于同一基线8.91倍的精炼延迟加速。
查看原文
查看缓存全文

缓存时间: 2026/09/30 08:19

论文页面 - SoL-Refiner:面向高分辨率视频的极速单步精修方法

来源:https://huggingface.co/papers/2609.37969
发布于9月29日

·

提交者:https://huggingface.co/Owen777

Owen (https://huggingface.co/Owen777) 于9月30日

作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

高分辨率视频生成成本高昂,其开销会随着时空标记数量的增加而急剧上升。一种可行的替代方案是先生成低分辨率视频,再通过精修器进行提升,但传统的多步精修会引入二次采样瓶颈。我们提出了SoL-Refiner——一种单步视频精修器,能够通过单次去噪步骤将低分辨率模型输出转化为4K视频。我们的三阶段方案结合了高分辨率持续训练、强化学习后训练以及最终的单步蒸馏。我们推出了Refiner-Bench,一个基于不同视频生成器输出构建的视频精修基准测试平台,并采用共享输入协议在约2K输出分辨率下对比精修器性能。在2K分辨率下,单步SoL-Refiner在VBench和UniPercept平均指标上超越了所有外部精修器;在3840×2176分辨率下,其两项指标均优于三步LTX-2.3 Refiner。通过完整的加速技术栈,SoL-Refiner在我们设定的2K延迟场景中,将精修延迟相比基线实现了8.91倍加速。

查看arXiv页面 (https://arxiv.org/abs/2609.37969) 查看PDF (https://arxiv.org/pdf/2609.37969) 项目页面 (https://nvlabs.github.io/Sana/Sol-Refiner/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.37969)

在您的工具中获取此论文:

hf papers read 2609.37969

未安装最新版CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

无模型关联本文

在模型的README.md中引用 arxiv.org/abs/2609.37969 以从本页链接。

引用本文的数据集 0

无数据集关联本文

在数据集的README.md中引用 arxiv.org/abs/2609.37969 以从本页链接。

引用本文的Space 0

无Space关联本文

在Space的README.md中引用 arxiv.org/abs/2609.37969 以从本页链接。

包含本文的收藏 0

无收藏包含本文

将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

LiteFrame 扩展视频大语言模型效率(6分钟阅读)

TLDR AI

LiteFrame 为视频大语言模型引入了一种高效的视频编码器,采用压缩令牌蒸馏技术,在保持准确率的同时,能够处理多达8倍的帧数并降低35%的延迟,为长视频理解开创了新的帕累托前沿。