SoL-Refiner:光速一步精炼用于高分辨率视频
摘要
SoL-Refiner 是一个一步视频精炼器,通过单个去噪步骤将低分辨率视频输出转换为4K分辨率,实现了显著的速度提升并在质量指标上超越了现有的精炼器。
查看缓存全文
缓存时间: 2026/09/30 08:19
论文页面 - SoL-Refiner:面向高分辨率视频的极速单步精修方法
来源:https://huggingface.co/papers/2609.37969
发布于9月29日
·
提交者:https://huggingface.co/Owen777
Owen (https://huggingface.co/Owen777) 于9月30日
作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
高分辨率视频生成成本高昂,其开销会随着时空标记数量的增加而急剧上升。一种可行的替代方案是先生成低分辨率视频,再通过精修器进行提升,但传统的多步精修会引入二次采样瓶颈。我们提出了SoL-Refiner——一种单步视频精修器,能够通过单次去噪步骤将低分辨率模型输出转化为4K视频。我们的三阶段方案结合了高分辨率持续训练、强化学习后训练以及最终的单步蒸馏。我们推出了Refiner-Bench,一个基于不同视频生成器输出构建的视频精修基准测试平台,并采用共享输入协议在约2K输出分辨率下对比精修器性能。在2K分辨率下,单步SoL-Refiner在VBench和UniPercept平均指标上超越了所有外部精修器;在3840×2176分辨率下,其两项指标均优于三步LTX-2.3 Refiner。通过完整的加速技术栈,SoL-Refiner在我们设定的2K延迟场景中,将精修延迟相比基线实现了8.91倍加速。
查看arXiv页面 (https://arxiv.org/abs/2609.37969) 查看PDF (https://arxiv.org/pdf/2609.37969) 项目页面 (https://nvlabs.github.io/Sana/Sol-Refiner/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.37969)
在您的工具中获取此论文:
hf papers read 2609.37969
未安装最新版CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
无模型关联本文
在模型的README.md中引用 arxiv.org/abs/2609.37969 以从本页链接。
引用本文的数据集 0
无数据集关联本文
在数据集的README.md中引用 arxiv.org/abs/2609.37969 以从本页链接。
引用本文的Space 0
无Space关联本文
在Space的README.md中引用 arxiv.org/abs/2609.37969 以从本页链接。
包含本文的收藏 0
无收藏包含本文
将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
无数据流自蒸馏用于少步视频生成 —— 在 MiniMax-H3 上开源了经过验证的实现 [P]
HyperFlow 是一个开源的 8 步 LoRA,它使用无数据流自蒸馏在 MiniMax-H3 中将视频生成步数从 49 步减少到 8 步,在保持质量的同时实现了显著的加速。
LiteFrame 扩展视频大语言模型效率(6分钟阅读)
LiteFrame 为视频大语言模型引入了一种高效的视频编码器,采用压缩令牌蒸馏技术,在保持准确率的同时,能够处理多达8倍的帧数并降低35%的延迟,为长视频理解开创了新的帕累托前沿。
Refiner:前Hugging Face预训练团队推出的机器人库
Refiner是Macrodata Labs开发的开源引擎,用于将原始机器人和多模态数据转换为高质量训练数据集,支持本地和云端执行。
SolarFlowRefiner: 感知细化流匹配用于地表太阳辐射降尺度
论文介绍了SolarFlowRefiner,一个感知细化的流匹配框架,用于将粗糙的ERA5数据降尺度为高分辨率的SolarCube场,展示了相对于独立生成和事后细化方法的一致改进。
HL-OutPaint: 面向高分辨率长时视频的由粗到细视频外扩方法
HL-OutPaint 是一个面向高分辨率长时视频的由粗到细视频外扩框架,利用全局粗粒度引导实现大空间外推,同时保持时空一致性。