SANA-Streaming:基于混合扩散Transformer的实时流式视频编辑
摘要
SANA-Streaming 利用混合扩散Transformer架构、循环反向正则化以及高效的系统协同设计,在消费级GPU上实现实时高分辨率视频到视频编辑,在单张RTX 5090上达到1280×704分辨率下24 FPS。
查看缓存全文
缓存时间: 2026/06/01 03:17
论文页面 - SANA-Streaming: 基于混合扩散Transformer的实时流式视频编辑
来源:https://huggingface.co/papers/2605.30409
发布于 5月28日
·
由 https://huggingface.co/Yuyang-z 提交
Yuyang (https://huggingface.co/Yuyang-z) 于 6月1日
摘要
SANA-Streaming 通过混合扩散 Transformer 架构、循环反向正则化以及针对消费级 GPU 优化的高效系统协同设计,实现了实时高清视频到视频的编辑。
实时流式视频到视频编辑(V2V)对于直播、游戏等交互式应用至关重要,但由于其对时间一致性和推理吞吐量的严苛要求,仍是一项艰巨挑战。本文提出 SANA-Streaming,一个面向消费级 GPU 的高分辨率、实时流式视频编辑的系统-算法协同设计框架,其核心设计包括以下三点:(1)混合扩散 Transformer 架构:在部分块中引入 softmax 注意力,以提升局部建模能力,同时保持线性层的效率。(2)循环反向正则化:一种新颖的训练策略,通过流匹配从生成内容预测源帧,强制执行语义一致性,无需成对的长编辑视频即可提升时间一致性。(3)高效系统协同设计:结合融合后的 GDN 核与针对 NVIDIA Blackwell(RTX 5090)架构优化的混合精度量化(MPQ)。通过分析实际吞吐量,我们的 MPQ 在保持生成质量的同时最大化 Tensor Core 利用率。最终系统在单块 RTX 5090 GPU 上实现了 1280 x 704 分辨率的实时编辑,端到端帧率达 24 FPS,其中 DiT 核心运行速度为 58 FPS。实验结果表明,我们的协同设计方法在时间连贯性和系统吞吐量方面均显著优于现有最先进方法。
查看 arXiv 页面 (https://arxiv.org/abs/2605.30409) 查看 PDF (https://arxiv.org/pdf/2605.30409) 项目页面 (https://nvlabs.github.io/Sana/Streaming/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30409)
在您的 Agent 中获取本文:
hf papers read 2605.30409
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 0
暂无模型链接本论文
请在模型 README.md 中引用 arxiv.org/abs/2605.30409 以在本页链接。
引用本论文的数据集 0
暂无数据集链接本论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.30409 以在本页链接。
引用本论文的 Spaces 0
暂无 Space 链接本论文
请在 Space README.md 中引用 arxiv.org/abs/2605.30409 以在本页链接。
包含本论文的收藏 0
暂无收藏包含本论文
请将本论文添加到一个收藏 (https://huggingface.co/new-collection) 中以在本页链接。
相似文章
YouTube 正在让在 YouTube 上赚钱变得更难
YouTube 正在提高创作者通过其合作伙伴计划赚钱的要求,自 2027 年 2 月 1 日起提高观看时长和 Shorts 观看次数的门槛。现有创作者必须在 2027 年 1 月 31 日前接受新条款,因为 YouTube 正朝着高级电视式服务迈进。
@addyosmani:你知道刷新页面会让 AI 聊天在响应中途中断吗?@triggerdotdev 的新聊天代理解决了这个问题,使其能存活…
Trigger.dev 的新聊天代理让开发者能够构建持久、有状态的 AI 聊天体验,这些体验在刷新和崩溃后依然存活,没有超时限制,并且可以在危险工具调用前暂停以请求许可。
@NASA:我们正在让太空离家园更近!我们的节目连续流媒体现已在@discoveryplus直播频道上线…
NASA宣布,NASA+节目现已在discovery+直播频道上线,同时包括Artemis III任务在内的特别活动将于2027年登陆HBO Max。
我已将 Maple-Preview 添加到 Mference,在 Air M4 上仅用 500MB 内存实现了 40 tps 的生成速度
作者为 Mference 添加了 Maple-Preview 支持。Mference 是一款通过从磁盘流式加载 MoE 专家来在低内存设备上运行大型模型的工具,作者在 Air M4 上实现了仅用 500MB 内存达到 40 tps 的速度。
@bkdgiffug: 短视频创作最怕什么?原创枯竭,搬运限流,两头堵死。这个开源工具能帮你用AI批量混剪破局。 Short-Video-Factory简化到三步: 写提示词 丢分镜素材 等成品输出 文案、配音、剪辑、字幕一条龙自动完成,本地处理确保数据安全,W…
短视频工厂是一个开源的跨平台桌面工具,通过AI技术实现自动化的短视频混剪,支持文案生成、语音合成、剪辑和字幕,批量处理提升创作效率。