DEMON:音乐编排噪声扩散引擎

Hugging Face Daily Papers 论文

摘要

DEMON 提出了一种实时扩散引擎,通过控制去噪过程实现现场音乐演奏,在单块 RTX 5090 上每秒可完成多达 12.3 次解码器推理。它引入了异构调度、共享可变状态、逐帧混合和窗口化 VAE 解码,以实现响应式控制。

我们提出 DEMON,一个实时扩散引擎,将去噪过程变为可演奏的现场乐器:控制界面既宽广(每帧对输出塑造多个参数)又响应迅速(每个控制以其在去噪循环中的位置允许的最快速度生效)。它基于 ACE-Step 1.5 和 StreamDiffusion 的环形缓冲区架构,并采用 TensorRT 加速,在单块消费级 GPU(RTX 5090)上,对于 60 秒音乐可维持每秒最多 12.3 次解码器完成次数,或在我们生产环境环深度为 4 时达到每秒 11.3 次生成。在此速率下,去噪参数可作为现场演奏控制,但环形缓冲区仅以其排空速率(即 S 个去噪步的下限)传播每次请求的变化。我们贡献了四种机制。(1)每槽异构去噪调度:每个环形缓冲区槽拥有自己的时间步调度,因此移动去噪滑块无需清空飞行队列——上游全局调度设计必须重建并丢弃该队列。(2)共享可变每步状态:在每个求解器步骤中查询的任何参数都立即生效,绕过环形缓冲区排空。(3)逐帧源混合:对标准 SDE 重噪步骤的采样时间控制,提供逐帧变换强度轴,作为标量去噪调度的补充。(4)窗口化 VAE 解码:利用感受野分析实现 8.0 倍解码加速。这些机制共同将流式扩散参数分为四类传播方式,按起效时间和收敛延迟划分。
查看原文
查看缓存全文

缓存时间: 2026/06/01 19:21

Paper page - DEMON: 扩散引擎实现音乐化编排噪声

来源:https://huggingface.co/papers/2605.28657

摘要

DEMON 通过专门的调度、共享状态管理和优化的解码技术,实现了作为乐器使用的实时扩散模型控制。

我们提出 DEMON,一个实时扩散引擎(https://huggingface.co/papers?q=diffusion%20engine),它使去噪过程(https://huggingface.co/papers?q=denoising%20process)能够像现场乐器一样可演奏:既宽阔(每帧输出中可调节众多参数)又响应迅速(每个控制项按其去噪循环(https://huggingface.co/papers?q=denoising%20loop)中的位置尽快生效)。它基于 ACE-Step 1.5(https://huggingface.co/papers?q=ACE-Step%201.5)和 StreamDiffusion(https://huggingface.co/papers?q=StreamDiffusion)的环形缓冲架构(https://huggingface.co/papers?q=ring-buffer%20architecture),并借助 TensorRT 加速(https://huggingface.co/papers?q=TensorRT%20acceleration),在单块消费级 GPU(RTX 5090)上可实现每秒最多 12.3 个解码器完成,用于 60 秒音乐;生产环形深度为 4 时,每秒生成 11.3 个。在此速率下,去噪参数(https://huggingface.co/papers?q=denoising%20parameters)可作为实况演奏控制项使用,但环形缓冲仅在泄放速率(即 S 个去噪步骤的下限)下传播每次请求的变化。我们贡献了四种机制。(1)每槽异构去噪调度(https://huggingface.co/papers?q=heterogeneous%20denoise%20scheduling):每个环形缓冲槽拥有自己的时间步调度,因此移动的去噪滑块得以跟踪,而无需清除飞行队列——传统全局调度设计则必须重建并丢弃该队列。(2)共享可变每步状态(https://huggingface.co/papers?q=Shared%20mutable%20per-step%20state):使每个求解步骤中咨询的任何参数在下一时刻生效,绕过环形缓冲泄放。(3)每帧源混合(https://huggingface.co/papers?q=Per-frame%20source%20blending):对标准 SDE 重噪步骤进行采样时间控制,提供帧级变换强度轴,补充标量去噪调度。(4)窗口化 VAE 解码(https://huggingface.co/papers?q=VAE%20decode):利用感受野分析(https://huggingface.co/papers?q=receptive-field%20analysis)实现 8.0 倍解码加速。这些机制共同将流式扩散参数按起效和收敛延迟分为四个传播类别。

查看 arXiv 页面(https://arxiv.org/abs/2605.28657)查看 PDF(https://arxiv.org/pdf/2605.28657)项目页面(https://daydreamlive.github.io/DEMON/)GitHub(https://github.com/daydreamlive/DEMON)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.28657)

在你的代理中获取此论文:

hf papers read 2605.28657

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 1

daydreamlive/DEMON 音频到音频 • 更新于约 4 小时前(https://huggingface.co/daydreamlive/DEMON)

引用本论文的数据集 0

无数据集链接本论文

请在数据集的 README.md 中引用 arxiv.org/abs/2605.28657,以便在此页面上建立链接。

引用本论文的 Space 0

无 Space 链接本论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2605.28657,以便在此页面上建立链接。

包含本论文的收藏 1

相似文章

来自NVIDIA的Nemotron-Labs-Diffusion

Reddit r/LocalLLaMA

NVIDIA发布了Nemotron-Labs-Diffusion模型系列(3B至14B),该系列同时支持AR解码和扩散解码,并采用新颖的自推测机制,在多种硬件平台上相比标准AR和Eagle3方法实现了显著加速(最高达4倍)。