DEMON:音乐编排噪声扩散引擎
摘要
DEMON 提出了一种实时扩散引擎,通过控制去噪过程实现现场音乐演奏,在单块 RTX 5090 上每秒可完成多达 12.3 次解码器推理。它引入了异构调度、共享可变状态、逐帧混合和窗口化 VAE 解码,以实现响应式控制。
查看缓存全文
缓存时间: 2026/06/01 19:21
Paper page - DEMON: 扩散引擎实现音乐化编排噪声
来源:https://huggingface.co/papers/2605.28657
摘要
DEMON 通过专门的调度、共享状态管理和优化的解码技术,实现了作为乐器使用的实时扩散模型控制。
我们提出 DEMON,一个实时扩散引擎(https://huggingface.co/papers?q=diffusion%20engine),它使去噪过程(https://huggingface.co/papers?q=denoising%20process)能够像现场乐器一样可演奏:既宽阔(每帧输出中可调节众多参数)又响应迅速(每个控制项按其去噪循环(https://huggingface.co/papers?q=denoising%20loop)中的位置尽快生效)。它基于 ACE-Step 1.5(https://huggingface.co/papers?q=ACE-Step%201.5)和 StreamDiffusion(https://huggingface.co/papers?q=StreamDiffusion)的环形缓冲架构(https://huggingface.co/papers?q=ring-buffer%20architecture),并借助 TensorRT 加速(https://huggingface.co/papers?q=TensorRT%20acceleration),在单块消费级 GPU(RTX 5090)上可实现每秒最多 12.3 个解码器完成,用于 60 秒音乐;生产环形深度为 4 时,每秒生成 11.3 个。在此速率下,去噪参数(https://huggingface.co/papers?q=denoising%20parameters)可作为实况演奏控制项使用,但环形缓冲仅在泄放速率(即 S 个去噪步骤的下限)下传播每次请求的变化。我们贡献了四种机制。(1)每槽异构去噪调度(https://huggingface.co/papers?q=heterogeneous%20denoise%20scheduling):每个环形缓冲槽拥有自己的时间步调度,因此移动的去噪滑块得以跟踪,而无需清除飞行队列——传统全局调度设计则必须重建并丢弃该队列。(2)共享可变每步状态(https://huggingface.co/papers?q=Shared%20mutable%20per-step%20state):使每个求解步骤中咨询的任何参数在下一时刻生效,绕过环形缓冲泄放。(3)每帧源混合(https://huggingface.co/papers?q=Per-frame%20source%20blending):对标准 SDE 重噪步骤进行采样时间控制,提供帧级变换强度轴,补充标量去噪调度。(4)窗口化 VAE 解码(https://huggingface.co/papers?q=VAE%20decode):利用感受野分析(https://huggingface.co/papers?q=receptive-field%20analysis)实现 8.0 倍解码加速。这些机制共同将流式扩散参数按起效和收敛延迟分为四个传播类别。
查看 arXiv 页面(https://arxiv.org/abs/2605.28657)查看 PDF(https://arxiv.org/pdf/2605.28657)项目页面(https://daydreamlive.github.io/DEMON/)GitHub(https://github.com/daydreamlive/DEMON)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.28657)
在你的代理中获取此论文:
hf papers read 2605.28657
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 1
daydreamlive/DEMON 音频到音频 • 更新于约 4 小时前(https://huggingface.co/daydreamlive/DEMON)
引用本论文的数据集 0
无数据集链接本论文
请在数据集的 README.md 中引用 arxiv.org/abs/2605.28657,以便在此页面上建立链接。
引用本论文的 Space 0
无 Space 链接本论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2605.28657,以便在此页面上建立链接。
包含本论文的收藏 1
相似文章
Live Music Diffusion Models: 交互式扩散音乐生成器的高效微调与后训练
本文介绍了Live Music Diffusion Models(LMDMs),它通过修改扩散过程,实现了高效的块式处理以及新颖的训练范式,从而在消费级硬件上进行实时交互式音乐生成,在推理复杂度上超越了离散自回归模型,并实现了稳定的后训练对齐。
展开与回滚:扩散大语言模型是自身的效率教师
本文介绍了 WINO 和 WINO+,这两种方法能够在扩散大语言模型中实现可撤销的并行解码,并提炼高效的降噪轨迹,显著改善质量-速度权衡。
来自NVIDIA的Nemotron-Labs-Diffusion
NVIDIA发布了Nemotron-Labs-Diffusion模型系列(3B至14B),该系列同时支持AR解码和扩散解码,并采用新颖的自推测机制,在多种硬件平台上相比标准AR和Eagle3方法实现了显著加速(最高达4倍)。
UniDDT: 通过解耦扩散变换器统一多模态理解与生成
UniDDT提出了一种解耦扩散变换器框架,通过利用Noisy ViT编码器和LLM进行语义编码,统一了多模态理解与生成,在两个任务上均取得了强劲性能。
[开源] dlmserve —— 首个扩散语言模型服务引擎
dlmserve 是首个面向扩散语言模型的开源服务引擎,提供兼容 OpenAI 的 API、持续批处理功能,在 12GB VRAM 内即可运行,吞吐量是 Hugging Face 的 2.5 倍。