Stereo2Spatial: 将立体声音乐曲目转换为空间化双声道混音 [P]

Reddit r/MachineLearning 模型

摘要

发布了一个模型(Stereo2Spatial),可将立体声音乐曲目转换为空间化双声道混音,采用流匹配扩散和振幅提升技术以实现稳定训练。该模型及一款Windows应用均以Apache 2.0许可证开源。

我发布了一个我断断续续工作了约6个月的模型。我一直很喜欢听空间音乐,但很多音乐并没有真正高质量的空间混音。所以我决定做一个模型,将立体声转换为空间音效。我首先制作了一个流匹配扩散模型,它在单独训练的VAE(EAR-VAE)的潜在空间中运行。我使用VAE将立体声输入编码为一个潜在向量,然后分别对7.1.4输出的每个通道进行编码。这种设计与我发现的一篇关于另一个立体声 -> 空间项目(ImmersiveFlow)的论文类似(该论文中有代码链接,但对我来说都返回404,所以我从头构建了代码库)。我在ImmersiveFlow论文基础上增加的一个关键功能是让模型能够跨窗口携带状态(记忆令牌),以实现稳定的长上下文生成。由于VAE与输出分布不匹配(它被训练为直接编码/解码立体声轨道,而不是单独通道,更不用说7.1.4混音的单独通道了),结果遇到了真正的质量瓶颈。但这表明映射是可能的。 我没有坚持在潜在空间中进行建模,而是决定转向对原始波形进行建模。这最终解决了我在潜在版本中看到的所有质量问题,但代价是训练计算量更大且不稳定。波形版本的模型训练到大约60K-80K步时,损失会像往常一样下降,验证生成看起来不错/在改进,然后它会迅速变得不稳定,损失会飙升。我尝试了直接波形、用乘数缩放波形、激进梯度裁剪、更低的学习率,所有这些实验都以同样的方式失败。幸运的是,我偶然发现了一篇名为WavFlow的最新论文。该项目的作者也遇到了使用流匹配扩散对原始波形进行建模的问题,他们通过使用振幅提升解决了这个问题(将每个音频轨道的RMS缩放至0.33,然后乘以3)(WavFlow论文在缩放前使用了1.0的裁剪,导致模型空间为-3到3,但我使用了4.0的裁剪,导致模型空间为-12到12(根据我的测试,这会产生更好的双声道输出))。一旦我像论文那样实现了振幅提升,训练稳定性问题就消失了。 波形模型在2个A6000 GPU上训练了约20天,使用了7,669条轨道: - 第一阶段10天,有效批次大小16,训练序列长度分别为10秒、18秒、26秒和34秒 - 第二阶段10天,有效批次大小16,训练序列长度为122秒 - 可选的混音风格条件控制(仅波形版本) - 直接双声道输出(波形训练比潜在训练计算成本更高,因此双声道版本验证了想法/理论,未来相同的代码库和数据可用于训练7.1.4版本(一旦我有计算资源)) 我还制作了一个Windows桌面应用程序,用于推理模型和使用结果。所有内容均以Apache 2.0许可证发布。 Huggingface波形模型链接:https://huggingface.co/francislabounty/stereo2spatial-v2-binaural Huggingface潜在模型链接:https://huggingface.co/francislabounty/stereo2spatial-v1 训练/推理GitHub仓库:https://github.com/francislabountyjr/stereo2spatial Windows应用GitHub仓库:https://github.com/francislabountyjr/stereo2spatial-app 应用主页:https://stereo2spatial.francislabounty.com 波形模型案例研究:https://francislabounty.com/blog/stereo2spatial-v2 潜在模型案例研究:https://francislabounty.com/blog/stereo2spatial 模型生成曲目播放列表(将随时间添加更多曲目):https://www.youtube.com/playlist?list=PLQ-HHjPijrAg 如有任何问题等,请留言,我会尽力回答!免责声明:我知道AI撰写的帖子通常不受欢迎,所以这篇帖子100%由我自己撰写(错误等也均出自本人)。但上述链接中的案例研究和README文件是借助AI完成的。
查看原文

相似文章

基于自回归扩散变换器的流式同步空间音频生成

Hugging Face Daily Papers

SwanSphere 提出了一种统一的流式框架,通过因果自回归扩散变换器和多模态学习策略,从全景视频和文本提示中生成高保真空间音频,在视频到空间音频和文本到空间音频任务中均实现了卓越性能。

Stable Audio 3

Hacker News Top

Stable Audio 3 推出了一系列快速潜扩散模型,用于变长音频生成与编辑,并开源了中小型模型权重。

StepAudio 2.5 技术报告

Hugging Face Daily Papers

StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。