@MireloAI: 今天,我们与@kyutai_labs合作,推出了全新的Audio-to-MIDI模型。它能接收完整的录音,并识别…
摘要
Mirelo AI与Kyutai Labs合作,推出了一款开源的Audio-to-MIDI模型,该模型能将完整的音乐混音转录为每个乐器的单独MIDI音轨,并直接从混音中检测和弦、调性和节奏,无需分离的音轨。
查看缓存全文
缓存时间: 2026/07/11 07:26
今天,我们与 @kyutai_labs 一起推出了全新的音频转 MIDI 模型。
只需提供一段完整的录音,它就能识别出演奏的乐器,并返回每个乐器的独立 MIDI 轨道——人声、鼓、贝斯、键盘等。
与大多数现有解决方案不同,我们的模型直接处理完整混音,无需先分离出单独的音轨。
它还能识别和弦、调性和节拍,为制作人提供更丰富的音乐上下文。
我们撰写了更多关于该模型、所要解决的问题以及工作原理的细节:http://mirelo.ai/blog/turning-audio-to-midi…
音频转 MIDI
来源:https://www.mirelo.ai/blog/turning-audio-to-midi **你是否曾听过一首喜爱的歌曲,希望能得到乐谱自己演奏?**我们的全新音频转 MIDI 模型就能做到这一点。给它一首歌,它就能返回每个乐器对应的音符:人声、鼓、贝斯、键盘等,各自独立成轨。
今天,我们与 Kyutai 一起,将这款模型及其背后的研究开源。我们还训练了一个改进版,使用了更多数据,现在你可以在全新的免费音频转 MIDI 工具中试用(位于 Mirelo Studio)。该工具可转录任何 WAV 或 MP3 格式的完整混音。之后,你可以获取完整的乐谱来学习某个乐器声部,或将任何轨道导出为 MIDI 并导入你的 DAW 进行二次创作。快来试试吧!
- Mirelo 的音频转 MIDI 工具 (https://www.mirelo.ai/studio)
- 模型权重在 Hugging Face (https://huggingface.co/MuScriptor)
- GitHub 仓库 (https://github.com/muscriptor/muscriptor)
- ArXiv 论文 (https://arxiv.org/abs/2607.08168)
你能得到什么
我们的模型专为完整混音场景设计。上传一段录音,它会提供:
- 自动乐器检测。模型能找出混音中的每个声部并为其打上标签(人声、鼓、电贝司、合成器主音等)。
- 每个乐器对应一条独立的 MIDI 轨道。每个检测到的声部都会在钢琴卷帘窗中呈现为独立轨道,你可以在导出前检查转录结果并调整任何需要修改的音符。
- 音乐上下文。如我们的音频转 MIDI 工具所示,基于该模型的应用还能进一步识别和弦、调性和节拍,为你呈现完整的和声画面。
- 一键导出。你可以独奏、静音或下载任意轨道的 MIDI 文件,直接拖入 DAW 使用。
为何我们对此感到兴奋
现有的音频转 MIDI 工具已经存在,有些还相当不错。但几乎所有的工具都只能一次处理一种声音:单独的人声、独奏钢琴、单次吉他录制。真实的音乐要密集得多,人声、鼓、贝斯等同时堆叠,往往还带有各种效果。这种密度正是现有模型失效的地方,也是为何将完整歌曲转化为可用 MIDI 一直是个难题。而我们的模型正好填补了这一空白:它能够直接处理完整混音,同时转录出所有乐器。
将音乐转录视为语言建模
在最基本的形式中,音乐转录涉及获取音乐音频录音的波形,并提取其中所有音符的起止时间。在多乐器情况下,我们还需要知道特定音符由哪件乐器演奏。这样的转录结果通常用钢琴卷帘表示法来可视化,其中 x 轴对应时间,y 轴对应音高,不同颜色的方块表示不同乐器演奏的音符。
钢琴卷帘表示法
我们的模型与先前的工作 [MT3] 类似,将这种钢琴卷帘表示为一个一维的离散 token 序列,每个 token 代表音高、时间和乐器类型。这种表示法与数字乐器中用于编码音符序列的流行 MIDI 标准类似。
Token 表示法
模型使用一个简单的纯解码器 Transformer 主干来预测这个 token 序列,从而将音乐转录当作语言建模来处理。模型接受一个表示 5 秒音频片段的梅尔频谱图作为前缀条件,并自回归地生成转录 token 流,直到得到 EOS token 为止。
Transformer 架构
合成预训练,强化学习后训练
在先前的工作 [MT3, YMT3] 中,已经探索过将音乐转录视为语言建模。那么,为什么有效的多乐器转录仍然如此难以实现?
构建多乐器 AMT 系统的一个主要瓶颈是缺乏具有对齐音符标注的音乐音频数据。对于钢琴 [MAESTRO] 这类特定乐器,这类数据相对容易获取,但在多乐器场景下则要困难得多。可大规模生成的合成音乐音频是一种有前景的替代方案。然而,尽管先前的工作确实使用了合成训练数据,但得到的模型泛化能力很差,导致在真实多乐器场景下的转录输出基本不可用。
对于我们的模型,我们利用合成数据进行预训练,同时结合在真实音乐音频上的微调以及使用强化学习的后训练,形成了三种训练数据集的组合:
- DSynth:我们收集了一个约 145 万 MIDI 文件的数据集,涵盖不同流派(重点关注流行音乐和西方古典音乐)。为了将这些数据用于转录,我们开发了一个实时合成流程,使用了不同的乐器、调性、速度和调音。
- DReal:为补充合成数据集 DSynth 并研究不同数据类型的影响,我们还使用了内部数据集,包含 17 万段真实音乐音频录音(总计超过 11,000 小时),并带有对齐的音符标注。
- DRL:最后,我们从 DReal 中精选出 300 首曲目,对模型应用类似 GRPO 的算法,使其与这个小型高质量转录数据集对齐。
各数据集上的训练结果
我们在 DSynth 上预训练模型,在 DReal 上微调,并在 DRL 上进行后训练。我们观察到,每个训练阶段都能比前一阶段提升结果。特别是,虽然仅在合成数据上训练的模型在帧 F1 分数上已能与先前的 state-of-the-art AMT 基线 [YMT3] 竞争,但微调 DReal 对于性能至关重要,它能使所有指标提升约 20 个百分点。此外,在高质量数据集 DRL 上的强化学习阶段进一步改善了结果,使我们得到了整体最佳的模型。
在随模型一同发布的论文中,我们提供了关于合成预训练效果的更多分析,并概述了我们的可选乐器条件机制,该机制允许根据特定乐器配置定制转录输出。
面向研究者的开放权重,面向音乐家的应用程序
所有详细信息请查看我们在 arXiv 上的论文 (https://arxiv.org/abs/2607.08168)。
为推动未来研究,推理代码 (https://github.com/muscriptor/muscriptor) 已发布在 GitHub,模型权重 (https://huggingface.co/MuScriptor) 已发布在 Hugging Face。
而改进后更精确的版本现已上线 Mirelo Studio (https://www.mirelo.ai/studio)。快去试试吧!
引用本作品时请使用以下参考文献:
@inproceedings{muscriptor2026,
title = {MuScriptor: An Open Model for Multi-Instrument Music Transcription},
author = {Rouard, Simon and Krause, Michael and Roebel, Axel and
Simon-Gabriel, Carl-Johann and D{\'e}fossez, Alexandre},
year = {2026},
note = {Mirelo AI, Kyutai, IRCAM}
}
参考文献
[MT3] J. Gardner, I. Simon, E. Manilow, C. Hawthorne, and J. Engel, "MT3: multi-task multitrack music transcription," in ICLR, 2022.
[YMT3] S. Chang, E. Benetos, H. Kirchhoff, and S. Dixon, "YourMT3+: multi-instrument music transcription with enhanced transformer architectures and cross-dataset stem augmentation" in MLSP, 2024.
[MAESTRO] C. Hawthorne, A. Stasyuk, A. Roberts, I. Simon, C. A. Huang, S. Dieleman, E. Elsen, J. H. Engel, and D. Eck, "Enabling factorized piano music modeling and generation with the MAESTRO dataset," in ICLR, 2019.
相似文章
@kyutai_labs: 我们发布了 MuScriptor,迄今最佳的多乐器转录开源模型,由我们与 @MireloAI 合作开发。
Kyutai Labs 与 MireloAI 发布了 MuScriptor,这是迄今最佳的多乐器转录开源模型,能够将任意流派的录音转录为各乐器的 MIDI 音轨。
@honualx: 音乐缺少了自己的“openai-whisper”。是时候让我们可以把任何音乐转成音符,就像语音转写现在已经成为理所当然的事情一样。
Kyutai 发布了 MuScriptor,这是一个用于多乐器转录的开源模型,能将任何音乐录音转换为 MIDI 音符,类似于 OpenAI Whisper 对语音的处理。
MuScriptor:一个用于多乐器音乐转录的开放模型
MuScriptor 是一个开源的多乐器音乐转录模型,能够将录音转录为每种乐器的 MIDI 音符,无需事先知道存在的乐器。
Music AI Sandbox 推出新功能,访问权限扩大
Google DeepMind 扩展了 Music AI Sandbox,新增功能包括 Lyria 2 音乐生成模型,并向美国音乐人开放更广泛的访问权限,通过用于生成、扩展和编辑音乐内容的工具来实现 AI 辅助音乐创作。
@StabilityAI: 大多数AI音频模型从未听过马卡姆。Team Motif对Stable Audio 3.0进行了微调,针对阿拉伯马卡姆,并构建了一个Ableton…
Team Motif对Stable Audio 3.0进行了针对阿拉伯马卡姆的微调,并构建了一个用于微调音风格迁移的Ableton插件,赢得了Music Hackspace举办的Stable Audio 3.0挑战赛。