@MireloAI: 今天,我们与@kyutai_labs合作,推出了全新的Audio-to-MIDI模型。它能接收完整的录音,并识别…

X AI KOLs Following 模型

摘要

Mirelo AI与Kyutai Labs合作,推出了一款开源的Audio-to-MIDI模型,该模型能将完整的音乐混音转录为每个乐器的单独MIDI音轨,并直接从混音中检测和弦、调性和节奏,无需分离的音轨。

今天,我们与@kyutai_labs合作,推出了全新的Audio-to-MIDI模型。 它能接收完整的录音,识别正在演奏的乐器,并返回每种乐器的单独MIDI音轨——人声、鼓、贝斯、键盘等。 与大多数现有解决方案不同,我们的模型直接从完整混音中工作,而无需单独的音轨。 它还能检测和弦、调性和节奏,为制作人提供更广泛的音乐语境。 我们撰写了更多关于该模型、问题以及工作原理的文章,请访问:http://mirelo.ai/blog/turning-audio-to-midi…
查看原文
查看缓存全文

缓存时间: 2026/07/11 07:26

今天,我们与 @kyutai_labs 一起推出了全新的音频转 MIDI 模型。

只需提供一段完整的录音,它就能识别出演奏的乐器,并返回每个乐器的独立 MIDI 轨道——人声、鼓、贝斯、键盘等。

与大多数现有解决方案不同,我们的模型直接处理完整混音,无需先分离出单独的音轨。

它还能识别和弦、调性和节拍,为制作人提供更丰富的音乐上下文。

我们撰写了更多关于该模型、所要解决的问题以及工作原理的细节:http://mirelo.ai/blog/turning-audio-to-midi…


音频转 MIDI

来源:https://www.mirelo.ai/blog/turning-audio-to-midi **你是否曾听过一首喜爱的歌曲,希望能得到乐谱自己演奏?**我们的全新音频转 MIDI 模型就能做到这一点。给它一首歌,它就能返回每个乐器对应的音符:人声、鼓、贝斯、键盘等,各自独立成轨。

今天,我们与 Kyutai 一起,将这款模型及其背后的研究开源。我们还训练了一个改进版,使用了更多数据,现在你可以在全新的免费音频转 MIDI 工具中试用(位于 Mirelo Studio)。该工具可转录任何 WAV 或 MP3 格式的完整混音。之后,你可以获取完整的乐谱来学习某个乐器声部,或将任何轨道导出为 MIDI 并导入你的 DAW 进行二次创作。快来试试吧!

  • Mirelo 的音频转 MIDI 工具 (https://www.mirelo.ai/studio)
  • 模型权重在 Hugging Face (https://huggingface.co/MuScriptor)
  • GitHub 仓库 (https://github.com/muscriptor/muscriptor)
  • ArXiv 论文 (https://arxiv.org/abs/2607.08168)

你能得到什么

我们的模型专为完整混音场景设计。上传一段录音,它会提供:

  • 自动乐器检测。模型能找出混音中的每个声部并为其打上标签(人声、鼓、电贝司、合成器主音等)。
  • 每个乐器对应一条独立的 MIDI 轨道。每个检测到的声部都会在钢琴卷帘窗中呈现为独立轨道,你可以在导出前检查转录结果并调整任何需要修改的音符。
  • 音乐上下文。如我们的音频转 MIDI 工具所示,基于该模型的应用还能进一步识别和弦、调性和节拍,为你呈现完整的和声画面。
  • 一键导出。你可以独奏、静音或下载任意轨道的 MIDI 文件,直接拖入 DAW 使用。

为何我们对此感到兴奋

现有的音频转 MIDI 工具已经存在,有些还相当不错。但几乎所有的工具都只能一次处理一种声音:单独的人声、独奏钢琴、单次吉他录制。真实的音乐要密集得多,人声、鼓、贝斯等同时堆叠,往往还带有各种效果。这种密度正是现有模型失效的地方,也是为何将完整歌曲转化为可用 MIDI 一直是个难题。而我们的模型正好填补了这一空白:它能够直接处理完整混音,同时转录出所有乐器。

将音乐转录视为语言建模

在最基本的形式中,音乐转录涉及获取音乐音频录音的波形,并提取其中所有音符的起止时间。在多乐器情况下,我们还需要知道特定音符由哪件乐器演奏。这样的转录结果通常用钢琴卷帘表示法来可视化,其中 x 轴对应时间,y 轴对应音高,不同颜色的方块表示不同乐器演奏的音符。

钢琴卷帘表示法

我们的模型与先前的工作 [MT3] 类似,将这种钢琴卷帘表示为一个一维的离散 token 序列,每个 token 代表音高、时间和乐器类型。这种表示法与数字乐器中用于编码音符序列的流行 MIDI 标准类似。

Token 表示法

模型使用一个简单的纯解码器 Transformer 主干来预测这个 token 序列,从而将音乐转录当作语言建模来处理。模型接受一个表示 5 秒音频片段的梅尔频谱图作为前缀条件,并自回归地生成转录 token 流,直到得到 EOS token 为止。

Transformer 架构

合成预训练,强化学习后训练

在先前的工作 [MT3, YMT3] 中,已经探索过将音乐转录视为语言建模。那么,为什么有效的多乐器转录仍然如此难以实现?

构建多乐器 AMT 系统的一个主要瓶颈是缺乏具有对齐音符标注的音乐音频数据。对于钢琴 [MAESTRO] 这类特定乐器,这类数据相对容易获取,但在多乐器场景下则要困难得多。可大规模生成的合成音乐音频是一种有前景的替代方案。然而,尽管先前的工作确实使用了合成训练数据,但得到的模型泛化能力很差,导致在真实多乐器场景下的转录输出基本不可用。

对于我们的模型,我们利用合成数据进行预训练,同时结合在真实音乐音频上的微调以及使用强化学习的后训练,形成了三种训练数据集的组合:

  • DSynth:我们收集了一个约 145 万 MIDI 文件的数据集,涵盖不同流派(重点关注流行音乐和西方古典音乐)。为了将这些数据用于转录,我们开发了一个实时合成流程,使用了不同的乐器、调性、速度和调音。
  • DReal:为补充合成数据集 DSynth 并研究不同数据类型的影响,我们还使用了内部数据集,包含 17 万段真实音乐音频录音(总计超过 11,000 小时),并带有对齐的音符标注。
  • DRL:最后,我们从 DReal 中精选出 300 首曲目,对模型应用类似 GRPO 的算法,使其与这个小型高质量转录数据集对齐。

各数据集上的训练结果

我们在 DSynth 上预训练模型,在 DReal 上微调,并在 DRL 上进行后训练。我们观察到,每个训练阶段都能比前一阶段提升结果。特别是,虽然仅在合成数据上训练的模型在帧 F1 分数上已能与先前的 state-of-the-art AMT 基线 [YMT3] 竞争,但微调 DReal 对于性能至关重要,它能使所有指标提升约 20 个百分点。此外,在高质量数据集 DRL 上的强化学习阶段进一步改善了结果,使我们得到了整体最佳的模型。

在随模型一同发布的论文中,我们提供了关于合成预训练效果的更多分析,并概述了我们的可选乐器条件机制,该机制允许根据特定乐器配置定制转录输出。

面向研究者的开放权重,面向音乐家的应用程序

所有详细信息请查看我们在 arXiv 上的论文 (https://arxiv.org/abs/2607.08168)。

为推动未来研究,推理代码 (https://github.com/muscriptor/muscriptor) 已发布在 GitHub,模型权重 (https://huggingface.co/MuScriptor) 已发布在 Hugging Face。

而改进后更精确的版本现已上线 Mirelo Studio (https://www.mirelo.ai/studio)。快去试试吧!

引用本作品时请使用以下参考文献:

@inproceedings{muscriptor2026,
title     = {MuScriptor: An Open Model for Multi-Instrument Music Transcription},
author    = {Rouard, Simon and Krause, Michael and Roebel, Axel and
Simon-Gabriel, Carl-Johann and D{\'e}fossez, Alexandre},
year      = {2026},
note      = {Mirelo AI, Kyutai, IRCAM}
}

参考文献

[MT3]      J. Gardner, I. Simon, E. Manilow, C. Hawthorne, and J. Engel, "MT3: multi-task multitrack music transcription," in ICLR, 2022.
[YMT3]     S. Chang, E. Benetos, H. Kirchhoff, and S. Dixon, "YourMT3+: multi-instrument music transcription with enhanced transformer architectures and cross-dataset stem augmentation" in MLSP, 2024.
[MAESTRO]  C. Hawthorne, A. Stasyuk, A. Roberts, I. Simon, C. A. Huang, S. Dieleman, E. Elsen, J. H. Engel, and D. Eck, "Enabling factorized piano music modeling and generation with the MAESTRO dataset," in ICLR, 2019.

相似文章

Music AI Sandbox 推出新功能,访问权限扩大

Google DeepMind Blog

Google DeepMind 扩展了 Music AI Sandbox,新增功能包括 Lyria 2 音乐生成模型,并向美国音乐人开放更广泛的访问权限,通过用于生成、扩展和编辑音乐内容的工具来实现 AI 辅助音乐创作。