@MireloAI: 今天,我们与@kyutai_labs合作,推出了全新的Audio-to-MIDI模型。它能接收完整的录音,并识别…

X AI KOLs Following 模型

摘要

Mirelo AI与Kyutai Labs合作,推出了一款开源的Audio-to-MIDI模型,该模型能将完整的音乐混音转录为每个乐器的单独MIDI音轨,并直接从混音中检测和弦、调性和节奏,无需分离的音轨。

今天,我们与@kyutai_labs合作,推出了全新的Audio-to-MIDI模型。 它能接收完整的录音,识别正在演奏的乐器,并返回每种乐器的单独MIDI音轨——人声、鼓、贝斯、键盘等。 与大多数现有解决方案不同,我们的模型直接从完整混音中工作,而无需单独的音轨。 它还能检测和弦、调性和节奏,为制作人提供更广泛的音乐语境。 我们撰写了更多关于该模型、问题以及工作原理的文章,请访问:http://mirelo.ai/blog/turning-audio-to-midi…
查看原文
查看缓存全文

缓存时间: 2026/07/11 07:26

今天,我们与 @kyutai_labs 一起推出了全新的音频转 MIDI 模型。

只需提供一段完整的录音,它就能识别出演奏的乐器,并返回每个乐器的独立 MIDI 轨道——人声、鼓、贝斯、键盘等。

与大多数现有解决方案不同,我们的模型直接处理完整混音,无需先分离出单独的音轨。

它还能识别和弦、调性和节拍,为制作人提供更丰富的音乐上下文。

我们撰写了更多关于该模型、所要解决的问题以及工作原理的细节:http://mirelo.ai/blog/turning-audio-to-midi…


音频转 MIDI

来源:https://www.mirelo.ai/blog/turning-audio-to-midi **你是否曾听过一首喜爱的歌曲,希望能得到乐谱自己演奏?**我们的全新音频转 MIDI 模型就能做到这一点。给它一首歌,它就能返回每个乐器对应的音符:人声、鼓、贝斯、键盘等,各自独立成轨。

今天,我们与 Kyutai 一起,将这款模型及其背后的研究开源。我们还训练了一个改进版,使用了更多数据,现在你可以在全新的免费音频转 MIDI 工具中试用(位于 Mirelo Studio)。该工具可转录任何 WAV 或 MP3 格式的完整混音。之后,你可以获取完整的乐谱来学习某个乐器声部,或将任何轨道导出为 MIDI 并导入你的 DAW 进行二次创作。快来试试吧!

  • Mirelo 的音频转 MIDI 工具 (https://www.mirelo.ai/studio)
  • 模型权重在 Hugging Face (https://huggingface.co/MuScriptor)
  • GitHub 仓库 (https://github.com/muscriptor/muscriptor)
  • ArXiv 论文 (https://arxiv.org/abs/2607.08168)

你能得到什么

我们的模型专为完整混音场景设计。上传一段录音,它会提供:

  • 自动乐器检测。模型能找出混音中的每个声部并为其打上标签(人声、鼓、电贝司、合成器主音等)。
  • 每个乐器对应一条独立的 MIDI 轨道。每个检测到的声部都会在钢琴卷帘窗中呈现为独立轨道,你可以在导出前检查转录结果并调整任何需要修改的音符。
  • 音乐上下文。如我们的音频转 MIDI 工具所示,基于该模型的应用还能进一步识别和弦、调性和节拍,为你呈现完整的和声画面。
  • 一键导出。你可以独奏、静音或下载任意轨道的 MIDI 文件,直接拖入 DAW 使用。

为何我们对此感到兴奋

现有的音频转 MIDI 工具已经存在,有些还相当不错。但几乎所有的工具都只能一次处理一种声音:单独的人声、独奏钢琴、单次吉他录制。真实的音乐要密集得多,人声、鼓、贝斯等同时堆叠,往往还带有各种效果。这种密度正是现有模型失效的地方,也是为何将完整歌曲转化为可用 MIDI 一直是个难题。而我们的模型正好填补了这一空白:它能够直接处理完整混音,同时转录出所有乐器。

将音乐转录视为语言建模

在最基本的形式中,音乐转录涉及获取音乐音频录音的波形,并提取其中所有音符的起止时间。在多乐器情况下,我们还需要知道特定音符由哪件乐器演奏。这样的转录结果通常用钢琴卷帘表示法来可视化,其中 x 轴对应时间,y 轴对应音高,不同颜色的方块表示不同乐器演奏的音符。

钢琴卷帘表示法

我们的模型与先前的工作 [MT3] 类似,将这种钢琴卷帘表示为一个一维的离散 token 序列,每个 token 代表音高、时间和乐器类型。这种表示法与数字乐器中用于编码音符序列的流行 MIDI 标准类似。

Token 表示法

模型使用一个简单的纯解码器 Transformer 主干来预测这个 token 序列,从而将音乐转录当作语言建模来处理。模型接受一个表示 5 秒音频片段的梅尔频谱图作为前缀条件,并自回归地生成转录 token 流,直到得到 EOS token 为止。

Transformer 架构

合成预训练,强化学习后训练

在先前的工作 [MT3, YMT3] 中,已经探索过将音乐转录视为语言建模。那么,为什么有效的多乐器转录仍然如此难以实现?

构建多乐器 AMT 系统的一个主要瓶颈是缺乏具有对齐音符标注的音乐音频数据。对于钢琴 [MAESTRO] 这类特定乐器,这类数据相对容易获取,但在多乐器场景下则要困难得多。可大规模生成的合成音乐音频是一种有前景的替代方案。然而,尽管先前的工作确实使用了合成训练数据,但得到的模型泛化能力很差,导致在真实多乐器场景下的转录输出基本不可用。

对于我们的模型,我们利用合成数据进行预训练,同时结合在真实音乐音频上的微调以及使用强化学习的后训练,形成了三种训练数据集的组合:

  • DSynth:我们收集了一个约 145 万 MIDI 文件的数据集,涵盖不同流派(重点关注流行音乐和西方古典音乐)。为了将这些数据用于转录,我们开发了一个实时合成流程,使用了不同的乐器、调性、速度和调音。
  • DReal:为补充合成数据集 DSynth 并研究不同数据类型的影响,我们还使用了内部数据集,包含 17 万段真实音乐音频录音(总计超过 11,000 小时),并带有对齐的音符标注。
  • DRL:最后,我们从 DReal 中精选出 300 首曲目,对模型应用类似 GRPO 的算法,使其与这个小型高质量转录数据集对齐。

各数据集上的训练结果

我们在 DSynth 上预训练模型,在 DReal 上微调,并在 DRL 上进行后训练。我们观察到,每个训练阶段都能比前一阶段提升结果。特别是,虽然仅在合成数据上训练的模型在帧 F1 分数上已能与先前的 state-of-the-art AMT 基线 [YMT3] 竞争,但微调 DReal 对于性能至关重要,它能使所有指标提升约 20 个百分点。此外,在高质量数据集 DRL 上的强化学习阶段进一步改善了结果,使我们得到了整体最佳的模型。

在随模型一同发布的论文中,我们提供了关于合成预训练效果的更多分析,并概述了我们的可选乐器条件机制,该机制允许根据特定乐器配置定制转录输出。

面向研究者的开放权重,面向音乐家的应用程序

所有详细信息请查看我们在 arXiv 上的论文 (https://arxiv.org/abs/2607.08168)。

为推动未来研究,推理代码 (https://github.com/muscriptor/muscriptor) 已发布在 GitHub,模型权重 (https://huggingface.co/MuScriptor) 已发布在 Hugging Face。

而改进后更精确的版本现已上线 Mirelo Studio (https://www.mirelo.ai/studio)。快去试试吧!

引用本作品时请使用以下参考文献:

@inproceedings{muscriptor2026,
title     = {MuScriptor: An Open Model for Multi-Instrument Music Transcription},
author    = {Rouard, Simon and Krause, Michael and Roebel, Axel and
Simon-Gabriel, Carl-Johann and D{\'e}fossez, Alexandre},
year      = {2026},
note      = {Mirelo AI, Kyutai, IRCAM}
}

参考文献

[MT3]      J. Gardner, I. Simon, E. Manilow, C. Hawthorne, and J. Engel, "MT3: multi-task multitrack music transcription," in ICLR, 2022.
[YMT3]     S. Chang, E. Benetos, H. Kirchhoff, and S. Dixon, "YourMT3+: multi-instrument music transcription with enhanced transformer architectures and cross-dataset stem augmentation" in MLSP, 2024.
[MAESTRO]  C. Hawthorne, A. Stasyuk, A. Roberts, I. Simon, C. A. Huang, S. Dieleman, E. Elsen, J. H. Engel, and D. Eck, "Enabling factorized piano music modeling and generation with the MAESTRO dataset," in ICLR, 2019.

相似文章