google/magenta-realtime-2

Hugging Face Models Trending 模型

摘要

Google DeepMind 发布了 Magenta RealTime 2,这是一个开源音乐生成模型,支持设备端流式处理,可通过文本、音频示例和 MIDI 实现低延迟控制。

任务:文本转音频 Tags: magenta-realtime-2, tflite, text-to-audio, arxiv:2508.04651, arxiv:2508.05207, arxiv:2205.01917, arxiv:2208.12415, license:cc-by-4.0, region:us
查看原文
查看缓存全文

缓存时间: 2026/06/08 03:28

google/magenta-realtime-2 · Hugging Face

来源:https://huggingface.co/google/magenta-realtime-2

Magenta RealTime 2 模型卡

作者:Google DeepMind

资源

  • 快速开始 (https://magenta.withgoogle.com/mrt2)
  • 博客文章 (https://magenta.withgoogle.com/magenta-realtime-2)
  • 代码仓库 (https://github.com/magenta/magenta-realtime)
  • HuggingFace (https://huggingface.co/google/magenta-realtime-2)

使用条款

Magenta RealTime 2 采用组合许可方式:代码库基于 Apache 2.0 许可(https://github.com/magenta/magenta-realtime/blob/main/LICENSE),模型权重基于 Creative Commons Attribution 4.0 International 许可(https://creativecommons.org/licenses/by/4.0/legalcode)。此外,我们指定以下使用条款:

版权所有 2026 Google LLC

请负责任地使用这些材料,不得生成侵犯或违反他人权利(包括受版权保护的内容的权利)的内容,包括输出结果。

Google 对您使用 Magenta RealTime 2 生成的输出不主张任何权利。您和您的用户对输出及其后续使用承担全部责任。

除非适用法律要求或书面同意,根据 Apache 2.0 或 CC-BY 许可分发的所有软件和材料均按“现状”提供,不附带任何明示或暗示的保证或条件。请参阅各许可,了解其中规定的具体权限和限制。您全权负责判断使用、复制、修改、表演、展示或分发软件、材料及任何输出的适当性,并承担与您使用或分发软件、材料及任何输出,以及行使许可中权利和权限相关的所有风险。

模型详情

Magenta RealTime 2 是 Google 开发的一款开放音乐生成模型,专为设备端流式生成长时间低延迟控制而设计。它属于实时音乐模型(https://arxiv.org/abs/2508.04651),是之前 Magenta RealTime 模型(https://huggingface.co/google/magenta-realtime)和 Lyria RealTime API(http://goo.gle/lyria-realtime)的后续版本,提供设备端生成,具有更丰富的控制和更低的延迟。Magenta RealTime 2 能够通过文本提示、音频示例和 MIDI 进行引导,连续生成音乐音频。

系统组件

Magenta RealTime 2 由三个组件组成:SpectroStream、MusicCoCa 和一个 LLM。其结构与原始 Magenta RealTime 类似,详见此处(https://arxiv.org/abs/2508.04651)。主要区别在于 LLM,现在是一个仅解码器模型,支持逐帧自回归(而非分块自回归),并针对设备端流式处理和帧级控制进行了调优。

  1. SpectroStream(Li+ 25 https://arxiv.org/abs/2508.05207)是一种离散音频编解码器,可将立体声 48kHz 音频转换为令牌。
  2. MusicCoCa 是一个对比学习训练的模型,能够将音频和文本嵌入到公共嵌入空间中,基于 Yu+ 22(https://arxiv.org/abs/2205.01917)和 Huang+ 22(https://arxiv.org/abs/2208.12415)的工作。
  3. 一个仅解码器 Transformer LLM,根据上下文音频令牌、分词后的 MusicCoCa 嵌入和 MIDI 令牌生成音频令牌。有两种配置:
    1. base 配置:2.4B 参数
    2. small 配置:230M 参数

输入和输出

  • SpectroStream RVQ 编解码器:将高保真音乐音频令牌化
    • 编码器输入 / 解码器输出:音乐音频波形,48kHz 立体声
    • 编码器输出 / 解码器输入:离散音频令牌,25Hz 帧率,64 RVQ 深度,10 位编码,16kbps
  • MusicCoCa:文本和音乐音频的联合嵌入
    • 输入:音乐音频波形,16kHz 单声道,或音乐风格的文本表示,例如“重金属”
    • 输出:768 维嵌入,量化为 12 RVQ 深度,10 位编码
  • 解码器 Transformer LLM:根据上下文、MIDI 和风格生成音频令牌。在每个时间步(编解码器帧),模型接收:
    • 输入
      • (上下文)SpectroStream 令牌
        • base:每层 25 帧(1 秒)窗口注意力,20 层
        • small:每层 41 帧(约 1.6 秒)窗口注意力,12 层
        • 两个模型的有效感受野均为 20 秒
      • (风格)12 个 MusicCoCa 令牌
      • (MIDI)128 维多热向量,表示该帧内每个 MIDI 音高的状态(0 = 关闭,1 = 保持,2 = 起始,3 = 保持或起始,由模型决定)
    • 输出:1 个生成的帧,12 个 RVQ 令牌

用途

音乐生成模型,特别是针对连续实时生成和控制的模型,在各个行业和领域有着广泛的应用。以下潜在用途列表并不全面。此列表的目的是提供模型创建者在模型训练和开发过程中考虑的可能用例的上下文信息。

  • 交互式音乐创作
    • 现场表演 / 即兴创作:这些模型可用于现场表演环境中的音乐生成,由表演者通过操控风格嵌入或音频上下文进行控制。
    • 无障碍音乐创作与音乐治疗:有障碍(技能差距、残疾等)使用传统乐器的人可以参与集体即兴演奏或 solo 音乐创作。
    • 视频游戏:开发者可以根据用户的动作和环境,实时为用户生成自定义配乐。
  • 研究
    • 迁移学习:研究人员可以利用 MusicCoCa 和 Magenta RT 2 的表示来识别音乐信息。
  • 个性化
    • 音乐家可以使用自己的作品目录对模型进行微调,以定制模型风格(微调支持即将推出)。
  • 教育
    • 探索流派、乐器和历史:自然语言提示使用户能够快速了解并尝试音乐概念。

超出范围的使用

关于我们认为超出范围的使用,请参见上文的使用条款(https://huggingface.co/google/magenta-realtime-2#terms-of-use)。

偏见、风险与局限性

Magenta RT 2 支持器乐音乐的实时生成和引导。此功能的目的和意图是促进新的实时交互式协同创作工作流的发展,这些工作流能无缝融入以人为中心的音乐创造力。

每个 AI 音乐生成模型,包括 Magenta RT 2,都存在影响音乐经济和文化格局的风险。我们旨在通过以下途径减轻这些风险:

  • 优先考虑人机交互作为 Magenta RT 2 设计的基础。
  • 根据服务条款分发模型,禁止开发者生成侵犯或违反他人权利(包括受版权保护的内容的权利)的输出。
  • 主要使用器乐数据进行训练。在特定提示下,该模型已被观察到可以生成一些人声和效果,但这些声音和效果通常是非词汇性的。

已知局限性

Magenta RealTime 2 在流派覆盖范围和非词汇性发声方面与 Magenta RealTime 有类似局限性,详情请参考此处(https://huggingface.co/google/magenta-realtime#known-limitations)。

优势

在发布时,Magenta RealTime 2 是唯一支持实时、连续音乐音频生成且具有低延迟控制(约 200ms)的开放权重模型。它专为支持实时的交互式音乐创作而设计,为音乐表演、艺术装置、视频游戏以及许多其他应用带来了新的能力。

如何开始使用模型

请参阅我们的快速入门页面(https://magenta.withgoogle.com/magenta-realtime-2)和 GitHub 仓库(https://github.com/magenta/magenta-realtime)获取使用示例。

训练详情

训练数据

Magenta RealTime 2 使用来自多个来源的约 71k 小时的库存音乐进行训练,主要为器乐。

硬件

Magenta RealTime 2 使用张量处理单元(TPU)(https://cloud.google.com/tpu/docs/intro-to-tpu)硬件进行训练。

软件

训练使用 JAX(https://github.com/jax-ml/jax)和 Sequence Layers(https://github.com/google/sequence-layers)完成。JAX 允许研究人员利用最新一代硬件(包括 TPU)的优势,实现更快、更高效的大模型训练。

评估

模型评估指标和结果将在我们即将发布的技术报告中分享。

引用

关于 Magenta RealTime 2 的论文即将发布。目前,请引用我们之前的技术报告:

BibTeX:

@inproceedings{gdmlyria2025live, title={Live Music Models}, author={Caillon, Antoine and McWilliams, Brian and Tarakajian, Cassie and Simon, Ian and Manco, Ilaria and Engel, Jesse and Constant, Noah and Li, Pen and Denk, Timo I. and Lalama, Alberto and Agostinelli, Andrea and Huang, Anna and Manilow, Ethan and Brower, George and Erdogan, Hakan and Lei, Heidi and Rolnick, Itai and Grishchenko, Ivan and Orsini, Manu and Kastelic, Matej and Zuluaga, Mauricio and Verzetti, Mauro and Dooley, Michael and Skopek, Ondrej and Ferrer, Rafael and Borsos, Zal{\'a}n and van den Oord, {\"A}aron and Eck, Douglas and Collins, Eli and Baldridge, Jason and Hume, Tom and Donahue, Chris and Han, Kehang and Roberts, Adam}, booktitle={NeurIPS Creative AI}, year={2025} }

相似文章

在Arduino上使用Magenta Realtime 2实现无限音乐故障

Reddit r/LocalLLaMA

一位开发者使用ESP32微控制器、MacBook、用于实时音乐生成的Magenta Realtime 2、用于转录的MLX Whisper,以及用于工具调用的Qwen模型,构建了一个本地语音控制的音乐系统,实现了对音乐元素(如流派和乐器)的对话式控制。

Music AI Sandbox 推出新功能,访问权限扩大

Google DeepMind Blog

Google DeepMind 扩展了 Music AI Sandbox,新增功能包括 Lyria 2 音乐生成模型,并向美国音乐人开放更广泛的访问权限,通过用于生成、扩展和编辑音乐内容的工具来实现 AI 辅助音乐创作。

google/gemma-4-31B-it-assistant

Hugging Face Models Trending

Google DeepMind 发布了 Gemma 4,这是一个开源权重的多模态模型家族,支持文本、图像、视频和音频,具备增强的推理和编码能力,并通过多令牌预测(MTP)实现高达 2 倍的解码速度提升。

MuseNet

OpenAI Blog

OpenAI 发布了 MuseNet,一个基于 GPT-2 架构的深度神经网络,通过从数十万个 MIDI 文件中学习模式,能够生成 4 分钟的音乐作品,包含 10 种乐器。该模型可以结合多种音乐风格并以新颖的方式融合它们。