YuE2 · 基于符号化规划的前沿音乐生成

Hacker News Top 模型

摘要

YuE2 是一款采用符号化规划的新AI音乐生成模型,在 WildSongBench 等基准测试中表现优异,达到或超越了 Suno v5 等专有系统的性能。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/11 02:17

# YuE2 · 具有符号规划的前沿音乐生成系统 来源:https://map-yue2.github.io/ ## 从乐谱到歌曲 聆听一首歌曲,然后探索其符号规划中的旋律、节奏与和声。 已选乐谱 ## 正在加载所选歌曲... 符号乐谱 原始乐谱录音 **交互式ABC乐谱**红色音符跟随乐谱录音。 查看原始乐谱页面 所有已选乐谱 ## 翻唱与编辑 熟悉的歌曲可以呈现不同的形态。聆听旋律、歌词、速度与编曲的变化。 ### 智能音乐编辑 通过对话塑造歌曲。加载编辑故事... ## 风格探索器 聆听精选,汇集各种风格与语言的作品。 搜索 语言 风格 生成 ## 模型与结果 YuE2(八选最优版本)在SongBench上达到**6.9632分**,这是WildSongBench(192条提示词)中15个评估设置观察到的最高平均分。Suno v5在同一对比中得分为6.8721。 论文图1:WildSongBench上歌曲质量与文本对齐度的对比。YuE2与YuE2八选最优版本在性能上可与已评估的专有系统相媲美。气泡面积代表AudioBox制作质量。(https://map-yue2.github.io/static/figures/frontier-teaser.pdf)WildSongBench上的歌曲质量与文本对齐度。气泡面积显示AudioBox制作质量;黑色轮廓标出在两个绘制轴上的帕累托最优解。Bo8 = 八选最优。如何解读指标(https://map-yue2.github.io/#evaluation-protocol)。模型架构 ### 符号作曲,音频演绎。 矢量PDF (https://map-yue2.github.io/static/figures/yue2-overview.pdf) YuE2架构:一个自回归-非自回归混合Transformer模型,将可编辑的符号乐谱转化为语义标记、声学潜变量和完整歌曲音频。同一生成器支持创作、翻唱与编辑。(https://map-yue2.github.io/static/figures/yue2-overview.pdf)可编辑乐谱转化为语义音乐标记、声学潜变量和完整歌曲音频。该模型拥有约35.9亿参数和28层结构,支持创作、翻唱与编辑。自回归与非自回归专家共享注意力计算,同时使用独立的归一化、投影层和多层感知器。探索基准测试得分 WildSongBench · 15个设置 · 7项指标**WildSongBench** 192条提示词 对比维度 如何解读这些结果 **WildSongBench**。192条提示词和15个系统设置。表格报告自动评估分数。八选最优版本根据音乐性、提示词控制能力和歌词准确度从八个生成结果中选出最优。 **图1。**歌曲质量结合SongBench与SongEval;文本对齐度结合MuLan、AllMusicCaps和提示词控制能力。两个轴均为归一化的对比指标。气泡面积代表AudioBox制作质量。 MERT2 · 音乐表征模型 ### 学习声音背后的结构。 矢量PDF (https://map-yue2.github.io/static/figures/mert2-ssl.pdf) MERT2架构:离线目标合成将MuQ和Qwen2-Audio特征组合为四个码流。ConvNeXt前端和24层Conformer通过掩码预测进行学习,然后分支为供SheetSage2使用的全曲表征和供YuE2使用的因果分词器课程。(https://map-yue2.github.io/static/figures/mert2-ssl.pdf)MERT2为分析与生成提供音乐表征。ConvNeXt前端和24层Conformer学习预测基于互补的MuQ与Qwen2-Audio特征构建的掩码码。全曲适配为SheetSage2提供音乐上下文;独立的因果分支成为YuE2的25Hz语义分词器。#### 在MARBLE基准测试上达到先进水平 MERT2-30s和MERT2-FS(全曲)在15项MARBLE指标中的**14项达到最先进水平**,在标签分类、调性、风格和情感识别方面领先。 最先进指标 MERT2-30s与MERT2-FS 14/15项 风格准确率 · GTZAN MERT2-30s · 分数 × 100 91.72 调性精细准确率 · GiantSteps MERT2-FS · 分数 × 100 67.05 探索MERT2基准测试得分 MARBLE · 15项指标 · 2个编码器 最先进计数使用两个MERT2编码器中的最佳分数,与该对比中九个已发表基线进行比较。两个编码器均拥有6.32亿参数。MERT2-30s使用30秒训练上下文;MERT2-FS使用300秒。这些是全上下文表征基准测试。MERT2报告了通过测试分数选择的表征中观察到的最佳结果;每个ROC-AUC/AP对使用相同的表征。 SheetSage2 · 音频转乐谱 ### 聆听歌曲。阅读其乐谱。 矢量PDF (https://map-yue2.github.io/static/figures/sheetsage2-overview.pdf) SheetSage2架构:全曲MERT2-FS编码器配备可训练适配器,连接六层自回归解码器。任务提示选择节拍、段落、调性、和弦和旋律事件,它们共享时间线并转化为ABC记谱法和主旋律谱。(https://map-yue2.github.io/static/figures/sheetsage2-overview.pdf)SheetSage2将录音转化为可编辑的主旋律谱。全曲MERT2-FS编码器通过LoRA适配,连接六层自回归解码器。任务提示选择节拍、段落、调性、和弦和旋律;共享的事件时间线转化为包含人声与器乐旋律声部的ABC记谱法。这些乐谱为YuE2提供了符号化的训练目标。#### 单一模型,六项转录任务 SheetSage2使用单一模型,在13项基准测试指标中的**10项达到最先进水平**,涵盖节拍、重拍、调性、和弦、结构和旋律转录。 最先进指标 单一模型 · 六项转录任务 10/13 人声旋律 · RWC-Pop 音高类音符F1 · 分数 × 100 82.51 和弦识别 · osu2017 大/小调 · 分数 × 100 90.08 探索SheetSage2基准测试得分 6项任务 · 13项指标 最先进计数指与SheetSage1、Madmom和该对比中任务特定系统相比的领先分数。结果使用一个通过验证损失选择的模型。旋律F1衡量音高类音符;结构F1在指定容差范围内衡量段落边界。在Chords1217上,ChordFormer使用五折交叉验证,而SheetSage2在所有1217个曲目上评估一个固定模型。 ## 训练数据 我们的模型主要在CC0音乐和合成数据上进行训练。Tokenwave.AI (https://www.tokenwave.us/)根据许可协议提供了我们大部分合成训练数据。我们致力于合乎道德且负责任地使用数据。 MERT2 70万小时 SheetSage2 2.84万小时 YuE2 34.6万小时

相似文章

多模态艺术投影/YuE

GitHub Trending (daily)

YuE2 是一个 AI 模型,通过首先根据歌词和风格创建符号化乐谱,然后将其渲染成音频来生成歌曲,达到与 Suno 竞争的前沿质量。

新音乐生成模型YuE2-3B发布!

Reddit r/LocalLLaMA

YuE2-3B是一个开源的音乐生成模型,能够根据歌词和风格提示创作完整的歌曲,具有可编辑的乐谱功能,其性能达到业界领先水平,媲美Suno v5等商业模型。

Comfy-Org/YuE2

Hugging Face Models Trending

本文详细介绍了为ComfyUI重新打包的YuE2模型,支持音频和音乐生成工作流。它提供了基于MERT-v2-FullSong和SheetSage2的模型文件,便于集成到ComfyUI项目中。