MERIT:学习解耦音乐表示以实现音频相似度
摘要
MERIT是一个框架,它通过条件音频生成和源分离音轨学习旋律、节奏和音色的解耦音乐表示,能够进行精细且特定因子的音频相似度查询。
查看缓存全文
缓存时间: 2026/06/03 07:36
论文页面 - MERIT:学习解耦音乐表示以实现音频相似度
来源:https://huggingface.co/papers/2605.27346
摘要
MERIT 框架通过学习解耦的音乐表示(旋律、节奏和音色),结合条件音频生成和源分离音轨,实现精细化的音乐查询。
当前的音乐相似度模型(https://huggingface.co/papers?q=music%20similarity%20models)通常计算单一的总体分数,将旋律、节奏和音色等不同的音乐维度混为一谈。这限制了用户控制和可解释性,无法执行精细化的查询。我们提出 MERIT,一个学习解耦的、因子特定的音乐表示(https://huggingface.co/papers?q=factor-specific%20music%20representations)框架,专为这三个核心维度设计。为了克服真实音频中缺乏孤立音乐变化的问题,我们采用了一种新颖的训练策略,利用条件音频生成(https://huggingface.co/papers?q=conditional%20audio%20generation)和源分离音轨(https://huggingface.co/papers?q=source-separated%20stems)来强烈鼓励训练数据中的单因子变化。我们的评估展示了强大的因子级解耦能力。每个头部对其目标感知维度响应强烈,而对其他维度则几乎保持随机水平,这种表示属性在合成训练领域和独立的真实音频中均成立。
查看 arXiv 页面(https://arxiv.org/abs/2605.27346)查看 PDF(https://arxiv.org/pdf/2605.27346)项目页面(https://github.com/AMAAI-Lab/MERIT)GitHub20(https://github.com/AMAAI-Lab/MERIT)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.27346)
在您的 agent 中获取此论文:
hf papers read 2605\.27346
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
amaai-lab/merit 特征提取• 更新于约3小时前 • 1(https://huggingface.co/amaai-lab/merit)
引用此论文的数据集1
amaai-lab/merit 预览• 更新于约3小时前 • 95 • 3(https://huggingface.co/datasets/amaai-lab/merit)
引用此论文的 Space0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.27346 以从此页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接它。
相似文章
基于LLM的多模态音乐推荐系统
提出了一种多模态框架,融合音频、歌词和语义信号,并利用基于LLM的序列推理进行会话式音乐推荐,相较于仅使用ID的基线方法,召回率提升高达95%。
TuneJury: 一个用于改进音乐生成偏好对齐的开放度量
TuneJury 是一个开源的成对奖励模型,用于文本到音乐生成,提供校准的偏好评分,并泛化到多个下游应用。
基于音频嵌入的味觉感知音乐检索
本文介绍了一个从音频嵌入预测味觉品质(如甜、苦等)的基准测试。它评估了10个预训练的音频编码器,实现了0.134的均方根误差,超越了先前的最优水平,并实现了基于味觉的音乐检索。
AudioMosaic:对比掩码音频表示学习
AudioMosaic 提出了一种基于对比学习的音频编码器,通过对频谱图块应用结构化时频掩码来构建正样本对,实现高效的大批量训练,在音频基准测试中达到最先进性能,并提升了音频-语言模型的效果。
MER-R1: 通过慢速-快速思维协同的多模态情感推理
本文介绍了MER-R1,一个通过协同快速和慢速思维进行多模态情感识别的强化学习框架。它通过双目标解耦和慢速-快速置信度校准,联合优化召回率和精确率,从而实现了最先进的性能。