MERIT:学习解耦音乐表示以实现音频相似度

Hugging Face Daily Papers 论文

摘要

MERIT是一个框架,它通过条件音频生成和源分离音轨学习旋律、节奏和音色的解耦音乐表示,能够进行精细且特定因子的音频相似度查询。

当前的音乐相似度模型通常计算单一的总体分数,将旋律、节奏和音色等不同音乐维度纠缠在一起。这限制了用户的控制和可解释性,使得无法执行精细的查询。我们提出了MERIT,一个学习针对这三个核心维度定制的解耦、特定因子音乐表示的框架。为了克服真实音频中缺乏孤立音乐变化的问题,我们采用了一种新颖的训练策略,使用条件音频生成和源分离音轨来强烈鼓励训练数据中的单因子变化。我们的评估展示了强大的因子级解耦。每个头部对其预期的感知维度反应强烈,而对其他维度则接近随机水平,这一表示属性在合成训练域和独立真实音频中均成立。
查看原文
查看缓存全文

缓存时间: 2026/06/03 07:36

论文页面 - MERIT:学习解耦音乐表示以实现音频相似度

来源:https://huggingface.co/papers/2605.27346

摘要

MERIT 框架通过学习解耦的音乐表示(旋律、节奏和音色),结合条件音频生成和源分离音轨,实现精细化的音乐查询。

当前的音乐相似度模型(https://huggingface.co/papers?q=music%20similarity%20models)通常计算单一的总体分数,将旋律、节奏和音色等不同的音乐维度混为一谈。这限制了用户控制和可解释性,无法执行精细化的查询。我们提出 MERIT,一个学习解耦的、因子特定的音乐表示(https://huggingface.co/papers?q=factor-specific%20music%20representations)框架,专为这三个核心维度设计。为了克服真实音频中缺乏孤立音乐变化的问题,我们采用了一种新颖的训练策略,利用条件音频生成(https://huggingface.co/papers?q=conditional%20audio%20generation)和源分离音轨(https://huggingface.co/papers?q=source-separated%20stems)来强烈鼓励训练数据中的单因子变化。我们的评估展示了强大的因子级解耦能力。每个头部对其目标感知维度响应强烈,而对其他维度则几乎保持随机水平,这种表示属性在合成训练领域和独立的真实音频中均成立。

查看 arXiv 页面(https://arxiv.org/abs/2605.27346)查看 PDF(https://arxiv.org/pdf/2605.27346)项目页面(https://github.com/AMAAI-Lab/MERIT)GitHub20(https://github.com/AMAAI-Lab/MERIT)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.27346)

在您的 agent 中获取此论文:

hf papers read 2605\.27346

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

amaai-lab/merit 特征提取• 更新于约3小时前 • 1(https://huggingface.co/amaai-lab/merit)

引用此论文的数据集1

amaai-lab/merit 预览• 更新于约3小时前 • 95 • 3(https://huggingface.co/datasets/amaai-lab/merit)

引用此论文的 Space0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.27346 以从此页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接它。

相似文章

基于LLM的多模态音乐推荐系统

Hugging Face Daily Papers

提出了一种多模态框架,融合音频、歌词和语义信号,并利用基于LLM的序列推理进行会话式音乐推荐,相较于仅使用ID的基线方法,召回率提升高达95%。

基于音频嵌入的味觉感知音乐检索

Hugging Face Daily Papers

本文介绍了一个从音频嵌入预测味觉品质(如甜、苦等)的基准测试。它评估了10个预训练的音频编码器,实现了0.134的均方根误差,超越了先前的最优水平,并实现了基于味觉的音乐检索。

AudioMosaic:对比掩码音频表示学习

arXiv cs.LG

AudioMosaic 提出了一种基于对比学习的音频编码器,通过对频谱图块应用结构化时频掩码来构建正样本对,实现高效的大批量训练,在音频基准测试中达到最先进性能,并提升了音频-语言模型的效果。

MER-R1: 通过慢速-快速思维协同的多模态情感推理

arXiv cs.AI

本文介绍了MER-R1,一个通过协同快速和慢速思维进行多模态情感识别的强化学习框架。它通过双目标解耦和慢速-快速置信度校准,联合优化召回率和精确率,从而实现了最先进的性能。