基于LLM的多模态音乐推荐系统

Hugging Face Daily Papers 论文

摘要

提出了一种多模态框架,融合音频、歌词和语义信号,并利用基于LLM的序列推理进行会话式音乐推荐,相较于仅使用ID的基线方法,召回率提升高达95%。

音乐推荐系统通常将歌曲视为不透明标识,依赖协同交互历史,而忽略了语义或声学内容。先前的工作探索了基于LLM增强、多模态和文本增强的序列推荐方法。尽管某些方法部分结合了语义、声学或参与度信号,但没有一种方法能在统一的基于LLM的序列推理框架中联合建模所有三种信号,并将推荐基于实际的歌曲内容。在这项工作中,我们提出了一种面向会话式音乐推荐的多模态框架,通过三种互补信号丰富了LastFM-1K数据集:(1) 使用预训练的音乐和文本表示模型提取的音频和歌词嵌入;(2) 使用MGPHot注释模式生成的LLM语义元数据;(3) 收听完成率。我们采用E4SRec框架,通过扩展多模态特征和不同的项目ID编码器骨干网络(包括SASRec、BERT4Rec和GRU4Rec)进行改进。我们还进一步扩展了LLM骨干网络选项,包括LLaMa-2-13B、Qwen2.5-7B-Instruct和LLaMa-3-70B,涵盖零样本和微调设置。实验表明,整合基于内容的特征相较于仅使用ID的基线方法,在召回率上提升高达95%,在NDCG上提升高达79%。此外,我们的实验表明,朴素的多模态融合并不总能带来叠加的改进,凸显了跨模态集成的挑战。我们发布了一个大规模多模态音乐推荐基准数据集。
查看原文
查看缓存全文

缓存时间: 2026/06/05 10:07

论文页面 - 基于LLM的多模态音乐推荐系统

来源:https://huggingface.co/papers/2606.00125

摘要

一个面向会话式音乐推荐的多模态框架,整合了音频、歌词与语义信号,并结合基于LLM的序列推理能力,从而提升推荐准确度。

传统音乐推荐系统通常将歌曲视为不透明的标识符,依赖协同过滤交互历史,忽略了语义或声学内容。已有研究探索了LLM增强、多模态及文本增强的序列推荐方法,但现有方法仅部分结合了语义、声学或参与度信号,尚未有一种方法能在统一的基于LLM的序列推理框架中同时建模这三种信号,并将推荐真正锚定在歌曲内容上。本研究提出一个面向会话式音乐推荐的多模态框架(https://huggingface.co/papers?q=multimodal%20framework),对LastFM-1K数据集(https://huggingface.co/papers?q=LastFM-1K%20dataset)扩充了三种互补信号:(1)利用预训练音乐与文本表示模型(https://huggingface.co/papers?q=text%20representation%20models)提取的音频与歌词嵌入(https://huggingface.co/papers?q=lyric%20embeddings);(2)基于MGPHot标注模式(https://huggingface.co/papers?q=MGPHot%20annotation%20schema)生成的LLM语义元数据(https://huggingface.co/papers?q=LLM-generated%20semantic%20metadata);(3)收听完成率(https://huggingface.co/papers?q=listening%20completion%20ratios)。我们采用E4SRec框架(https://huggingface.co/papers?q=E4SRec%20framework),通过扩展多模态特征及不同项目ID编码骨干网络(https://huggingface.co/papers?q=item%20ID%20encoder%20backbones)——包括SASRec(https://huggingface.co/papers?q=SASRec)、BERT4Rec(https://huggingface.co/papers?q=BERT4Rec)和GRU4Rec(https://huggingface.co/papers?q=GRU4Rec)——来增强模型。我们还进一步扩展了LLM骨干选项,引入LLaMa-2-13B(https://huggingface.co/papers?q=LLaMa-2-13B)、Qwen2.5-7B-Instruct(https://huggingface.co/papers?q=Qwen2.5-7B-Instruct)和LLaMa-3-70B(https://huggingface.co/papers?q=LLaMa-3-70B),并在零样本与微调设置(https://huggingface.co/papers?q=fine-tuned%20settings)下进行实验。实验表明,融合基于内容的特征相比仅使用ID的基线模型,在召回率(https://huggingface.co/papers?q=Recall)上最高提升95%,在归一化折损累计增益(NDCG)(https://huggingface.co/papers?q=NDCG)上最高提升79%。此外,我们的实验显示,朴素的多模态融合(https://huggingface.co/papers?q=naive%20multimodal%20fusion)并不总能带来叠加式改进,凸显了跨模态集成(https://huggingface.co/papers?q=cross-modal%20integration)的挑战。我们发布了一个大规模多模态音乐推荐基准数据集。

查看arXiv页面(https://arxiv.org/abs/2606.00125)
查看PDF(https://arxiv.org/pdf/2606.00125)
项目页面(https://zenodo.org/records/20431748)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.00125)

在你的智能体中获取此论文:

hf papers read 2606.00125

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

暂无模型链接此论文

在模型README.md中引用arxiv.org/abs/2606.00125,即可从此页面建立链接。

引用该论文的数据集0

暂无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2606.00125,即可从此页面建立链接。

引用该论文的Spaces0

暂无Space链接此论文

在Space README.md中引用arxiv.org/abs/2606.00125,即可从此页面建立链接。

包含该论文的收藏集0

暂无收藏集包含此论文

将此论文添加到一个收藏集(https://huggingface.co/new-collection)中,即可从此页面建立链接。

相似文章

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。

面向多模态情感分析的语义对齐结构抽象

arXiv cs.CL

本文提出了SentiLLM,一个利用语义对齐结构抽象将非语言模态提炼为类文本标记的框架,用于基于大语言模型的多模态情感分析。它引入了一种双流显著性-上下文校准机制,并在四个数据集上取得了优越的性能。

偏见交响曲:探索多模态大语言模型中乐器与性别关联

arXiv cs.CL

本文介绍了Symphony-Bias,一个用于评估大语言模型在文本、视觉和音频模态下乐器与性别关联偏见的多模态数据集。研究发现,92%的乐器层面结果与先前社会科学研究一致,其中文本模态的性别偏见最强,音频最弱。