基于LLM的多模态音乐推荐系统
摘要
提出了一种多模态框架,融合音频、歌词和语义信号,并利用基于LLM的序列推理进行会话式音乐推荐,相较于仅使用ID的基线方法,召回率提升高达95%。
查看缓存全文
缓存时间: 2026/06/05 10:07
论文页面 - 基于LLM的多模态音乐推荐系统
来源:https://huggingface.co/papers/2606.00125
摘要
一个面向会话式音乐推荐的多模态框架,整合了音频、歌词与语义信号,并结合基于LLM的序列推理能力,从而提升推荐准确度。
传统音乐推荐系统通常将歌曲视为不透明的标识符,依赖协同过滤交互历史,忽略了语义或声学内容。已有研究探索了LLM增强、多模态及文本增强的序列推荐方法,但现有方法仅部分结合了语义、声学或参与度信号,尚未有一种方法能在统一的基于LLM的序列推理框架中同时建模这三种信号,并将推荐真正锚定在歌曲内容上。本研究提出一个面向会话式音乐推荐的多模态框架(https://huggingface.co/papers?q=multimodal%20framework),对LastFM-1K数据集(https://huggingface.co/papers?q=LastFM-1K%20dataset)扩充了三种互补信号:(1)利用预训练音乐与文本表示模型(https://huggingface.co/papers?q=text%20representation%20models)提取的音频与歌词嵌入(https://huggingface.co/papers?q=lyric%20embeddings);(2)基于MGPHot标注模式(https://huggingface.co/papers?q=MGPHot%20annotation%20schema)生成的LLM语义元数据(https://huggingface.co/papers?q=LLM-generated%20semantic%20metadata);(3)收听完成率(https://huggingface.co/papers?q=listening%20completion%20ratios)。我们采用E4SRec框架(https://huggingface.co/papers?q=E4SRec%20framework),通过扩展多模态特征及不同项目ID编码骨干网络(https://huggingface.co/papers?q=item%20ID%20encoder%20backbones)——包括SASRec(https://huggingface.co/papers?q=SASRec)、BERT4Rec(https://huggingface.co/papers?q=BERT4Rec)和GRU4Rec(https://huggingface.co/papers?q=GRU4Rec)——来增强模型。我们还进一步扩展了LLM骨干选项,引入LLaMa-2-13B(https://huggingface.co/papers?q=LLaMa-2-13B)、Qwen2.5-7B-Instruct(https://huggingface.co/papers?q=Qwen2.5-7B-Instruct)和LLaMa-3-70B(https://huggingface.co/papers?q=LLaMa-3-70B),并在零样本与微调设置(https://huggingface.co/papers?q=fine-tuned%20settings)下进行实验。实验表明,融合基于内容的特征相比仅使用ID的基线模型,在召回率(https://huggingface.co/papers?q=Recall)上最高提升95%,在归一化折损累计增益(NDCG)(https://huggingface.co/papers?q=NDCG)上最高提升79%。此外,我们的实验显示,朴素的多模态融合(https://huggingface.co/papers?q=naive%20multimodal%20fusion)并不总能带来叠加式改进,凸显了跨模态集成(https://huggingface.co/papers?q=cross-modal%20integration)的挑战。我们发布了一个大规模多模态音乐推荐基准数据集。
查看arXiv页面(https://arxiv.org/abs/2606.00125)
查看PDF(https://arxiv.org/pdf/2606.00125)
项目页面(https://zenodo.org/records/20431748)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.00125)
在你的智能体中获取此论文:
hf papers read 2606.00125
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
暂无模型链接此论文
在模型README.md中引用arxiv.org/abs/2606.00125,即可从此页面建立链接。
引用该论文的数据集0
暂无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2606.00125,即可从此页面建立链接。
引用该论文的Spaces0
暂无Space链接此论文
在Space README.md中引用arxiv.org/abs/2606.00125,即可从此页面建立链接。
包含该论文的收藏集0
暂无收藏集包含此论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)中,即可从此页面建立链接。
相似文章
多视角证据合成与推理的无监督多模态实体链接
MSR-MEL 提出一种无监督框架,利用大语言模型对多视角证据进行合成与推理,实现多模态实体链接,在标准基准上全面超越既有方法。
基于人-大语言模型对齐的歌词标注混合框架
本文介绍了一种混合框架,用于歌词的句子级情感标注,通过预测不对齐来优化人与LLM的协作,解决了歌词情感识别中的主观性和可扩展性挑战。
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
面向多模态情感分析的语义对齐结构抽象
本文提出了SentiLLM,一个利用语义对齐结构抽象将非语言模态提炼为类文本标记的框架,用于基于大语言模型的多模态情感分析。它引入了一种双流显著性-上下文校准机制,并在四个数据集上取得了优越的性能。
偏见交响曲:探索多模态大语言模型中乐器与性别关联
本文介绍了Symphony-Bias,一个用于评估大语言模型在文本、视觉和音频模态下乐器与性别关联偏见的多模态数据集。研究发现,92%的乐器层面结果与先前社会科学研究一致,其中文本模态的性别偏见最强,音频最弱。