Libretto:赋予LLM代理音乐结构感知
摘要
Libretto提出了一种结构化框架,用于符号音乐生成与修改,采用LLM原生语法和经语料库校准的统计评估,涵盖多个音乐维度,使LLM代理能够将音乐视为可测量和可编辑的对象。
查看缓存全文
缓存时间: 2026/06/23 17:43
论文页面 - Libretto:赋予LLM智能体音乐结构感
来源:https://huggingface.co/papers/2606.22708
摘要
Libretto 提供了一种结构化框架,用于基于 LLM 原生语法以及跨音乐维度的统计评估,进行符号音乐生成与修订。
生成式音乐系统如今能够从文本提示中生成令人印象深刻的声音,但音频输出难以检查、编辑以及诊断其音乐结构。我们提出 Libretto,一个面向智能体的符号音乐生成(https://huggingface.co/papers?q=symbolic%20music%20generation)与修订框架。Libretto 使用带有显式起始时隙(https://huggingface.co/papers?q=onset%20slots)、声部(https://huggingface.co/papers?q=voices)和小节级组织(https://huggingface.co/papers?q=bar-level%20organization)的 LLM 原生语法(https://huggingface.co/papers?q=LLM-native%20grammar),然后在经过语料库校准的统计空间(https://huggingface.co/papers?q=corpus-calibrated%20statistical%20space)中,对每首作品在节奏(https://huggingface.co/papers?q=rhythm)、和声(https://huggingface.co/papers?q=harmony)、旋律(https://huggingface.co/papers?q=melody)、织体(https://huggingface.co/papers?q=texture)、结构(https://huggingface.co/papers?q=form)和变奏(https://huggingface.co/papers?q=variation)方面进行评估。同样的结构维度支持检索(https://huggingface.co/papers?q=retrieval)、诊断、抄袭风险控制(https://huggingface.co/papers?q=copy-risk%20control)以及迭代式自我修订(https://huggingface.co/papers?q=iterative%20self-revision)。在空缺填充、参考引导全曲生成、渐进变形以及教育类音乐生成等任务中,Libretto 将符号音乐从原始的 token 序列转变为可供语言模型智能体测量和编辑的对象。
查看 arXiv 页面(https://arxiv.org/abs/2606.22708)查看 PDF(https://arxiv.org/pdf/2606.22708)项目页面(https://libretto.site/)GitHub(https://github.com/Xyc-arch/Libretto)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.22708)
在您的智能体中获取此论文:
hf papers read 2606\.22708
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.22708 以在此页面链接。
引用此论文的数据集0
没有数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.22708 以在此页面链接。
引用此论文的 Space0
没有 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.22708 以在此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到收藏集(https://huggingface.co/new-collection)以在此页面链接。
相似文章
基于LLM的多模态音乐推荐系统
提出了一种多模态框架,融合音频、歌词和语义信号,并利用基于LLM的序列推理进行会话式音乐推荐,相较于仅使用ID的基线方法,召回率提升高达95%。
我向6个前沿LLM提供了相同的巴赫MusicXML文件和提示。结果都是一次生成的,未经编辑
一位用户测试了六个前沿LLM,从巴赫MusicXML文件在一次生成中生成音乐,并展示了未经编辑的结果。
为LLM智能体设计的音频感知层,拥有随使用而增长的记忆
一个实验性开源框架,使LLM智能体能够使用本地模型(CLAP、Whisper、Silero VAD)和不断增长的概念记忆来感知并识别非语音音频事件。该系统采用事件门控识别、指纹识别和基于符号的推理,目前尚无正式基准测试。
指令调优大语言模型中的构成性文学原语:自我、风格与情感的跨架构SAE特征
本文通过稀疏自编码器刻画了指令调优大语言模型中的构成性文学原语,发现了自我、风格与情感的特征类别,这些特征能够在两种架构间实现情感引导。
FunAudioLLM:面向人类与LLM自然交互的语音理解与生成基础模型
介绍FunAudioLLM,这是一个模型系列,结合了用于多语言ASR、情感检测和音频事件检测的SenseVoice,以及用于自然语音生成的CosyVoice,通过开源模型和代码实现与LLM增强的语音交互。