Libretto:赋予LLM代理音乐结构感知

Hugging Face Daily Papers 论文

摘要

Libretto提出了一种结构化框架,用于符号音乐生成与修改,采用LLM原生语法和经语料库校准的统计评估,涵盖多个音乐维度,使LLM代理能够将音乐视为可测量和可编辑的对象。

生成式音乐系统现在可以根据文本提示生成令人印象深刻的音频,但音频输出难以作为音乐结构进行查看、编辑和诊断。我们推出了Libretto,一个面向代理的框架,用于符号音乐生成与修改。Libretto使用LLM原生语法,具有显式的起始槽、声部和小节级组织,然后在一个经语料库校准的统计空间中评估每首乐曲,涵盖节奏、和声、旋律、织体、形式和变奏。相同的结构轴支持检索、诊断、复制风险控制和迭代自我修改。在缺口填充、参考引导的全曲生成、渐进变形和教育音乐生成等任务中,Libretto将符号音乐从原始令牌序列转变为语言模型代理可测量和可编辑的对象。
查看原文
查看缓存全文

缓存时间: 2026/06/23 17:43

论文页面 - Libretto:赋予LLM智能体音乐结构感

来源:https://huggingface.co/papers/2606.22708

摘要

Libretto 提供了一种结构化框架,用于基于 LLM 原生语法以及跨音乐维度的统计评估,进行符号音乐生成与修订。

生成式音乐系统如今能够从文本提示中生成令人印象深刻的声音,但音频输出难以检查、编辑以及诊断其音乐结构。我们提出 Libretto,一个面向智能体的符号音乐生成(https://huggingface.co/papers?q=symbolic%20music%20generation)与修订框架。Libretto 使用带有显式起始时隙(https://huggingface.co/papers?q=onset%20slots)、声部(https://huggingface.co/papers?q=voices)和小节级组织(https://huggingface.co/papers?q=bar-level%20organization)的 LLM 原生语法(https://huggingface.co/papers?q=LLM-native%20grammar),然后在经过语料库校准的统计空间(https://huggingface.co/papers?q=corpus-calibrated%20statistical%20space)中,对每首作品在节奏(https://huggingface.co/papers?q=rhythm)、和声(https://huggingface.co/papers?q=harmony)、旋律(https://huggingface.co/papers?q=melody)、织体(https://huggingface.co/papers?q=texture)、结构(https://huggingface.co/papers?q=form)和变奏(https://huggingface.co/papers?q=variation)方面进行评估。同样的结构维度支持检索(https://huggingface.co/papers?q=retrieval)、诊断、抄袭风险控制(https://huggingface.co/papers?q=copy-risk%20control)以及迭代式自我修订(https://huggingface.co/papers?q=iterative%20self-revision)。在空缺填充、参考引导全曲生成、渐进变形以及教育类音乐生成等任务中,Libretto 将符号音乐从原始的 token 序列转变为可供语言模型智能体测量和编辑的对象。

查看 arXiv 页面(https://arxiv.org/abs/2606.22708)查看 PDF(https://arxiv.org/pdf/2606.22708)项目页面(https://libretto.site/)GitHub(https://github.com/Xyc-arch/Libretto)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.22708)

在您的智能体中获取此论文:

hf papers read 2606\.22708

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.22708 以在此页面链接。

引用此论文的数据集0

没有数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.22708 以在此页面链接。

引用此论文的 Space0

没有 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.22708 以在此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

请将此论文添加到收藏集(https://huggingface.co/new-collection)以在此页面链接。

相似文章

基于LLM的多模态音乐推荐系统

Hugging Face Daily Papers

提出了一种多模态框架,融合音频、歌词和语义信号,并利用基于LLM的序列推理进行会话式音乐推荐,相较于仅使用ID的基线方法,召回率提升高达95%。

为LLM智能体设计的音频感知层,拥有随使用而增长的记忆

Reddit r/LocalLLaMA

一个实验性开源框架,使LLM智能体能够使用本地模型(CLAP、Whisper、Silero VAD)和不断增长的概念记忆来感知并识别非语音音频事件。该系统采用事件门控识别、指纹识别和基于符号的推理,目前尚无正式基准测试。