MusiChat:音乐创作的氛围式创作

arXiv cs.AI 论文

摘要

MusiChat 提出了一种用于人机音乐协作创作的对话系统,通过自然语言交互实现迭代优化,在多轮编辑中达到了高准确率。

arXiv:2607.24873v1 公告类型:新 摘要:近期人工智能音乐生成的进展使得用户能够通过自然语言提示创作完整的音乐作品。然而,大多数现有系统遵循“提示-重新生成”的范式,使得迭代优化变得困难,因为用户必须反复重建创作,而非直接演化已有的音乐概念。我们提出了 MusiChat,一个对话式氛围创作系统,通过自然语言交互和迭代优化实现人机协作音乐创作。MusiChat 的核心是一个分层可控的音乐生成框架,它将歌词对齐的音乐结构生成与表现性表面实现分离,从而支持灵活的样式转换和结构保持性编辑。该系统通过内存增强架构将大语言模型与混合符号音乐引擎集成在一起,该架构在交互过程中维护活跃的创作状态和用户历史。一种混合意图路由机制进一步支持对精确音乐编辑和开放式创作请求的高效解读。与从头重新生成创作不同,MusiChat 在保留相关音乐结构和用户意图的同时,增量式地转化不断演化的音乐作品。我们通过客观分析和人类研究对 MusiChat 进行了评估,在单轮和多轮交互中分别达到了 95.31% 和 100% 的准确率,在旋律自然度方面获得了 2:1 的喜爱与不喜爱比率,在音乐质量方面获得了 3:1 的比率。我们的结果表明,MusiChat 通过对话界面支持连贯的多轮音乐创作和人机交互式协作创作。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:52

# MusiChat:用于音乐创作的氛围式编排

来源:https://arxiv.org/html/2607.24873
Callie C. Liao∗  斯坦福大学 加利福尼亚州斯坦福 [email protected] &Duoduo Liao∗  乔治梅森大学 弗吉尼亚州费尔法克斯 [email protected] &Ellie L. Zhang IntelliSky 弗吉尼亚州麦克莱恩 [email protected]

###### 摘要

近期人工智能音乐生成的进展使用户能够通过自然语言提示创建完整的音乐作品。然而,大多数现有系统遵循“提示并重新生成”的范式,使得迭代修改变得困难,因为用户必须反复重新创作,而不是直接演变现有的音乐创意。我们提出 MusiChat,一个对话式氛围编排系统,通过自然语言交互和迭代修改实现人机协作的音乐创作。MusiChat 的核心是一个分层可控的音乐生成框架,它将歌词对齐的音乐结构生成与表现性表层实现解耦,允许灵活的风格转换和保持结构不变的编辑。该系统通过记忆增强架构集成大语言模型与混合符号音乐引擎,该架构在交互过程中维持活跃的创作状态和用户历史记录。一种混合意图路由机制进一步实现了对精确音乐编辑和开放式创意请求的高效解读。MusiChat 不是从头重新生成作品,而是增量式地演变成熟的音乐制品,同时保留相关的音乐结构和用户意图。我们通过客观分析和人类研究评估 MusiChat,在单轮和多轮交互中分别实现了 95.31% 和 100% 的准确率,旋律自然度与音乐质量的喜欢与不喜欢比率分别为 2:1 和 3:1。我们的结果表明,MusiChat 通过对话式界面支持连贯的多轮音乐创作和交互式人机协作创作。

MusiChat:用于音乐创作的氛围式编排

Callie C. Liao∗  斯坦福大学 加利福尼亚州斯坦福 [email protected] Duoduo Liao∗  乔治梅森大学 弗吉尼亚州费尔法克斯 [email protected] Ellie L. Zhang IntelliSky 弗吉尼亚州麦克莱恩 [email protected]

**脚注:* 同等贡献。11 脚注:MusiChat:演示视频 (https://www.intellisky.org/share/musichat_demo.mp4) 和基于 AWS 的网络工具 (https://musichat.intellisky.ai/)。

## 1 引言

参考图注 图 1:MusiChat 工作区。左侧:雕刻乐谱、MIDI 播放器(乐器 + 和弦控制)和钢琴卷帘。右侧:对话和风格选择器。
参考图注 图 2:用于音乐协作创作的氛围式编排的 MusiChat 框架。多模态输入首先通过基于 LLM 的推理被抽象为显式的歌词表示。歌词作为一种持久的中间推理表示,指导混合符号音乐生成。对话式接口通过直接操作这些表示来实现迭代修改,将聊天转变为一个交互式推理环境。

随着现有知名音乐生成模型如 SunoSuno (2026 (https://arxiv.org/html/2607.24873#bib.bib125))、Google 的 LyriaCaillon 等人 (2025 (https://arxiv.org/html/2607.24873#bib.bib126))、Stable Audio 3.0Evans 等人 (2026 (https://arxiv.org/html/2607.24873#bib.bib127)) 和 MusicGenCopet 等人 (2024 (https://arxiv.org/html/2607.24873#bib.bib128)) 的普及,音乐生成现在只需一个文本、图像或音频提示即可完成,这使得几乎没有音乐经验的创作者也能进行音乐创作。一些模型还提供了多种功能来编辑和优化生成的音乐,包括允许艺术家在产品内手动编辑音乐、在音乐生成时调整参数,以及通过歌词编辑或常规重新生成来重新生成歌曲的选定片段。

虽然它们可能提供片段重新生成、音乐生成过程中的风格变化以及手动编辑,但希望仅重新生成音乐特征(如旋律或乐器部分)的一部分同时保持原曲音乐连续性的需求仍未得到满足,因为用户通常会对该部分得到截然不同的重新生成结果。要求音乐生成模型修改歌曲的一部分,类似于要求最先进的大语言模型(LLM)如 ChatGPT 和 Claude 只修改文章中的一段而保持其他段落不变——轮内修改目前是不可能的,因为它们仅提供一次性生成 (Huang 等人, 2018 (https://arxiv.org/html/2607.24873#bib.bib13); Payne, 2019 (https://arxiv.org/html/2607.24873#bib.bib123); Dhariwal 等人, 2020 (https://arxiv.org/html/2607.24873#bib.bib12); Yu 等人, 2025 (https://arxiv.org/html/2607.24873#bib.bib7)),其中语义内容、结构和表层实现在不透明的表示中纠缠在一起,限制了可解释性、可控性和协作使用 (Agostinelli 等人, 2023 (https://arxiv.org/html/2607.24873#bib.bib23); Wu 等人, 2023 (https://arxiv.org/html/2607.24873#bib.bib8); Zhou 等人, 2024 (https://arxiv.org/html/2607.24873#bib.bib18))。像 MelodyGLM (Wu 等人, 2023 (https://arxiv.org/html/2607.24873#bib.bib8)) 和 MeloTrans (Wang 等人, 2024 (https://arxiv.org/html/2607.24873#bib.bib6)) 这样的符号模型提供了更高的透明度,但使用单次流水线,而 SongComposer (Ding 等人, 2025 (https://arxiv.org/html/2607.24873#bib.bib19)) 推进了歌词感知的生成,但所有这些模型仍然主要是数据驱动的端到端模型。

对这种端到端方法的一些替代方案是要求完全重新生成整首歌曲,但指定对歌曲的一部分进行微小更改;然而,这很可能导致生成与原曲几乎没有相似性的歌曲,并且由于侧重于表达高层意图,许多当前的音乐生成模型无论如何都无法精确定位到需要做轻微修改的区域。

在这样的限制下,艺术家要么只能通过多次多轮重新生成(使用对话作为媒介)(Zhao 等人, 2025 (https://arxiv.org/html/2607.24873#bib.bib11); Laban 等人, 2025 (https://arxiv.org/html/2607.24873#bib.bib2); Zhang 等人, 2024 (https://arxiv.org/html/2607.24873#bib.bib10); Yi 等人, 2025 (https://arxiv.org/html/2607.24873#bib.bib1)) 直到得到一个相对连贯、令人满意的结果,要么自己在其他软件中编辑音乐。前者没有解决直接问题,后者需要更高的音乐制作经验,从而限制了许多有抱负的音乐家。

因此,我们提出 MusiChat,一个氛围式编排的符号自然语言到音乐生成工具,它能够进行可靠的旋律、节奏和歌词的轮内修改,同时保留歌曲的所有其他部分,生成音乐连贯、意图感知的片段,并保持音乐结构。类似于“氛围式编程”111https://x.com/karpathy/status/1886192184808149383 的概念(一个人可以通过与 LLM 对话而不是直接编写代码来构建软件),我们引入了用于音乐的“氛围式编排”术语,即任何对音乐的旋律、节奏和歌词的修改,无论范围大小,都可以纯粹使用自然语言完成。与当前的音乐生成方法相反,我们结合了混合符号音乐生成模型来生成所需的音乐。通过特别包含确定性设计,轮内修改变得可行。

在我们的演示中,用户不仅能够对作者和标题等特征进行基本修改,还能通过用自然语言表达的特定重新生成请求对选定的小节和歌词片段进行修改。除了列出的功能外,用户还可以在保持歌曲骨架的同时更改歌曲风格,从而也允许一般性的修改。通过 MusiChat,用户无需丰富的音乐经验即可进行音乐、节奏和歌词方面的提示、创作和修改,超越了现有音乐生成模型在精确音乐和节奏修改请求上的先前限制。

我们的贡献是多方面的:

- •*MusiChat:一个对话式氛围编排系统*,一个基于 LLM 的系统,展示了对话式 AI 如何通过连续对话和迭代修改促进人机协作的音乐创作。
- •*一个分层可控的音乐生成框架*,通过将歌词对齐的音乐结构生成与表现性表层实现解耦,为氛围式编排奠定基础,支持灵活的、保持结构不变的音乐变换。
- •*一个全面的系统评估*,通过客观分析和人类研究评估交互、音乐结构、表现变化和感知质量。

我们通过代表性的作曲场景展示 MusiChat,展示对话式交互、持久记忆和增量编辑如何支持与 AI 辅助音乐生成进行氛围式编排的自然迭代工作流。

## 2 系统架构

### 2.1 系统概述

MusiChat 是一个双面板的基于网络的工作区 (图 1 (https://arxiv.org/html/2607.24873#S1.F1)),专为通过对话式音乐创作和迭代修改进行氛围式编排而设计。左侧面板通过雕刻乐谱、带有乐器和和弦控制的 MIDI 播放器以及可折叠的钢琴卷帘展示生成的作曲,用于检查音乐结构。右侧面板提供对话式界面,用于通过自然语言请求创建、修改和完善作品,探索音乐创意,以及应用风格转换。最右侧的一组按钮提供对附加功能的访问,包括登录、创作历史、输入示例和其他用于管理和重新审视创意工作的实用工具。

图 2 (https://arxiv.org/html/2607.24873#S1.F2) 展示了端到端的系统架构。用户请求通过接口发送到无服务器后端,该后端执行意图路由,调用基础模型执行歌词生成等任务,并调用进程内的神经符号混合音乐引擎进行作曲生成和变换。生成的 MusicXML 和 MIDI 制品随后被交付给客户端,用于乐谱渲染和音频播放。

系统维持两种互补的状态形式来支持迭代式氛围式编排。*短期创作状态*捕获跨对话轮次的当前作品,而*持久创作历史*将先前的作品、提示和用户评分存储在文档数据库中供认证用户使用,使用户能够重新访问并继续先前的创意探索。

参考图注 图 3:*左:*每个实现器的平均意见分数(MOS)及95%置信区间(CI)。*右:*每对参与者平均意见分数(MOS)差异的百分位自助法95%置信区间。

### 2.2 自然语言交互

对话循环构成了氛围式编排的核心交互范式。用户通过自然语言指令或图像输入创建和修改作品,这些指令和输入被解释并映射到结构化的音乐操作。请求被分类为生成、参数修改(例如,调号、速度和拍号)、符号编辑(例如,标题或音高变化)、风格转换、音乐分析或一般性对话。这种意图驱动的工作流实现了迭代修改,同时保持用户对作品结构和表现方面的控制。

##### 混合意图路由。

MusiChat 采用一种混合意图路由架构,结合了确定性规则和基于 LLM 的推理。轻量级的*确定性检测器*使用正则表达式和关键词匹配处理频繁、明确的编辑(例如,“改为 C 大调”或“加快速度”),无需调用 LLM。对于开放式或模糊的请求,基于 LLM 的*路由器*对意图进行分类,并将任务委派给相应的代理,包括音乐生成、调号、拍号、速度、分析或一般性对话。这种混合设计降低了结构化编辑的延迟和成本,同时保持了自然语言氛围式编排所需的灵活性。

##### 多模态歌词生成。

系统支持多模态歌词生成,允许用户从文本或视觉输入开始创作。当提供文本时,LLM 生成简短的歌词,作为音乐生成的语义基础。当用户提供*图像*时,多模态模型解释视觉内容并生成受图像启发的歌词,支持将照片等视觉体验转化为音乐作品。生成的歌词在章节、乐句、单词和音节级别与生成的旋律层次对齐,为后续的歌词感知创作和编辑提供基础。

##### 持久的创作状态。

编辑操作作用于*当前*作品,而不是作为独立的生成请求。后端维护正在进行的工作歌曲状态,而客户端重新发送相关的上下文,包括之前的提示、作品元数据和待处理的建议。这种设计确保在无状态无服务器执行的情况下仍能进行迭代修改,允许每个对话轮次转换同一个音乐制品。“重新生成”请求从初始生成过程重建作品,而原地编辑则更新现有作品并替换当前作品卡片,而不是创建新版本。

### 2.3 混合符号音乐引擎

音乐生成由一个自包含的 Python 引擎执行,该引擎集成在后端中,不依赖外部模型服务器。引擎采用*分层表示*,构成了氛围式编排的基础。它首先从输入的歌词中导出一个稳定的*音乐骨架*,然后应用可插拔的*表层实现器*以生成特定风格的音乐实现,同时保持底层骨架不变。

##### 歌词到音乐骨架生成。

歌词为旋律生成提供了语义和韵律基础。引擎分析语言*重音*模式以推断出合适的拍号,并将歌词层次性地分割为章节、乐句、单词和音节 (Liao 等人, 2023 (https://arxiv.org/html/2607.24873#bib.bib129))。旋律音符被分配给音节,在乐句边界处插入休止符以加强音乐结构。音高选择遵循一个缓冲区约束、主要呈级进方式跨越小节,并在乐句转换处进行平滑处理以促进旋律的连续性。由此产生的旋律、节奏、乐句结构和歌词对齐构成了贯穿后续编辑操作的作曲骨干 (Liao 等人, 2024 (https://arxiv.org/html/2607.24873#bib.bib75), 2025 (https://arxiv.org/html/2607.24873#bib.bib65), 2022 (https://arxiv.org/html/2607.24873#bib.bib130))。

##### 表层实现(三个实现器)。

一个生成后的样式子系统通过固定的节奏、和声、旋律、力度和乐句变换流水线,将中性的作曲框架转换为特定风格的演绎。该子系统由八种流派(*古典、流行、爵士、摇滚、华尔兹、低保真、电影配乐*和*节奏布鲁斯*)的规格参数化,将风格实现与底层骨架解耦,支持灵活的氛围式编排。

相似文章

Composer

Product Hunt

Composer 是一个多人在线 Markdown 编辑器,专为团队协作和 AI 代理设计。

HumToBeats

Product Hunt

HumToBeats 将哼唱转化为AI生成的节拍,使用户能够通过简单的语音输入创作音乐。

VibeAround

Product Hunt

VibeAround 是一款本地 AI 编程助手,用户可通过任意即时通讯应用或网页浏览器与之对话。

Spotify扩展其AI布局,推出类似ChatGPT的音乐助手

TechCrunch AI

Spotify为Premium用户推出了一项测试版功能,允许用户与应用进行互动对话来选择音乐,该功能结合了其自身的AI和多个提供商的语言模型,初期将在美国、爱尔兰和瑞典上线。