Mental Damage:针对检索增强文本到音乐生成的描述投毒攻击
摘要
本文介绍了一种针对检索增强文本到音乐系统的双层描述投毒攻击,证明攻击者可以通过向知识数据库中注入恶意描述,在不修改用户提示或模型的情况下,将生成的音乐引导至攻击者选择的意图。
查看缓存全文
缓存时间: 2026/06/01 09:29
# 心理伤害:针对检索增强型文生音乐的标题投毒攻击 来源:https://arxiv.org/html/2605.30365 Yizhu Wen14, Shuhao Zhang24, Nan Zhang3, Long Cheng2, Hanqing Guo1 ###### 摘要 检索增强型文生音乐(TTM)系统通过从音乐标题数据集中检索到的标题来增强未充分指定的用户提示。这种设计引入了对音乐知识数据库的完整性依赖。我们表明,攻击者可以通过注入少量精心构造的音乐标题来污染数据库,导致系统检索到恶意标题,从而偏置提示增强并引导生成偏离用户预期功能,而无需修改用户提示、检索器或生成器。为了实现音乐标题投毒攻击,我们提出了一种双层标题投毒策略,该策略保留高层检索锚点,同时注入低层声学描述符,以将提示增强和下游音乐生成引导至攻击者选择的预期意图。在 MusicCaps 知识数据库、CLAP 检索器和 MusicGen 流水线中,被投毒的生成结果显著更接近攻击者的目标,同时与原始用户查询保持相当的契合度。这些结果揭示了检索增强型创意 AI 系统的一个实际完整性风险。我们的演示可访问:https://yizhu-wen.github.io/Mental-Damage/ ## 1 引言 文生音乐(TTM)生成系统,如 MusicLM[1 (https://arxiv.org/html/2605.30365#bib.bib1)]、MusicGen[5 (https://arxiv.org/html/2605.30365#bib.bib23)] 和 AudioLDM[16 (https://arxiv.org/html/2605.30365#bib.bib17)],通过允许用户用自然语言指定所需的音频内容,使音乐创作变得越来越便捷。然而,在实践中,基于低层领域特定语义[1 (https://arxiv.org/html/2605.30365#bib.bib1)]训练的模型难以处理用户通常提出的未充分指定的现实查询[7 (https://arxiv.org/html/2605.30365#bib.bib2)]。例如,没有音乐领域专业训练的用户可能会写出如“给我一首平静的歌曲来支持我的自学”或“我需要阅读时的放松背景音乐”这样的高层提示[14 (https://arxiv.org/html/2605.30365#bib.bib38)]。这些提示明确表达了用户意图(例如,平静、专注、学习支持),但为高质量音乐生成提供的低层声学指导(例如,节奏、乐器编配、音色、织体、力度)不足。近期的工作[10 (https://arxiv.org/html/2605.30365#bib.bib3),6 (https://arxiv.org/html/2605.30365#bib.bib15)]通过检索增强的提示增强和重写来弥补这一差距,系统从音乐-文本语料库中检索标题或示例,并在生成前将用户提示增强为更详细、更专业的描述。例如,系统可能将高层提示重写为低层描述,如“慢速钢琴主导的氛围曲目,柔和力度,稀疏编配,温暖铺垫质感,低节奏复杂性,轻柔起音,无突兀瞬态”。这种设计可以提高可用性和输出质量,但也引入了新的安全依赖,即检索语料库的完整性,特别是附加到音频的文本标签/标题。 先前关于检索增强生成(RAG)安全性的工作表明,通过污染检索知识库可以攻击 RAG 系统,导致下游模型产生受攻击者影响的输出[26 (https://arxiv.org/html/2605.30365#bib.bib4),15 (https://arxiv.org/html/2605.30365#bib.bib14)]。现有的 RAG 投毒研究主要集中于以文本为中心的 LLM 设置,攻击目标是操纵事实答案或文本补全。目前尚不清楚类似的攻击是否能转移到多模态生成流水线,尤其是 TTM 系统,其中检索到的标题直接指导生成。参见标题图 1:基于 RAG 的标题增强用于文生音乐:通过从音乐-文本知识库中检索详细的低层音乐标题来丰富高层用户提示,然后将增强后的提示传递给 TTM 模型。在本文中,我们研究了检索增强型文生音乐(TTM)生成中的一个新攻击面,即*音乐 RAG 知识数据库的标题投毒*。图1 (https://arxiv.org/html/2605.30365#S1.F1)展示了受害流水线和投毒入口点。用户提供*高层提示*(例如,“学习用的平静歌曲”)。系统嵌入此查询并从音乐-文本知识库中检索最相关的标题。检索到的标题随后被输入到*提示增强模块*,要么通过直接拼接,要么通过基于 LLM 的重写器,生成描述面向生成的声学属性(如节奏、乐器编配、音色和织体)的*低层提示*。然后 TTM 生成器(例如,MusicLM)根据这个增强后的提示合成音频。 攻击目标与影响:攻击者的目标是诱导基于 RAG 的 TTM 系统生成偏离用户预期功能的音乐,即使用户提供了良性的查询。攻击者不直接攻击生成器模型,而是针对 RAG 知识库,使得系统在提示增强期间接收被操纵的标题指导。如果成功,攻击会导致用户意图与生成输出之间的不匹配(例如,产生具有意外情感或风格特征的音乐),同时保持推理时的用户提示、检索器架构和生成器模型参数不变。这使得攻击从用户角度难以察觉,并暴露了检索增强型创意生成流水线中的实际完整性风险。 挑战:然而,发起这样的攻击并非易事,因为成功的被投毒标题必须满足多个相互竞争的要求。(1) **检索合理性**:被投毒标题必须保持足够的语义相关性,以便为目标良性查询检索到(例如,如果用户要求“学习用的平静音乐”,被投毒标题必须仍然看起来与平静/学习/背景音乐相关)。(2) **冲突控制**:天真的投毒可能会引入过于强烈冲突的目标语义,从而降低检索合理性或给生成器造成不稳定的 conditioning。例如,直接将目标标签如“摇滚”附加到平静学习标题上,可能在高层功能和低层声学特征(例如,节奏、力度和节奏密度)方面与源意图冲突。(3) **引导强度**:被投毒标题还必须带有足够的恶意引导,以影响提示重写和下游生成(例如,将增强后的提示转向怪异或阴森的声学特征)。 我们的思路:先前关于自动音频标题分析的工作将标题内容分为高层意图元素和低层声学描述符[21 (https://arxiv.org/html/2605.30365#bib.bib39)]。基于这一区分,我们通过一种三部分设计,将*高层检索兼容性*与*低层生成引导*分离,从而解决检索与引导之间的张力。(1) **锚点保留** 通过保留高层语义线索来提高*检索合理性*,这些线索使被投毒标题在良性查询下仍然可检索,例如,“平静的学习音乐”或“放松的背景音乐”。(2) **高层功能对立目标生成** 通过选择逆转用户预期功能(例如,舒适/专注 vs. 不安/紧张)的目标概念来改善*冲突控制*,同时在低层描述符空间中保持兼容,从而相对于强烈矛盾的目标减少不稳定。(3) **低层语义相似目标生成** 通过注入攻击者控制的低层声学描述符(例如,“缓慢脉动的 drone”、“远处回荡的钟声”或“空洞混响空间”)来增强*引导强度*,这些描述符塑造提示增强和下游合成。这些组件共同产生被投毒标题,在检索时保持合理,同时将生成引导偏离用户预期功能。 我们总结贡献如下: - • 我们识别了一种针对基于 RAG 的 TTM 生成的新型完整性攻击,其中污染 RAG 语料库中的标题元数据可以重定向高层到低层的提示翻译过程,并导致生成的音乐偏离用户预期功能。 - • 我们设计了一种双层标题投毒攻击,通过结合*锚点保留*、*功能对立定位*和*描述符级有效载荷注入*来共同提高检索合理性和恶意生成引导,从而解决关键攻击挑战。 - • 我们在使用 CLAP 检索和 MusicGen 音乐生成的基于 RAG 的 TTM 流水线上展示了攻击的有效性,表明被投毒生成的音乐与攻击者选择的目标意图的相似度大约翻倍,同时保持与原始用户查询的对齐。 ## 2 背景 ### 2.1 什么是文生音乐(TTM)? TTM 指的是一类从自然语言提示创建音乐的生成式 AI 系统。代表性例子包括 MusicLM[1 (https://arxiv.org/html/2605.30365#bib.bib1)]、MusicGen[5 (https://arxiv.org/html/2605.30365#bib.bib23)] 以及与 TTM 密切相关的音频生成模型,如 AudioLDM[16 (https://arxiv.org/html/2605.30365#bib.bib17)]。在 TTM 系统中,用户用文本描述所需的音乐,例如情绪(如平静、紧张)、流派(如古典、爵士)、乐器编配(如钢琴、吉他、弦乐)、节奏(如慢、快)或场景上下文(如学习用的背景音乐),模型生成相应的音频片段。直观地说,TTM 充当了两种不同模态之间的翻译系统:人类语言和音乐音频。文本提示提供了用户想要内容的语义描述,模型将该描述转换为音乐信号。诸如 MusicLM[1 (https://arxiv.org/html/2605.30365#bib.bib1)] 和 MusicGen[5 (https://arxiv.org/html/2605.30365#bib.bib23)] 等系统说明了这种文本条件生成设置,而诸如 CLAP[8 (https://arxiv.org/html/2605.30365#bib.bib16)] 等音频-文本对齐模型则在文本和音频表示之间提供更强的语义基础。 为了做好这一点,TTM 模型不仅要理解提示中的高层意图(例如,放松 vs. 充满活力),还要将该意图映射到更低层的音乐属性,如节奏、音色、织体、力度和乐器编配。在这个意义上,TTM 可以被视为一个多模态条件生成任务,其中文本作为控制信号,音乐是生成的输出[5 (https://arxiv.org/html/2605.30365#bib.bib23),16 (https://arxiv.org/html/2605.30365#bib.bib17)]。TTM 具有挑战性,因为用户提示通常是高层且未充分指定的。例如,像“学习用的平静音乐”这样的提示传达了意图,但省略了与生成相关的属性,如乐器编配、编曲密度、节奏和空间织体。为了缩小这一差距,最近的系统利用更强的文本-音频对齐、更丰富的标题监督(例如,MusicLM 流水线中的 MusicCaps[1 (https://arxiv.org/html/2605.30365#bib.bib1),13 (https://arxiv.org/html/2605.30365#bib.bib18)])以及提示精炼机制(如检索增强的提示重写[6 (https://arxiv.org/html/2605.30365#bib.bib15)])来提高可控性和生成质量。 ### 2.2 用于 TTM 的 RAG RAG 最初在基于 LLM 的文本生成中普及,现已越来越多地被采用到多模态生成设置中,包括文本到图像和文本-图像生成[3 (https://arxiv.org/html/2605.30365#bib.bib5),19 (https://arxiv.org/html/2605.30365#bib.bib6),23 (https://arxiv.org/html/2605.30365#bib.bib33)]。随着大规模生成式音频模型的最新进展,类似的检索增强机制也已出现在文本到音频(TTA)和 TTM 生成中[9 (https://arxiv.org/html/2605.30365#bib.bib10),4 (https://arxiv.org/html/2605.30365#bib.bib9)]。这些系统使用外部音频-文本存储器(例如,带标题的音乐或音频示例)来改善语义基础、可控性和生成质量,特别是对于抽象提示、长尾类别和零样本设置。 在 TTA 设置中,先前的工作已将检索集成到扩散和流匹配流水线中。Yuan 等人[9 (https://arxiv.org/html/2605.30365#bib.bib10)]将基于 CLAP 的检索集成到潜在扩散模型中,以改善稀有或未见声音的生成。Yang 等人[22 (https://arxiv.org/html/2605.30365#bib.bib7)]将流匹配生成条件建立在检索到的音频样本上,提高了零样本和少样本性能,而无需标记的检索数据。Zhao 等人[25 (https://arxiv.org/html/2605.30365#bib.bib8)]进一步引入了一个使用大型音频语言模型的反馈驱动精炼框架,其中缺失或不完美的声音事件通过检索和交叉注意力被迭代识别和纠正。 在音乐领域,检索也被应用于提示级别,以改善 TTM 系统的可控性和表现力。Gonzales-Rudzicz 等人[10 (https://arxiv.org/html/2605.30365#bib.bib3)]使用从 MusicCaps[13 (https://arxiv.org/html/2605.30365#bib.bib18)] 检索到的语义相似的音乐方面来增强输入提示。Ding 等人[6 (https://arxiv.org/html/2605.30365#bib.bib15)]检索相关描述并使用语言模型将新手提示重写为更详细、专家风格的输入,在不修改生成器的情况下改善音乐性和制作质量。总的来说,这些方法揭示了 RAG 启用的 TTM 系统中常见的设计模式:检索到的标题充当中间语义控制信号,连接高层用户意图和低层声学实现。 为什么 TTM 在低层输入上表现良好?TTM 模型通常在低层声学描述(例如,节奏、织体、混响、音色和节奏密度)上表现良好,因为这类描述符在音乐标题数据集中频繁出现,而高层语义意图则更多样且相对稀疏[20 (https://arxiv.org/html/2605.30365#bib.bib37)]。这种重复的监督使得低层描述符在训练期间成为稳定且有效的条件信号[21 (https://arxiv.org/html/2605.30365#bib.bib39)]。相比之下,高层提示通常未充分指定,并且可以通过多种不同音乐方式实现。例如,“学习用的音乐”可能对应不同的流派、乐器和编曲风格。因此,低层描述符通常对生成提供更强控制。 ### 2.3 现有 RAG 攻击 随着 RAG 被广泛集成到大型语言模型系统中,RAG 的安全风险已受到越来越多的关注。先前的工作表明,RAG 在基于文本和基于图像的设置中都可能受到攻击[11 (https://arxiv.org/html/2605.30365#bib.bib32),15 (https://arxiv.org/html/2605.30365#bib.bib14),23 (https://arxiv.org/html/2605.30365#bib.bib33),18 (https://arxiv.org/html/2605.30365#bib.bib34)]。在基于文本的 RAG 中,攻击通常通过投毒或注入来操纵外部知识源(例如,向量数据库或检索到的文档),导致系统检索恶意内容,从而引导下游生成[26 (https://arxiv.org/html/2605.30365#bib.bib4)]。在基于图像或多模态
相似文章
归因盲点:检测语言模型何时依赖记忆而非检索到的上下文
提出计算现实监测(Computational Reality Monitoring)方法,用于检测语言模型何时依赖预训练记忆而非检索到的上下文,从而解决检索增强生成中的归因盲点问题。
语境之代价:在多模态检索增强生成中缓解文本偏差
本文识别并形式化了多模态RAG中的“再污染”现象,即添加准确上下文会导致模型因注意力崩溃(视觉盲区和位置偏差)而放弃正确预测。作者提出BAIR,一种无参数的推理时框架,能恢复视觉显著性并惩罚文本干扰因素,从而在医学、公平性和地理空间基准上提高可靠性。
语音AI系统易受隐藏音频攻击
新研究表明,不易察觉的音频信号能以79-96%的成功率劫持大型音频语言模型(LALMs),迫使其执行未经授权的命令,如网络搜索或发送电子邮件。这种被称为AudioHijack的技术针对生成式模型,无论用户输入如何都能生效,对语音AI系统构成严重安全风险。
误判鸿沟:当记忆投毒在自主AI系统中看似模型故障
本文识别了多智能体AI流水线中的一种结构性缺陷,即记忆层攻击可能被误判为模型失调,形式化定义了语义规范漂移(SND),并提出反事实组合测试(Counterfactual Composition Testing)和持久记忆信息流控制(Memory-Persistent Information-Flow Control)作为防御措施。
当智能体记忆过多:针对大语言模型智能体的记忆投毒攻击
本文介绍了GhostWriter,一种新颖的攻击向量,利用基于大语言模型的个人智能体的记忆子系统来毒化其记忆存储,实现了高注入率和激活率。作者提出了AM-Sentry防御机制,在保持智能体实用性的同时显著降低攻击成功率。