音频-视频模型中的注意力三角形
摘要
本文通过跨注意力机制中的‘注意力三角形’研究音频-视频扩散模型中的语义泄漏,并提出了在生成过程中增强语义锚定的方法。
arXiv:2609.03586v1 公告类型:新
摘要: 音频-视频扩散模型依赖跨模态注意力来协调文本、声音和视觉内容,然而这种机制可能引入微妙且系统性的语义泄漏。我们通过探测和分析‘注意力三角形’来研究这些模型,该三角形由连接文本、音频和视频流的三个跨注意力边组成,并检查在生成过程中语义信息如何跨模态路由。我们的分析揭示,沿音频-视频边的路由是双向的:音频可以影响视频生成,而视频可以影响音频生成。这条边由模型参数中编码的偏差塑造,并成为泄漏的主要因素:当提示与学习到的先验知识发生冲突时,跨模态交互可能覆盖预期的条件,并将语义重新路由到视觉上规范但不正确的结果。这些效应表明,语义伪影并非仅仅源于注意力超出其预期目标的扩散,而是源于沿特定路径的结构化、偏差驱动的交互。基于这一观点,我们提取注意力衍生的信号,揭示语义如何跨模态分布和锚定,并将其用作诊断工具,在受控条件下分析和有意引发泄漏。这使我们能够探测跨模态路由的内部动态,并隔离各个交互的作用。我们进一步利用这些信号来指导推理时的干预,以鼓励更一致的跨模态对齐。大量实验支持我们的分析,并表明在保持生成质量的同时改进了语义锚定。
查看缓存全文
缓存时间: 2026/09/04 06:08
# 音视频模型中的注意力三角机制 来源:https://arxiv.org/html/2609.03586 \\@ACM@balancefalse 期刊:TOG 作者:Noa Kraicer 隶属机构:特拉维夫大学,以色列特拉维夫 Gal Metzer 隶属机构:特拉维夫大学,以色列特拉维夫 Zhuo Ning 隶属机构:西蒙弗雷泽大学,加拿大本那比 Ali Mahdavi-Amiri 隶属机构:西蒙弗雷泽大学,加拿大本那比 Daniel Cohen-Or 隶属机构:特拉维夫大学,以色列特拉维夫 与Raja Giryes 隶属机构:特拉维夫大学,以色列特拉维夫 © none 四个生成视频示例以2×2网格排列,展示码头场景中的海盗与鹦鹉。基线模型赋予海盗鹦鹉般的视觉属性并让海盗说话。“我们的-文本”模型恢复了海盗外观,但语音仍由海盗发出。“我们的-音视频”模型将语音转移给鹦鹉,但海盗的视觉扭曲依然存在。“我们的-完整”模型保留了海盗外观并将语音分配给鹦鹉。 **图1**:音视频模型中的注意力三角机制。 左上:基线T2AV生成表现出强烈泄漏;海盗在视觉上继承了鹦鹉的属性并成为语音来源。 右上:“我们的-文本”恢复了海盗的外观,但语音仍错误地定位在海盗身上。 左下:“我们的-音视频”正确地将语音定位于鹦鹉,但海盗的外观泄漏依然存在。 右下:“我们的-完整”模型共同恢复了正确的外观并将语音定位于预期来源。 提示词显示在图下方。四个生成视频示例以2×2网格排列,展示码头场景中的海盗与鹦鹉。基线模型赋予海盗鹦鹉般的视觉属性并让海盗说话。“我们的-文本”模型恢复了海盗外观,但语音仍由海盗发出。“我们的-音视频”模型将语音转移给鹦鹉,但海盗的视觉扭曲依然存在。“我们的-完整”模型保留了海盗外观并将语音分配给鹦鹉。 **摘要**:音视频扩散模型依赖跨模态注意力来协调文本、声音与视觉内容,但这一机制也可能引入微妙而系统的语义泄漏。本文通过探查和分析“注意力三角”来研究这些模型,该三角由连接文本、音频与视频流的三个跨注意力边构成,并考察了生成过程中语义信息如何跨模态路由。我们的分析揭示,沿着音视频边的路由是双向的:音频可以影响视频生成,视频也可以影响音频生成。这条边受模型参数中编码的偏差塑造,是泄漏的主要贡献者:当提示词与学习到的先验知识冲突时,跨模态交互可能覆盖预期条件作用,并将语义路由至视觉上典型但错误的结果。这些效应表明,语义伪影的产生不仅源于注意力超出其预期目标的扩散,还源于特定路径上由偏差驱动的结构化交互。基于此视角,我们提取暴露语义如何在跨模态间分布和锚定的注意力派生信号,并将其用作诊断工具,以分析并刻意在控制条件下引发泄漏。这使我们能够探测跨模态路由的内部动态,并隔离各交互的作用。我们进一步利用这些信号指导推理时干预,以促进更一致的跨模态对齐。大量实验支持我们的分析,并在保持生成质量的同时提升了语义锚定。 ## 1. 引言 *扩散模型*的最新进展,特别是扩散Transformer(DiT)(Peebles and Xie, 2023 (https://arxiv.org/html/2609.03586#bib.bib32)),已确立注意力作为条件生成的核心机制。通过利用Transformer架构内的跨注意力,这些模型可以将文本、参考图像或其他模态等条件信号与不断演变的视觉表征相关联。注意力在整个去噪过程中捕获并传播交互表征间的语义关联,从而实现富有表现力的组合生成。然而,同样的机制在没有明确局部性或排他性约束的情况下,以柔和且全局的方式混合信息。因此,语义关联可能扩散到其预期目标之外,产生属性泄漏、语义纠缠以及随时间变化的不稳定绑定。这些局限性在音视频生成中变得更加突出,因为注意力必须同时协调文本、音频和视频模态之间的交互(图1 (https://arxiv.org/html/2609.03586#acmlabel1) 和图3 (https://arxiv.org/html/2609.03586#acmlabel3))。我们将这种三元组模态设置称为*注意力三角*(图2 (https://arxiv.org/html/2609.03586#acmlabel2)),其中每种模态既影响又约束着其他模态。与双模态条件作用不同,对齐不再是成对的,而是耦合于所有三种模态。模型必须协调来自文本的语义意图、来自音频的时间结构以及视频中的时空实现。这些耦合的约束可能产生竞争信号、模态主导和纠缠关联,使得竞争性解释能够通过注意力传播并降低全局一致性。 我们的消融研究确定了音视频路径是LTX-2中语义泄漏的主要来源(图6 (https://arxiv.org/html/2609.03586#acmlabel6) 和补充图7 (https://arxiv.org/html/2609.03586#acmlabel7))。我们假设这种漏洞部分源于音频token编码时间(而非空间)位置,使得源定位的约束不足。本文从分析驱动的视角重新审视音视频生成。我们通过注意力三角结构分析上述泄漏问题,同时特别强调源归因的失败,即声音语义是否锚定于适当的视觉实体。透过此视角,泄漏可以理解为语义信息如何在文本、音频和视频流之间路由。更普遍地说,这种路由本质上是双向的:音频可以影响视觉解释,而视觉先验反过来又会偏向声音的生成和归因。从我们的分析中浮现的一个有趣观察是,该三角的音视频边常常表现为薄弱环节(图5 (https://arxiv.org/html/2609.03586#acmlabel5) 和补充图11 (https://arxiv.org/html/2609.03586#acmlabel11))。在提示词与模型学习到的跨模态偏差存在冲突的情况下,这种交互可能覆盖文本诱导的绑定,将声音语义路由至视觉上典型但错误的源。这表明泄漏不仅是语义关联扩展到非预期实体的结果,还与模型参数中编码的、沿特定跨模态路径表现的偏差驱动交互密切相关。 基于此视角,我们提取暴露源归因的注意力派生信号,并将其用作诊断工具,以分析并刻意引发泄漏。通过引发受控失败,我们探究声音语义如何跨实体和模态路由,并隔离特定跨模态交互的作用。然后我们利用这些信号指导推理时的干预,以实现更一致的声音-源锚定。图1 (https://arxiv.org/html/2609.03586#acmlabel1) 展示了一个代表性示例。基线模型表现出外观泄漏和错误的源归因,海盗继承了鹦鹉般的属性并成为语音来源。部分干预揭示了一种解耦:引导文本边恢复外观但不恢复归因,而引导音视频边修正归因但不修正外观。只有联合引导所有三角边才能同时解决两者,这说明没有任何单一交互足以控制跨模态路由。在各种提示词和设置中,我们的实验揭示了一致的泄漏模式,并表明该框架同时支持探测和缓解(表1 (https://arxiv.org/html/2609.03586#S5.T1) 和补充图9 (https://arxiv.org/html/2609.03586#acmlabel9))。 ## 2. 背景与相关工作 扩散模型依赖于两种互补的注意力机制。*自注意力*在单个模态内操作,允许每个token从所有其他token中聚合远程上下文(Vaswani et al., 2017 (https://arxiv.org/html/2609.03586#bib.bib39))。*跨注意力*耦合两个token序列,通常是噪声潜变量和文本嵌入,使得潜变量token可以有选择地关注相关的条件token(Rombach et al., 2022 (https://arxiv.org/html/2609.03586#bib.bib34))。在基于文本到图像的DiT(Peebles and Xie, 2023 (https://arxiv.org/html/2609.03586#bib.bib32))和UNet骨干中,跨注意力是将提示语义空间锚定于图像的主要机制。我们的工作建立在三条紧密相关的研究线之上:利用跨注意力作为图像生成的控制面、其不同实体间泄漏的失败模式,以及继承并沿新模态轴复合此问题的音视频扩散模型。 ### 2.1. 图像扩散模型中的注意力操控与泄漏 跨注意力已成为文本到图像扩散的主要控制面:它编码空间布局(Hertz et al., 2023 (https://arxiv.org/html/2609.03586#bib.bib18))并通过其键和值承载属性绑定(Feng et al., 2023 (https://arxiv.org/html/2609.03586#bib.bib12))。推理时方法引导它以增强未充分关注的token并恢复缺失或代表性不足的主体(Chefer et al., 2023 (https://arxiv.org/html/2609.03586#bib.bib5)),将注意力图与句法结构对齐以修正属性对应(Rassin et al., 2023 (https://arxiv.org/html/2609.03586#bib.bib33)),分离竞争实体同时绑定属性(Li et al., 2023 (https://arxiv.org/html/2609.03586#bib.bib26)),或强制用户指定的布局(Chen et al., 2024 (https://arxiv.org/html/2609.03586#bib.bib6))。即使在基于RoPE的现代MMDiT骨干(Esser et al., 2024 (https://arxiv.org/html/2609.03586#bib.bib11))中,不同的Transformer层也扮演着定性上不同的角色,这为层定向编辑提供了可能(Wei et al., 2025 (https://arxiv.org/html/2609.03586#bib.bib42))。所有这些工作都将跨注意力视为可操纵的、语义上有意义的信号,无需重新训练即可实现细粒度控制。其另一面是*泄漏*:因为注意力是一种柔和的全局混合过程,没有明确的局部性或排他性约束,特征经常在提示意图保持独立的实体之间渗透。诸如“一只条纹猫旁边一只斑点狗”的提示词通常会产生条纹狗或斑点猫,因为模式是根据目标实体的语义而非目标描述进行路由的。这种失败被归因于注意力层特征在视觉相似主体间的混合(Dahary et al., 2024 (https://arxiv.org/html/2609.03586#bib.bib9))、外部施加的布局与噪声先验之间的冲突(Dahary et al., 2025 (https://arxiv.org/html/2609.03586#bib.bib8))、聚合了整个提示中属性的纠缠的序列结束文本嵌入(Mun et al., 2025 (https://arxiv.org/html/2609.03586#bib.bib31)),以及跨实体分配不当的注意力logits(Ventura et al., 2026 (https://arxiv.org/html/2609.03586#bib.bib40));相应的补救措施都作为推理时干预,将泄漏视为注意力路由失败。一个相关的失败模式是*上下文矛盾*,其中一个概念通过纠缠的学习关联隐含地抑制另一个;Huberman等人(2025)(https://arxiv.org/html/2609.03586#bib.bib23) 通过阶段感知提示来解决此问题,该提示在去噪阶段分解提示词,而非直接编辑注意力。我们的工作将这一视角扩展到文本到图像生成之外的*注意力三角*,其中泄漏不仅发生在视觉实体之间,也跨模态发生。 ### 2.2. 视频与音视频扩散模型 早期的文本到视频系统,如Make-A-Video(Singer et al., 2023 (https://arxiv.org/html/2609.03586#bib.bib37))和Imagen Video(Ho et al., 2022a (https://arxiv.org/html/2609.03586#bib.bib19)),在预训练的文本到图像模型上附加时空模块(Ho et al., 2022b (https://arxiv.org/html/2609.03586#bib.bib20); Blattmann et al., 2023 (https://arxiv.org/html/2609.03586#bib.bib2)),生成*无声*片段,音频在生成循环之外。向扩散Transformer(DiT)骨干(Brooks et al., 2024 (https://arxiv.org/html/2609.03586#bib.bib3))的转变使得大规模联合视频训练成为可能,包括CogVideoX(Yang et al., 2024 (https://arxiv.org/html/2609.03586#bib.bib45))、HunyuanVideo(Kong et al., 2024 (https://arxiv.org/html/2609.03586#bib.bib24))、Wan(Wan et al., 2025 (https://arxiv.org/html/2609.03586#bib.bib41))和LTX-Video(HaCohen et al., 2024 (https://arxiv.org/html/2609.03586#bib.bib16))等开源系统,以及闭源的Sora(Brooks et al., 2024 (https://arxiv.org/html/2609.03586#bib.bib3))和Veo(Google DeepMind, 2025 (https://arxiv.org/html/2609.03586#bib.bib14))。这些系统保留了无声视频的假设。近期一条研究路线通过在单一扩散框架中联合生成音频和视频来弥合音频差距。MM-Diffusion(Ruan et al., 2023 (https://arxiv.org/html/2609.03586#bib.bib35))开创性地通过一个随机移位跨注意力块配对视频和音频子网络,交换时间对齐信息;MM-LDM(Sun et al., 2024 (https://arxiv.org/html/2609.03586#bib.bib38))将这一思想提升到共享的语义潜空间。随后,Transformer骨干产生了双分支设计,通过跨模态注意力耦合两个并行的DiT塔:SyncFlow(Liu et al., 2024 (https://arxiv.org/html/2609.03586#bib.bib27))融合了用于时间对齐文本到音视频的双扩散Transformer;AV-Link(Haji-Ali et al., 2025 (https://arxiv.org/html/2609.03586#bib.bib17))将冻结的音频和视频扩散模型的中间特征重新用作跨模态条件;JavisDiT(Liu et al., 2025 (https://arxiv.org/html/2609.03586#bib.bib28))引入了分层时空先验,在多个粒度上对齐两个流;Ovi(Low et al., 2025 (https://arxiv.org/html/2609.03586#bib.bib29))采用了完全对称的双子DiT设计,配有成对的跨注意力层。闭源方面,Veo 3(Google DeepMind, 2025 (https://arxiv.org/html/2609.03586#bib.bib14))在覆盖两种模态的统一token序列上执行联合去噪。开源基础模型LTX-2(HaCohen et al., 2026 (https://arxiv.org/html/2609.03586#bib.bib15))代表了当前最先进水平。 最近的工作更直接地考察或构建了双流生成器中的跨模态交互。UniAVGen引入了模态特定、时间对齐的交互和学习到的面部感知调制(Zhang et al., 2026 (https://arxiv.org/html/2609.03586#bib.bib46)),而跨模态上下文学习(CCL)识别了背景区域注意力偏差、优化不稳定性以及文本与跨模态条件之间的冲突,并通过时间分区、可学习的上下文token
相似文章
当视觉为声音代言
本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
利用视觉-语言模型检测教育视频中的注意力
本文探讨了使用视觉-语言模型(VLM)通过结合注视数据与视频内容来检测教育视频中的注意力丧失,但发现VLM方法并未超越传统的机器学习基线。
PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力
PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。
基于自回归扩散变换器的流式同步空间音频生成
SwanSphere 提出了一种统一的流式框架,通过因果自回归扩散变换器和多模态学习策略,从全景视频和文本提示中生成高保真空间音频,在视频到空间音频和文本到空间音频任务中均实现了卓越性能。