Fusion Embedding:文本、图像、视频与音频的统一嵌入空间

arXiv cs.CL 论文

摘要

Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。

arXiv:2607.18666v1 公告类型:新论文 摘要:一个覆盖文本、图像、视频和音频的单一嵌入空间,能够用一个索引服务用户可能提出的所有查询。基于视觉-语言主干构建的嵌入模型目前引领着文本/图像/视频检索基准,但完全缺乏音频能力;而音频-文本检索则由不服务其他模态的专家系统主导。我们提出 Fusion Embedding 系列,将音频添加至一个冻结的视觉-语言嵌入基座(其参数从未更新):第一代(fusion-embedding-1)仅训练一个 16.4M 参数的连接器,位于冻结的音频塔和冻结的基座之间;第二代(fusion-embedding-2)增加了模态门控深度适配器(44.2M 参数),其分支在文本、图像或视频输入上永不执行:它们的输出与已发布的基座逐比特相同,每次训练运行后均经验证。由于基座已将文本、图像和视频绑定,仅将音频与文本对齐即可使音频-图像检索涌现,且无需任何配对的音视频训练数据。除了方案本身,我们还通过受控的负面结果(使用 LLM 重写训练标题、替换排行榜更强的音频塔、以及加宽连接器,均会降低检索性能)以及训练协议发现(我们预计这些发现可迁移至任何冻结的解码器-LM 嵌入主干)来映射其设计空间。两代模型均可在单个 GPU 上数小时内完成训练。权重、代码和评估工具已开源发布。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:24

# 融合嵌入:文本、图像、视频和音频的统一嵌入空间  
来源:https://arxiv.org/html/2607.18666  
Abdul Basit Tonmoy¹,²,³,Kazi Fardinul Hoque²,Md. Shahrier Islam Arham¹,²,Arman Luthra¹,²  
¹Eximius Labs  
²Wabash College  
³Skop Intelligence Co.  
[email protected]  
[email protected]  
[email protected]  
[email protected]  

###### 摘要  

一个覆盖文本、图像、视频和音频的单一嵌入空间,使得一个索引就能服务于用户可能提出的任何查询。基于视觉-语言骨干构建的嵌入模型目前在文本/图像/视频检索基准中处于领先地位,但完全缺乏音频能力;而音频-文本检索则由只服务于单一模态的专用系统主导。我们提出了Fusion Embedding系列,该系列将音频添加到一个冻结的视觉-语言嵌入基线上,其参数从未更新:第一代(fusion-embedding-1)仅在冻结的音频塔和冻结的基线之间训练一个16.4M参数的连接器;第二代(fusion-embedding-2)增加了模态门控的深度适配器(44.2M参数),这些适配器的分支在文本、图像或视频输入上永远不会执行:它们的输出与已发布的基线逐位相同,这一点在每次训练运行后都经过验证。由于基线已经将文本、图像和视频绑定在一起,仅将音频与文本对齐就使音频-图像检索*涌现*出来,且无需任何配对的音频-视觉训练数据。除了配方,我们还通过受控的负面结果(用LLM重写训练描述、替换排行榜更强的音频塔、以及加宽连接器——这些操作*降低*了检索性能)和训练协议发现(我们预计这些发现可迁移到任何冻结的解码器-LM嵌入骨干)来映射其设计空间。两代模型均在单个GPU上数小时内完成训练。权重、代码和评估工具已公开发布。  

# 融合嵌入:文本、图像、视频和音频的统一嵌入空间  

## 1 引言  

检索系统越来越需要一个*单一*的向量空间,覆盖用户可能存储或查询的所有模态:文本、图像、视频和音频。针对每对模态训练的对比双编码器,例如用于视觉-语言的CLIP(Radford等人,2021)和用于音频-语言的CLAP系列(Wu等人,2023;Mei等人,2024;Zhu和Duan,2024;Niizumi等人,2025),在成对检索中表现强劲,但每个模型仅覆盖两种模态。统一空间模型,如ImageBind(Girdhar等人,2023),将多种模态绑定到一个枢轴模态上,证明了两个模态之间的对齐可以通过共享的第三种模态涌现。与此同时,基于大型视觉-语言骨干的嵌入模型现在主导了文本/图像/视频检索基准,如MMEB-V2(Jiang等人,2024;Meng等人,2025),但完全缺乏音频能力。添加缺失模态的两种途径正在出现,它们权衡了不同的方面。  

*音频原生专用系统*从内部调整多模态LLM:OEA(Yoo等人,2026)在音频原生LLM的骨干注意力中训练LoRA适配器;AuroLA(Xu等人,2026)在Qwen2.5-Omni-7B的音频塔和LLM内部训练了418M LoRA参数,并添加了第二个7B模型作为重排序器。这些系统在音频-文本基准上引领步伐,但它们只服务于一个模态对,并且其骨干网络已不再是生态系统所发布的那个模型。  

*冻结基座融合*,即本文所采取的路径,保持已部署的模型不变,并从外部附加新模态。这种权衡是用能力换取不变性:部署中已基于基座模型计算和索引的每个嵌入保持完全有效;基座已发布的文本/图像/视频基准结果保持不变;不是近似,而是通过构造保证。本报告描述了Fusion Embedding系列的两代模型:fusion-embedding-1和fusion-embedding-2,两者均基于逐字节冻结的Qwen3-VL-Embedding-2B(Li等人,2026)基线和冻结的Qwen2.5-Omni音频塔(Xu等人,2025)。第一代建立了空间:一个16.4M参数的感知器-重采样器连接器,通过对比学习与缓存的冻结文本目标进行训练,足以使音频成为一等模态:AudioCaps音频到文本R@10为0.741(两个塔均冻结),Clotho完全零样本迁移,音频到图像检索达到29倍随机水平,无需任何音频-视觉监督。第二代则探究剩余性能提升空间何在。三个受控的负面结果(§8)将其定位在冻结LM*处理*音频令牌的能力上,而非数据或连接器;因此fusion-embedding-2在每个解码器层添加了瓶颈适配器,并硬门控到音频输入,使得非音频计算逐位不受影响。这些适配器改进了每个文本到音频基准(AudioCaps R@10为0.775),同时不变性保证完全成立。  

我们的贡献:  
- •**系统**。一种两代配方,用于将冻结的视觉-语言嵌入基线与音频扩展:一个16.4M连接器(第一代),然后是其模态门控的深度适配器(+44.2M,第二代),该门保证非音频输入执行基座计算不变(§3.3)。仅连接器的系统在结构上保留了基线;门控将相同的精确性扩展到了*层内*容量,而先前的方法只能减轻漂移:未合并的LoRA保留了基线*参数*,但在文本路径上执行;零初始化的扩展则从恒等映射开始训练。  
- •**涌现的跨模态检索**。在零音频-图像训练对的情况下,VGGSound-696上的音频到图像检索达到R@10 0.418(29倍随机;最强第二代检查点使用不同读出模板时为0.443;见表6)。在统一协议下进行头对头比较,ImageBind和fusion-embedding-1各自在其监督对中胜出,而fusion-embedding-1在剩余两对中胜出;fusion-embedding-1在所有三对上击败了LanguageBind,包括LanguageBind的监督对,我们将此失败归因于其分支文本塔的 measurable 发散(§7)。  
- •**负面结果**。受控实验表明:使用LLM重写的训练描述(尽管更干净)*降低*了检索性能;在浅层投影比较中占优的声音事件音频塔在冻结LLM拼接中丢失了16个R@10点;更宽的连接器因过拟合而失败。加上+14.5点的训练协议效应和损失地板审计,这些结果勾勒出冻结骨干音频融合的设计空间(§8)。  
- •**发布**。两代模型的开放权重(带固定修订标签)、Apache-2.0训练和评估代码,以及每个报告数值的结果记录(§10)。  

## 2 相关工作  

#### 对比性音频-文本预训练(CLAP系列)。  
LAION-CLAP(Wu等人,2023)、WavCaps(Mei等人,2024)、Cacophony(Zhu和Duan,2024)和M2D-CLAP(Niizumi等人,2025)在数十万音频-描述对上端到端训练音频和文本编码器,并在双编码器中达到了AudioCaps检索的最先进水平(音频到文本R@10 0.906–0.928)。这些模型微调了两个塔,并包含域内AudioCaps训练;M2D-CLAP额外将Clotho纳入其训练数据,因此其Clotho行不是零样本的。WavCaps还展示了大型LLM辅助描述语料库的价值,而AudioSetCaps(Bai等人,2024)将该配方扩展到190万对;值得注意的是,其作者报告称,预训练后的域内AudioCaps微调值得+13–15个R@1点,并且一个478K高质量描述子集优于类似规模的WavCaps+AudioCaps+Clotho混合;在同等规模下,描述质量获胜。GLAP(Dinkel等人,2026)在统一的对比配方下比较了五个冻结音频编码器,并选择Dasheng(Dinkel等人,2024)作为最通用的,Whisper系列编码器在声音检索上落后声音事件编码器约9–12 mAP@10;我们的塔交换实验表明,这种排名在冻结LLM拼接中*不*成立(§8)。在数据方面,AudioCaps 2.0(Kim等人,2025)(91,256训练/4,875测试对,音频分布需通过请求流程访问)将域内池扩大一倍;我们验证其训练集与我们评估的v1测试协议不相交(我们的883个评估片段中没有一个出现在其训练CSV中),使其成为我们微调阶段的自然扩展。我们的模型与整个系列的不同之处在于:*两个*塔均未训练。  

#### 音频原生专用系统。  
最近的工作在多模态LLM骨干上构建音频-文本检索。OEA(Yoo等人,2026)在可训练参数预算上最接近第一代:它保持音频原生多模态LLM骨干冻结,并在注意力层和投影头上训练LoRA适配器(11–16M可训练参数,对比我们的16.4M连接器),在AudioCaps文本到音频R@1上达到0.389。架构差异对我们的设定至关重要:OEA的LoRA位于*骨干注意力内部*,因此文本路径也被适配,共享骨干不再与其发布版本逐字节相同,而这正是我们的设计所要保持的属性。OEA的两个进一步观察为我们的分析提供信息:其7B骨干在音频基准上表现与其3B骨干相当,且其Clotho训练的变体在Clotho上不是零样本的。AuroLA(Xu等人,2026)在Qwen2.5-Omni-7B的两个塔中训练LoRA(418M可训练参数),在一个精心策划的140万对语料上,并添加第二个7B模型进行成对重排序,作为两遍系统达到AudioCaps R@1 0.656(A→T)/ 0.510(T→A);其缩放消融表明,大收益恰好在我们的语料规模范围之上。其混合NCE损失(带加权负样本的软正样本集)是我们在(§4.1)采用的大规模语料软标签和假负样本掩码项的收敛证据。两条线路都验证了LLM骨干用于音频检索,同时适配了远超音频路径的内容,并且两者都不服务于也不评估音频和文本之外的任何模态。  

#### 统一嵌入空间。  
ImageBind(Girdhar等人,2023)将六种模态绑定到图像,并建立了从未在训练中配对的模态之间的跨模态对齐可以涌现。我们使用相同的涌现机制,以文本为枢轴,但方向相反:我们不训练模态塔绑定到枢轴编码器,而是冻结现有的多模态基座,仅训练新模态的路径,这保持了基座的基准性能完全不变。LanguageBind(Zhu等人,2024)通过微调文本塔的每个分支副本来将模态分支绑定到语言,我们在§7中测量了这种设计的后果。ONE-PEACE(Wang等人,2023)从头训练了一个4B的三模态(视觉/音频/语言)模型,并在音频-文本检索上仍然是统一空间中最强的,其每个参数都经过训练,其检索行在合并的AudioCaps+Clotho+MACS训练集上微调(表4)。另一条*空间缝合*线路(OmniBind,Wang等人,2025;FreeBind,Wang等人,2024)使用小型学习投影器和路由器将多个预训练的专业空间绑定在一起;这些系统仅报告AudioCaps/Clotho R@1/R@5(检索方向未说明),且绑定的专家包含在AudioCaps/Clotho训练数据上训练过的检查点,因此它们的“零样本”适用于缝合阶段而非底层空间。Matryoshka表示学习(Kusupati等人,2022)提供了我们端到端保留的嵌套截断特性;我们的对比目标作用于基座阶梯的每一级,并且我们的白化被有意设计为对角形式,使得截断和白化可交换。  

#### 定位。  
与同时期的jina-embeddings-v5-omni(Hönicke等人,2026)——它组合了一个冻结的*文本*嵌入骨干与冻结的视觉和音频编码器,仅训练连接组件——并行,fusion-embedding-1据我们所知是第一个将已有的*视觉-语言*嵌入模型(Qwen3-VL-Embedding-2B)扩展到音频,同时保持基座和音频塔冻结,仅训练连接器的模型:将一个第四模态添加到已有的检索器,而不是从文本基座构建多模态空间。fusion-embedding-2在冻结骨干的层内添加音频容量,通过模态门控。与门控交叉注意力(Alayrac等人,2022)或块扩展(Wu等人,2024)不同——这些方法仅近似或在初始化时保持原始行为——该门使得文本、图像和视频输出与冻结基座*逐位相同*——这一保证我们在发布的检查点上验证过,并且据我们所知,之前没有多模态嵌入模型能在同时保留多个模态的情况下提供这种保证。在AudioCaps音频到文本R@10上,fusion-embedding-1和fusion-embedding-2(约0.74)属于两个塔均冻结类的前沿;下一个这样的系统是jina-embeddings-v5-omni的0.672,并且它们之上的每个模型都至少训练了一个塔。ONE-PEACE达到0.92,但属于不同类别:所有4B参数都经过训练,并经过了域内微调。上述音频原生专用系统在域内音频-文本R@1上更高(§6.2);它们是单对系统,不同系统类别的比较在表4中明确给出。  

## 3 模型家族  

参见图标题  
图1:Fusion Embedding家族。两代模型共享冻结堆栈:逐字节冻结的Qwen3-VL-Embedding-2B基座(最后令牌池化,Matryoshka输出阶梯)和冻结的Qwen2.5-Omni音频塔。第一代(fusion-embedding-1)仅训练FusionResampler(16.4M参数,宽度384,64个潜在查询),该模块将音频塔帧映射到基座的输入嵌入空间的占位令牌位置。第二代(fusion-embedding-2)

相似文章

FATE:帧级音视频时间嵌入

Hugging Face Daily Papers

提出FATE,一种帧级音视频时间嵌入方法,将帧序列在物理时间轴上对齐,实现语义与时间的联合理解。在时间检索、事件定位和生成评估指标上均优于基线方法。