jina-embeddings-v5-omni:通过冻结塔组合实现文本几何保持的多模态嵌入
摘要
本文介绍了 jina-embeddings-v5-omni,这是一套多模态嵌入模型,通过冻结塔组合技术将文本嵌入扩展至图像、音频和视频。该方法仅训练总权重的 0.35%,在保持文本几何结构的同时,以显著降低的计算成本实现了极具竞争力的最先进性能。
arXiv:2605.08384v1 宣布类型:新论文
摘要:在本研究中,我们引入了冻结编码器模型组合,这是一种针对多模态嵌入模型的新颖方法。我们基于视觉语言模型(VLM)风格的架构构建,在该架构中,非文本编码器被调整以产生语言模型的输入,随后语言模型生成所有类型输入的嵌入。我们展示了研究成果:jina-embeddings-v5-omni 套件,这是一对将文本、图像、音频和视频输入编码到单一语义嵌入空间中的模型。我们的方法是通过添加图像和音频编码器,将两个 Jina Embeddings v5 文本模型扩展以支持更多媒体类型。主干文本嵌入模型和新增的非文本媒体编码器保持冻结状态。我们仅训练了连接组件,这些组件占联合模型总权重的 0.35%。因此,训练比全参数重新训练效率高得多。此外,语言模型实际上保持不变,对于文本输入生成的嵌入与 Jina Embeddings v5 文本模型完全相同。我们的评估表明,该方法产生的结果与最先进水平具有竞争力,其性能几乎等同于更大的多模态嵌入模型。
查看缓存全文
缓存时间: 2026/05/12 06:43
# jina-embeddings-v5-omni:通过冻结塔组合实现保持文本几何结构的多模态嵌入 来源:https://arxiv.org/html/2605.08384 作者:Michael Günther, Andreas Koukounas, Kalim Akram, Scott Martens, Saba Sturua 和 Han Xiao ###### 摘要 在本文中,我们引入了**冻结编码器模型组合(frozen-encoder model composition)**,这是一种构建多模态嵌入模型的新方法。我们基于 VLM 风格的架构,在这种架构中,非文本编码器被调整以产生语言模型的输入,进而为各种输入生成嵌入。我们展示了结果:**jina-embeddings-v5-omni** 套件,这是一对能将文本、图像、音频和视频输入编码到单一语义嵌入空间中的模型。我们的方法是扩展两个 Jina Embeddings v5 Text 模型,通过添加图像和音频编码器来支持其他媒体类型。骨干文本嵌入模型和新增的非文本媒体编码器均保持冻结状态。我们仅训练了连接组件,这些组件占联合模型总权重的 0.35%。因此,训练效率远高于全参数重新训练。此外,语言模型基本保持不变,为文本输入产生的嵌入与 Jina Embeddings v5 Text 模型完全相同。我们的评估表明,这种方法产生的结果与最先进的方法具有竞争力,性能几乎等同于更大的多模态嵌入模型。 所有作者均来自 Jina by Elastic。联系邮箱:[email protected] ††copyright:none††ccs:信息系统 多媒体和多模态检索††ccs:计算方法论 图像表示††ccs:计算方法论 机器学习 ## 1. 引言 纯文本嵌入模型已长期用于检索、检索增强生成(RAG)(Lewis et al., 2020)以及依赖稳定嵌入几何结构的向量索引的分类流水线中。与此同时,搜索工作负载越来越需要能够与文本一起查询图像(包括截图、页面扫描、信息图和其他渲染媒体)、音频(如语音、音乐和自然声音)以及视频。(Xiao et al., 2025b; Macé et al., 2025; Jiang et al., 2025; El Assadi et al., 2026) > 图1. 多模态嵌入任务中的平均性能与模型参数数量的关系(见表1)。一张单列前沿图,展示了六个开源全模态模型的平均得分:jina-v5-omni-nano, jina-v5-omni-small, LanguageBind, LCO-3B, LCO-7B 和 Nem-3B。 > > 图2. **jina-embeddings-v5-omni** 的架构(图中展示的是 jina-embeddings-v5-omni-small;jina-embeddings-v5-omni-nano 使用较小的 ViT 和 LLaVA 风格的标记)。冻结的塔通过可训练的模态投影器输入到冻结的文本骨干网中;特定任务的导出选择一组投影器/分隔符以及匹配的 LoRA 适配器。 我们提出 **jina-embeddings-v5-omni**,这是一对模型,它在保留文本输入模型完全不变的情况下,将文本嵌入骨干扩展到图像、视频和音频。这两个模型在规模上差异显著:**jina-embeddings-v5-omni-nano** 基于 **jina-embeddings-v5-text-nano**,其基础纯文本模型拥有 0.24B 参数;**jina-embeddings-v5-omni-small** 基于 **jina-embeddings-v5-text-small**,拥有 0.67B 参数。(Akram et al., 2026)这两个基础模型已经针对高性能文本嵌入进行了训练,并使用 LoRA 适配器针对检索、文本匹配、聚类和分类等多项任务进行了优化。 为了支持非文本模态,我们集成了: - 来自 Qwen3.5-2B 和 Qwen3.65-0.8 的视觉编码器(Qwen Team, 2026),它们分别从 SigLIP2 So400m 和 SigLIP2 Base 改编而来。(Tschannen et al., 2025) - Qwen2.5-Omni 音频编码器(Chu et al., 2025),它改编自 Whisper-large-v3。(Radford et al., 2023) **冻结编码器模型组合**的核心思想是使用独立预训练、语言对齐的编码器,并通过小型可训练投影器将它们与文本嵌入模型对齐,而不是对它们进行联合重新训练。这使得能够轻松地构建模块化的多模态嵌入模型,同时最小化增加的参数和额外的训练开销。 ##### 贡献。 1. 我们描述了**冻结编码器模型组合**,并通过扩展 Jina Embeddings v5 Text 套件以支持其他媒体,将其应用于 **jina-embeddings-v5-omni** 模型套件的建设中。 2. 我们发布了 **jina-embeddings-v5-omni** 模型集合[^1],为开放嵌入生态系统做出贡献,该集合包含两个基础模型以及八个针对检索、分类、聚类和文本匹配的特定任务变体,涵盖 Small 和 Nano 规模。 3. 我们在一系列标准基准上评估了 **jina-embeddings-v5-omni** 及可比模型,并证明我们的方法产生了具有竞争力的结果。(见图1。) 4. 我们通过针对投影器训练、编码器选择和 Matryoshka 截断的消融实验,分析了该方案背后的设计规则,并单独量化了训练效率。 ## 2. 相关工作 纯文本嵌入模型长期以来已用于检索和 RAG 系统,从双向编码器如 Sentence-BERT(Reimers and Gurevych, 2019)和 GTE-Qwen2(Alibaba Tongyi Lab, 2024)到基于 LLM 的纯文本嵌入模型如 E5-Mistral(Wang et al., 2024b)和 NV-Embed(Lee et al., 2025)。Jina Embeddings v5 Text(Akram et al., 2026)承袭了这一传统:这是一个最先进的模型家族,具有任务条件化的 LoRA 适配器,并得益于 Matryoshka 表示学习(Kusupati et al., 2022)支持以较低性能损失进行截断。 CLIP(Radford et al., 2021)确立了具有独立编码图像和文本塔的对比式图像-文本嵌入,SigLIP(Zhai et al., 2023)、SigLIP2(Tschannen et al., 2025)和 EVA-CLIP(Fang et al., 2023)通过改进的损失函数、数据和视觉训练配方进一步完善了这一范式。ImageBind(Girdhar et al., 2023)将对比对齐扩展到其他模态。Jina CLIP v1/v2(Koukounas et al., 2024b, a)在 CLIP 风格模型中保持了文本嵌入性能,同时支持其他媒体。然而,对比训练的多模态嵌入器在共享表示空间的模态特定区域之间存在差距(Liang et al., 2022)。 VLM 风格的架构通过将非文本媒体编码器的输出通过同一语言模型传递(如同文本标记表示)来解决这一挑战。这些模型,包括 LLaVA(Liu et al., 2023)、BLIP-2(Li et al., 2023)、Qwen2-VL(Wang et al., 2024a)和 Qwen3-VL(Bai et al., 2025),使用投影器或连接器模块将编码器连接到语言模型。源自 VLM 的嵌入模型,如 E5-V(Jiang et al., 2024)、GME(Zhang et al., 2025)和 Qwen3-VL-Embedding(Li et al., 2026),展示了强大的多模态检索性能,但涉及对语言模型、非文本媒体编码器或两者进行适配。 Omni 风格的系统联合训练或对齐多种模态,除图像外还支持视频和音频,例如 E5-Omni(Chen et al., 2026)、WAVE(Tang et al., 2026)和 LCO-Embedding-Omni(Xiao et al., 2025a)。 我们注意到先前基于 CLIP 架构的冻结塔方法,如 LiT(Zhai et al., 2022)和 Nomic Embed Vision(Nussbaum et al., 2024),它们冻结文本编码器而适配其他媒体塔。据我们所知,此前没有已发表的工作使用 VLM 风格架构将冻结的文本嵌入模型扩展以支持非文本媒体。 ## 3. 架构 图2总结了 **jina-embeddings-v5-omni** 模型的架构。我们通过添加规模匹配的 Qwen3.5 视觉编码器[^2]和 Qwen2.5-Omni 音频编码器到相同的文本序列骨干,将 Jina Embeddings v5 Text 从纯文本嵌入扩展到视觉和音频。我们选择来自训练有素的多模态语言系统的编码器,而不是像 SigLIP2 或 Whisper-large 这样的裸感知编码器,因为先前的研究表明,视觉和音频特征在可靠转移到文本条件的多模态任务之前,需要显式的语言空间对齐或自然语言监督(Chen et al., 2025; Elizalde et al., 2023; Qwen Team, 2026; Chu et al., 2025)。**jina-embeddings-v5-omni** 的文本处理路径与 Jina Embeddings v5 Text 完全相同:词嵌入通过冻结的文本 Transformer,应用继承的任务 LoRA 适配器,最终嵌入由最后一个 token 池化和 L2 规范化产生。 ### 3.1. 投影器 **jina-embeddings-v5-omni** 分别使用从 Qwen3.5 和 Qwen2.5-Omni 提取的图像和音频编码器。这些编码器产生的输出与 Jina Embeddings v5 Text 的输入维度不匹配。因此,我们用匹配 Jina Embeddings v5 Text 输入规格的投影器替换了它们。对于音频,我们插入了一个随机初始化的 `fc_audio` 层,将编码器的原生 1280 维输出投影到 **jina-embeddings-v5-omni-small** 的 1024 维输入空间和 **jina-embeddings-v5-omni-nano** 的 768 维输入空间。 我们将每个全连接层写为相同的仿射映射 $$ \ell_{W,\mathbf{b}}(\mathbf{x}) = W\mathbf{x} + \mathbf{b} $$ 具有特定层的权重和偏置。因此,`fc_vision_1` 是 $\ell_{W_{\text{v1}},\mathbf{b}_{\text{v1}}}$,`fc_vision_2` 是 $\ell_{W_{\text{v2}},\mathbf{b}_{\text{v2}}}$,`fc_audio` 是 $\ell_{W_{\text{aud}},\mathbf{b}_{\text{aud}}}$。 对于视觉,Qwen3.5 视觉投影器通过应用 LayerNorm、2×2 空间合并、`fc_vision_1`、GELU 和 `fc_vision_2` 将 ViT patch token 转换为文本 token 特征。这里,LayerNorm 表示对 ViT patch token 的特征规范化。2×2 空间合并是一种固定的空间到深度(像素洗牌)重排,它将四个相邻的 patch 嵌入连接成一个 $4d_{\text{vit}}$ 向量,将空间 token 数量减少 4 倍;它是像素洗牌/子像素重排(Shi et al., 2016)的反方向,并遵循 Qwen 的视觉合并器设计(Wang et al., 2024a; Qwen Team, 2026)。对于每组四个相邻的 patch token $\mathbf{V}_i=[\mathbf{v}_{i,1},\dots,\mathbf{v}_{i,4}] \in \mathbb{R}^{4\times d_{\text{vit}}}$,视觉投影器产生 $$ \begin{aligned} \mathbf{m}^{(i)}_{\text{vis}} &= [\text{LayerNorm}(\mathbf{v}_{i,1}); \dots; \text{LayerNorm}(\mathbf{v}_{i,4})] \in \mathbb{R}^{4d_{\text{vit}}}, \\ \mathbf{z}^{(i)}_{\text{vis}} &= \text{GELU}(\ell_{W_{\text{v1}},\mathbf{b}_{\text{v1}}}(\mathbf{m}^{(i)}_{\text{vis}})), \\ \mathbf{h}^{(i)}_{\text{vis}} &= \ell_{W_{\text{v2}},\mathbf{b}_{\text{v2}}}(\mathbf{z}^{(i)}_{\text{vis}}), \quad i=1,\dots,N_{\text{vis}}. \end{aligned} $$ 只有 `fc_vision_2` 执行到文本隐藏空间的具体维度投影:在 2B 源检查点中,它映射 $4096 \to 2048$ 到 Qwen3.5-2B 文本隐藏维度,而在 0.8B 源检查点中,它映射 $3072 \to 1024$ 到 Qwen3.5-0.8B 文本隐藏维度。这些目标与 Small 的 1024 维或 Nano 的 768 维 Jina 文本骨干不匹配,因此我们保持 LayerNorm 和 `fc_vision_1` 冻结,但用随机初始化的 $4096 \to 1024$ 层(针对 Small)和 $3072 \to 768$ 层(针对 Nano)替换 `fc_vision_2`。 令 $\mathbf{A}=[\mathbf{a}_1,\dots,\mathbf{a}_K] \in \mathbb{R}^{K\times 1280}$ 表示具有 $K$ 个音频 token 的输入的冻结 Qwen2.5-Omni 音频编码器状态。每个音频 token 由 `fc_audio` 独立投影到 Jina 文本隐藏维度 $$ \mathbf{h}^{(i)}_{\text{aud}} = \ell_{W_{\text{aud}},\mathbf{b}_{\text{aud}}}(\mathbf{a}_i), \quad i=1,\dots,K, $$ 其中 $W_{\text{aud}} \in \mathbb{R}^{d_{\text{text}}\times 1280}$ 且 $d_{\text{text}} \in \{1024, 768\}$ 分别对应 Small 和 Nano。 ### 3.2. 输入序列构建 每个输入都被序列化为一个 token 序列。文本保持为普通的文本 token;非文本模态由模态分隔符内的占位符运行表示。图像被编码为 $$ \texttt{<|vision\_start|>} \; \underbrace{\texttt{<|image\_pad|>} \times N}_{\text{visual slots}} \; \texttt{<|vision\_end|>} $$ 带有 $N$ 个视觉槽。音频输入被编码为 $$ \texttt{<|audio\_start|>} \; \underbrace{\texttt{<|audio\_pad|>} \times K}_{\text{audio slots}} \; \texttt{<|audio\_end|>} $$ 带有 $K$ 个音频槽。视频是一个视觉... [^1]: Jina Embeddings v5 Omni Hugging Face 集合 (https://huggingface.co/collections/jinaai/jina-embeddings-v5-omni-69f336b985c156b1d757029e) [^2]: jina-embeddings-v5-omni-small 使用 Qwen/Qwen3.5-2B;jina-embeddings-v5-omni-nano 使用 Qwen/Qwen3.5-0.8B。
相似文章
@JinaAI_: jina-embeddings-v5-omni 正式发布!我们首个支持文本、图像、音频和视频的通用嵌入模型。现已在 t…
Jina AI 发布了 jina-embeddings-v5-omni,这是一款支持文本、图像、音频和视频的通用嵌入模型,具备向后兼容的索引功能。
@berryxia: 兄弟们!Jina 今天直来了个大 的! Jina-embeddings-v5-omni 来了! 这是他们首个真正支持 text + image + audio + video 的统一 Embedding 模型!(多模态的EMB~!) 两个…
Jina 发布了首个支持文本、图像、音频和视频的统一多模态嵌入模型 Jina-embeddings-v5-omni。该模型提供 Small 和 Nano 两个版本,向后兼容原有索引且性能强劲,已上线 Hugging Face 及 Jina API。
Fusion Embedding:文本、图像、视频与音频的统一嵌入空间
Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。
zsxkib/jina-clip-v2
Jina CLIP v2 是一个改进的多模态嵌入模型,支持 89 种语言、高分辨率图像和灵活的嵌入维度,性能比 v1 提升 3%,在多语言基准测试上达到最先进水平。
使用 Sentence Transformers 的多模态 Embedding 与 Reranker 模型
Sentence Transformers v5.4 引入了对多模态嵌入和重排序的支持,允许用户使用统一的 API 对文本、图像、音频和视频进行编码和比较。