Ovis-Embedding:推动通用全模态嵌入的前沿
摘要
本文介绍了Ovis-Embedding,一种最先进的全模态嵌入模型,它使用共享骨干网络将文本、图像、视频和音频编码到公共表示空间中,在MMEB-v3和MVEB等基准测试上取得了顶级性能。
查看缓存全文
缓存时间: 2026/09/23 03:31
论文页面 - Ovis-Embedding:推动通用全模态嵌入技术的前沿
来源:https://huggingface.co/papers/2609.25165
摘要
本报告介绍了 Ovis-Embedding,这是一族先进的全模态嵌入模型,基于文本、图像、视频和音频的原生集成构建而成。Ovis-Embedding 并非拼接独立的模态处理塔,而是采用共享的多模态主干网络,在统一的表示空间中编码不同模态。具体而言,我们实现了三大关键突破:(1) 原生全模态初始化:采用预训练的 Qwen-omni 模型作为嵌入主干网络,并通过低秩初始化结合对比训练进行适配;(2) 数据中心的全模态训练:构建了涵盖文本、图像、视频、音频及交错多模态数据的广泛高质量语料库。为提高数据效率,我们引入同源采样策略,形成任务一致且包含有信息的批内负样本的数据批次;(3) 嵌入专用训练与推理优化:采用焦点损失函数强调困难样本,并通过基于相似度的嵌入蒸馏技术,从互补专家模型中迁移细粒度的相似性结构。在推理阶段,低秩特征分解实现了维度灵活、性能损失极小的紧凑嵌入表示。实验评估表明,Ovis-Embedding 系列在 MMEB-v3、MMEB-v2、MVEB、MAEB 和 RTEB 上取得了最先进性能,证明了其在文本、图像、视频和音频模态上的有效性。这些结果凸显了统一的全模态训练在克服模态碎片化、推动用于任意到任意检索的通用嵌入模型发展方面的潜力。
查看 arXiv 页面 (https://arxiv.org/abs/2609.25165) 查看 PDF (https://arxiv.org/pdf/2609.25165) GitHub19 (https://github.com/ATH-MaaS/Ovis-Omni-Embedding) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.25165)
通过您的代理获取此论文:
hf papers read 2609\.25165
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.25165 以从本页面链接。
引用本文的数据集 0
没有数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.25165 以从本页面链接。
引用本文的 Space 0
没有 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.25165 以从本页面链接。
包含本文的收藏 0
没有收藏包含此论文
将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
@JinaAI_: jina-embeddings-v5-omni 正式发布!我们首个支持文本、图像、音频和视频的通用嵌入模型。现已在 t…
Jina AI 发布了 jina-embeddings-v5-omni,这是一款支持文本、图像、音频和视频的通用嵌入模型,具备向后兼容的索引功能。
jina-embeddings-v5-omni:通过冻结塔组合实现文本几何保持的多模态嵌入
本文介绍了 jina-embeddings-v5-omni,这是一套多模态嵌入模型,通过冻结塔组合技术将文本嵌入扩展至图像、音频和视频。该方法仅训练总权重的 0.35%,在保持文本几何结构的同时,以显著降低的计算成本实现了极具竞争力的最先进性能。
MVEB:大规模视频嵌入基准
本文介绍了MVEB,一个大规模的视频嵌入基准,涵盖23个任务,发现没有单一模型占据主导地位,并且音频的贡献取决于数据集注释的来源。它整合到MTEB生态系统中,用于统一的多模态评估。
Fusion Embedding:文本、图像、视频与音频的统一嵌入空间
Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。
UEmbed:统一稀疏与稠密多模态嵌入
UEmbed 是一个仅解码器的多模态嵌入模型,能够在一次前向传播中同时生成稀疏和稠密表示,已发布 2B、4B 和 9B 三种规模。它在 MMEB-v2 上优于现有基于公开数据训练的多模态嵌入模型,并在 BEIR 上保持竞争力。