Ovis-Embedding:推动通用全模态嵌入的前沿

Hugging Face Daily Papers 论文

摘要

本文介绍了Ovis-Embedding,一种最先进的全模态嵌入模型,它使用共享骨干网络将文本、图像、视频和音频编码到公共表示空间中,在MMEB-v3和MVEB等基准测试上取得了顶级性能。

在本报告中,我们介绍了Ovis-Embedding,一个建立在文本、图像、视频和音频原生集成基础上的最先进全模态嵌入家族。Ovis-Embedding没有组装单独的模态塔,而是使用共享的多模态骨干网络在公共表示空间中编码不同模态。具体来说,我们实现了三个关键进展:(1) 原生全模态初始化:我们采用预训练的Qwen-omni模型作为嵌入骨干网络,并通过低秩初始化对比训练对其进行适配;(2) 以数据为中心的全模态训练:我们构建了一个涵盖文本、图像、视频、音频和交错多模态数据的广泛、高质量语料库。为提高数据效率,我们引入同源采样来形成任务一致的批次,其中包含信息丰富的批内负样本;(3) 嵌入特定的训练和推理优化:我们使用焦点损失来强调困难样本,并通过基于相似性的嵌入蒸馏从互补专家中转移细粒度相似性结构。在推理时,低秩特征分解能够实现紧凑的嵌入,具有灵活的维度和最小的性能损失。实证评估表明,Ovis-Embedding家族在MMEB-v3、MMEB-v2、MVEB、MAEB和RTEB上取得了最先进的性能,证明了其在文本、图像、视频和音频模态上的有效性。这些结果突出了统一全模态训练在克服模态碎片化并推进用于任意到任意检索的通用嵌入模型方面的潜力。
查看原文
查看缓存全文

缓存时间: 2026/09/23 03:31

论文页面 - Ovis-Embedding:推动通用全模态嵌入技术的前沿

来源:https://huggingface.co/papers/2609.25165

摘要

本报告介绍了 Ovis-Embedding,这是一族先进的全模态嵌入模型,基于文本、图像、视频和音频的原生集成构建而成。Ovis-Embedding 并非拼接独立的模态处理塔,而是采用共享的多模态主干网络,在统一的表示空间中编码不同模态。具体而言,我们实现了三大关键突破:(1) 原生全模态初始化:采用预训练的 Qwen-omni 模型作为嵌入主干网络,并通过低秩初始化结合对比训练进行适配;(2) 数据中心的全模态训练:构建了涵盖文本、图像、视频、音频及交错多模态数据的广泛高质量语料库。为提高数据效率,我们引入同源采样策略,形成任务一致且包含有信息的批内负样本的数据批次;(3) 嵌入专用训练与推理优化:采用焦点损失函数强调困难样本,并通过基于相似度的嵌入蒸馏技术,从互补专家模型中迁移细粒度的相似性结构。在推理阶段,低秩特征分解实现了维度灵活、性能损失极小的紧凑嵌入表示。实验评估表明,Ovis-Embedding 系列在 MMEB-v3、MMEB-v2、MVEB、MAEB 和 RTEB 上取得了最先进性能,证明了其在文本、图像、视频和音频模态上的有效性。这些结果凸显了统一的全模态训练在克服模态碎片化、推动用于任意到任意检索的通用嵌入模型发展方面的潜力。

查看 arXiv 页面 (https://arxiv.org/abs/2609.25165) 查看 PDF (https://arxiv.org/pdf/2609.25165) GitHub19 (https://github.com/ATH-MaaS/Ovis-Omni-Embedding) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.25165)

通过您的代理获取此论文:

hf papers read 2609\.25165

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.25165 以从本页面链接。

引用本文的数据集 0

没有数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.25165 以从本页面链接。

引用本文的 Space 0

没有 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.25165 以从本页面链接。

包含本文的收藏 0

没有收藏包含此论文

将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

MVEB:大规模视频嵌入基准

Hugging Face Daily Papers

本文介绍了MVEB,一个大规模的视频嵌入基准,涵盖23个任务,发现没有单一模型占据主导地位,并且音频的贡献取决于数据集注释的来源。它整合到MTEB生态系统中,用于统一的多模态评估。

Fusion Embedding:文本、图像、视频与音频的统一嵌入空间

arXiv cs.CL

Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。

UEmbed:统一稀疏与稠密多模态嵌入

Hugging Face Daily Papers

UEmbed 是一个仅解码器的多模态嵌入模型,能够在一次前向传播中同时生成稀疏和稠密表示,已发布 2B、4B 和 9B 三种规模。它在 MMEB-v2 上优于现有基于公开数据训练的多模态嵌入模型,并在 BEIR 上保持竞争力。