UEmbed:统一稀疏与稠密多模态嵌入

Hugging Face Daily Papers 论文

摘要

UEmbed 是一个仅解码器的多模态嵌入模型,能够在一次前向传播中同时生成稀疏和稠密表示,已发布 2B、4B 和 9B 三种规模。它在 MMEB-v2 上优于现有基于公开数据训练的多模态嵌入模型,并在 BEIR 上保持竞争力。

稀疏检索支撑着现代搜索系统,从网页搜索到检索增强生成。已有工作引入了学习式稀疏检索(LSR),以超越精确词法匹配,走向更丰富的语义。然而,LSR 迄今仍局限于编码器风格的双向架构,其在多模态场景下的扩展也严重依赖辅助的跨模态模块。为解决这些局限,我们提出了 UEmbed(统一嵌入),一个仅解码器的多模态嵌入模型,能够在一次因果前向传播中同时生成稀疏词法和稠密表示。UEmbed 向输入追加 N 个可学习的特殊 token,并将词表划分为 N 个不相交的子集。每个 token 的因果隐藏状态为其分配的子集预测稀疏权重,然后将这 N 个子集拼接成完整的稀疏向量。基于公开数据训练,我们发布了 2B、4B 和 9B 三种规模的 UEmbed。UEmbed-9B 在 MMEB-v2 上达到 71.8(稠密)和 71.0(稀疏),优于基于公开数据训练的多模态嵌入模型(例如 RzenEmbed)。在 BEIR 上,UEmbed 也能与强稠密和稀疏基线保持竞争力。此外,我们从三个维度展示了 UEmbed 的实际效用:有效性、效率和智能体应用。总体而言,UEmbed 提供了一种新范式:它将稠密和稀疏嵌入统一于一个模型,同时进一步扩展稀疏检索以统一文本和多模态输入。
查看原文
查看缓存全文

缓存时间: 2026/08/04 05:37

论文页面 - UEmbed:统一稀疏与稠密多模态嵌入

来源:https://huggingface.co/papers/2608.02583

摘要

稀疏检索是现代搜索系统的基础,从网页搜索到检索增强生成(retrieval-augmented generation)都是如此。现有工作已引入学习型稀疏检索(Learned Sparse Retrieval, LSR),以超越精确词汇匹配,实现更丰富的语义。然而,LSR 至今仍局限于编码器风格的双向架构,其向多模态设置的扩展也仍严重依赖辅助的跨模态模块。为解决这些局限,我们提出了 UEmbed(Unified Embedding),一种仅解码器的多模态嵌入模型,可在一次因果前向传播中同时产生稀疏词法表示和稠密表示。UEmbed 向输入附加 N 个可学习的特殊 token,并将词汇表划分为 N 个不相交的子集。每个 token 的因果隐藏状态对其分配的子集预测稀疏权重,然后将 N 个子集拼接成完整的稀疏向量。我们在公开数据上训练,并发布了 2B、4B 和 9B 三种规模的 UEmbed。UEmbed-9B 在 MMEB-v2 上达到 71.8(稠密)和 71.0(稀疏),优于在公开可用数据上训练的多模态嵌入模型(如 RzenEmbed)。在 BEIR 上,UEmbed 也与强稠密和稀疏基线保持竞争力。此外,我们从三个维度展示了 UEmbed 的实际效用:有效性、效率和智能体应用。总体而言,UEmbed 提供了一种新范式:它在单一模型中统一了稠密和稀疏嵌入,同时进一步将稀疏检索扩展为统一文本和多模态输入。

查看 arXiv 页面 (https://arxiv.org/abs/2608.02583) · 查看 PDF (https://arxiv.org/pdf/2608.02583) · 项目页面 (https://alibaba-nlp.github.io/UEmbed/) · GitHub2 (https://github.com/Alibaba-NLP/UEmbed) · 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02583)

在您的 agent 中获取这篇论文:

hf papers read 2608\.02583

没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型3

Alibaba-NLP/UEmbed-9B 特征提取 • 8B • 更新于约2小时前 • 4 (https://huggingface.co/Alibaba-NLP/UEmbed-9B)

Alibaba-NLP/UEmbed-2B 特征提取 • 2B • 更新于约2小时前 • 2 (https://huggingface.co/Alibaba-NLP/UEmbed-2B)

Alibaba-NLP/UEmbed-4B 特征提取 • 5B • 更新于约2小时前 • 1 (https://huggingface.co/Alibaba-NLP/UEmbed-4B)

引用此论文的数据集0

没有链接此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2608.02583 即可从此页面链接它。

引用此论文的 Spaces 0

没有链接此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2608.02583 即可从此页面链接它。

包含此论文的收藏集1

相似文章

WeMM-Embedding: WeChat 多模态嵌入技术报告

Hugging Face Daily Papers

WeMM-Embedding 是由腾讯开发的通用多模态嵌入模型系列,在微信应用的检索和推荐任务中达到了最先进的性能,公开发布了 2B、4B 和 9B 参数的变体。

tencent/WeMM-Embedding 9B/4B/2B

Reddit r/LocalLLaMA

腾讯推出 WeMM-Embedding,这是一系列基于 Qwen3.5 构建的通用多模态嵌入模型,提供 9B、4B 和 2B 尺寸,支持文本、图像、视频和视觉文档的嵌入生成。

Douyin多模态嵌入模型技术报告

Hugging Face Daily Papers

本技术报告介绍了Douyin多模态嵌入(DME),这是一个两阶段训练的模型,结合了对比预训练与基于证据的潜在推理和交叉条件重构,在MMEB-v2上取得了最先进的结果,并已部署于Douyin搜索。