UEmbed:统一稀疏与稠密多模态嵌入
摘要
UEmbed 是一个仅解码器的多模态嵌入模型,能够在一次前向传播中同时生成稀疏和稠密表示,已发布 2B、4B 和 9B 三种规模。它在 MMEB-v2 上优于现有基于公开数据训练的多模态嵌入模型,并在 BEIR 上保持竞争力。
查看缓存全文
缓存时间: 2026/08/04 05:37
论文页面 - UEmbed:统一稀疏与稠密多模态嵌入
来源:https://huggingface.co/papers/2608.02583
摘要
稀疏检索是现代搜索系统的基础,从网页搜索到检索增强生成(retrieval-augmented generation)都是如此。现有工作已引入学习型稀疏检索(Learned Sparse Retrieval, LSR),以超越精确词汇匹配,实现更丰富的语义。然而,LSR 至今仍局限于编码器风格的双向架构,其向多模态设置的扩展也仍严重依赖辅助的跨模态模块。为解决这些局限,我们提出了 UEmbed(Unified Embedding),一种仅解码器的多模态嵌入模型,可在一次因果前向传播中同时产生稀疏词法表示和稠密表示。UEmbed 向输入附加 N 个可学习的特殊 token,并将词汇表划分为 N 个不相交的子集。每个 token 的因果隐藏状态对其分配的子集预测稀疏权重,然后将 N 个子集拼接成完整的稀疏向量。我们在公开数据上训练,并发布了 2B、4B 和 9B 三种规模的 UEmbed。UEmbed-9B 在 MMEB-v2 上达到 71.8(稠密)和 71.0(稀疏),优于在公开可用数据上训练的多模态嵌入模型(如 RzenEmbed)。在 BEIR 上,UEmbed 也与强稠密和稀疏基线保持竞争力。此外,我们从三个维度展示了 UEmbed 的实际效用:有效性、效率和智能体应用。总体而言,UEmbed 提供了一种新范式:它在单一模型中统一了稠密和稀疏嵌入,同时进一步将稀疏检索扩展为统一文本和多模态输入。
查看 arXiv 页面 (https://arxiv.org/abs/2608.02583) · 查看 PDF (https://arxiv.org/pdf/2608.02583) · 项目页面 (https://alibaba-nlp.github.io/UEmbed/) · GitHub2 (https://github.com/Alibaba-NLP/UEmbed) · 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02583)
在您的 agent 中获取这篇论文:
hf papers read 2608\.02583
没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型3
Alibaba-NLP/UEmbed-9B 特征提取 • 8B • 更新于约2小时前 • 4 (https://huggingface.co/Alibaba-NLP/UEmbed-9B)
Alibaba-NLP/UEmbed-2B 特征提取 • 2B • 更新于约2小时前 • 2 (https://huggingface.co/Alibaba-NLP/UEmbed-2B)
Alibaba-NLP/UEmbed-4B 特征提取 • 5B • 更新于约2小时前 • 1 (https://huggingface.co/Alibaba-NLP/UEmbed-4B)
引用此论文的数据集0
没有链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2608.02583 即可从此页面链接它。
引用此论文的 Spaces 0
没有链接此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2608.02583 即可从此页面链接它。
包含此论文的收藏集1
相似文章
UMER:通过配对感知判别推理统一嵌入与排序以实现通用多模态检索
UMER 引入了一个统一的多模态检索框架,通过配对感知判别推理结合嵌入与排序,在 MMEB-V2 基准测试中达到了最先进的性能。
WeMM-Embedding: WeChat 多模态嵌入技术报告
WeMM-Embedding 是由腾讯开发的通用多模态嵌入模型系列,在微信应用的检索和推荐任务中达到了最先进的性能,公开发布了 2B、4B 和 9B 参数的变体。
tencent/WeMM-Embedding 9B/4B/2B
腾讯推出 WeMM-Embedding,这是一系列基于 Qwen3.5 构建的通用多模态嵌入模型,提供 9B、4B 和 2B 尺寸,支持文本、图像、视频和视觉文档的嵌入生成。
Douyin多模态嵌入模型技术报告
本技术报告介绍了Douyin多模态嵌入(DME),这是一个两阶段训练的模型,结合了对比预训练与基于证据的潜在推理和交叉条件重构,在MMEB-v2上取得了最先进的结果,并已部署于Douyin搜索。
NeoMME:一个用于高效微调和推理的单塔多模态原生多语言基础编码器
NeoMME 展示了一系列高效的多模态编码器,采用掩码离散扩散进行预训练,在视觉文档检索和高嵌入压缩方面表现优异,同时在基准测试中超越了更小的模型。