WeMM-Embedding: WeChat 多模态嵌入技术报告

Hugging Face Daily Papers 论文

摘要

WeMM-Embedding 是由腾讯开发的通用多模态嵌入模型系列,在微信应用的检索和推荐任务中达到了最先进的性能,公开发布了 2B、4B 和 9B 参数的变体。

通用多模态嵌入正成为现代 AI 系统的核心组成部分,使异构内容能够在共享空间中表示,用于检索、推荐、分类和代理系统等应用。在本报告中,我们介绍了 WeMM-Embedding,这是一个支持文本、图像、视频、视觉文档以及任意交错多模态输入的通用多模态嵌入模型系列,具有灵活的输出维度。该系列包括 2B、4B 和 9B 变体,并经过两个阶段的训练:首先是大规模多模态对齐阶段,随后是使用精选数据、细粒度相关性监督和跨尺度知识转移的优化阶段。在广泛的评估中,WeMM-Embedding 在多个公共基准测试中取得了领先性能。值得注意的是,2B 变体已经在 MMEB-v2 上超越了之前领先的 8B 开源基线,而 9B 变体进一步实现了 80.6 的新最先进的总分。WeMM-Embedding 在微信应用中也展示了强大的实际性能,在 26 个任务的内部基准测试中取得了显著提升,并在 14 个在线 A/B 测试中持续改进。它已在推荐和搜索应用中大规模部署,包括 WeChat Channels、Official Accounts、Moments 和电子商务服务。我们已发布模型权重和代码,以促进未来的研究,地址为 https://github.com/Tencent/WeMM-Embedding。
查看原文
查看缓存全文

缓存时间: 2026/08/26 07:14

论文页面 - WeMM-Embedding:微信多模态嵌入技术报告

来源:https://huggingface.co/papers/2608.24053

摘要

WeMM-Embedding 是一个通用的多模态嵌入模型家族,能在共享空间中对齐文本、图像、视频和交错输入,在公开基准测试和大规模微信应用中实现了最先进的检索与推荐性能。

通用多模态嵌入(https://huggingface.co/papers?q=multimodal%20embeddings)正成为现代人工智能系统的核心组件,能够将异构内容表示在共享空间中,用于检索、推荐、分类和智能体系统等应用。在本报告中,我们介绍了 WeMM-Embedding,这是一族支持文本、图像、视频、视觉文档及任意交错多模态输入的通用多模态嵌入模型(https://huggingface.co/papers?q=universal%20multimodal%20embedding%20models),并提供灵活的输出维度。该模型家族包含 2B、4B 和 9B 三个变体,经过两阶段训练:首先是大规模多模态对齐阶段,随后是使用精选数据、细粒度相关性监督(https://huggingface.co/papers?q=fine-grained%20relevance%20supervision)和跨尺度知识迁移(https://huggingface.co/papers?q=cross-scale%20knowledge%20transfer)进行的精炼阶段。在广泛的评估中,WeMM-Embedding 在多个公开基准测试上取得了领先性能。值得注意的是,2B 变体已在 MMEB-v2(https://huggingface.co/papers?q=MMEB-v2)上超越了此前领先的 8B 开源基线,而 9B 变体更是取得了 80.6 的全新总体最先进分数。WeMM-Embedding 在微信应用中也展现了强大的实际性能,在内部 26 任务基准测试中取得了显著提升,并在 14 项在线 A/B 测试中持续改进。该模型已大规模部署于推荐和搜索应用中,包括微信视频号、公众号、朋友圈和电商服务。我们已发布模型权重和代码以促进未来研究,地址为 https://github.com/Tencent/WeMM-Embedding。

查看 arXiv 页面 (https://arxiv.org/abs/2608.24053)查看 PDF (https://arxiv.org/pdf/2608.24053)GitHub31 (https://github.com/Tencent/WeMM-Embedding)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.24053)

在你的智能体中获取此论文:

hf papers read 2608\.24053

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型3

tencent/WeMM-Embedding-9B 特征提取• 9B• 更新于约 4 小时前 • 40 (https://huggingface.co/tencent/WeMM-Embedding-9B)

tencent/WeMM-Embedding-2B 特征提取• 3B• 更新于约 4 小时前 • 24 (https://huggingface.co/tencent/WeMM-Embedding-2B)

tencent/WeMM-Embedding-4B 特征提取• 5B• 更新于约 4 小时前 • 18 (https://huggingface.co/tencent/WeMM-Embedding-4B)

引用此论文的数据集0

无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.24053 以将其从此页面链接。

引用此论文的空间0

无空间关联此论文

在空间 README.md 中引用 arxiv.org/abs/2608.24053 以将其从此页面链接。

包含此论文的收藏集1

相似文章

tencent/WeMM-Embedding 9B/4B/2B

Reddit r/LocalLLaMA

腾讯推出 WeMM-Embedding,这是一系列基于 Qwen3.5 构建的通用多模态嵌入模型,提供 9B、4B 和 2B 尺寸,支持文本、图像、视频和视觉文档的嵌入生成。

Douyin多模态嵌入模型技术报告

Hugging Face Daily Papers

本技术报告介绍了Douyin多模态嵌入(DME),这是一个两阶段训练的模型,结合了对比预训练与基于证据的潜在推理和交叉条件重构,在MMEB-v2上取得了最先进的结果,并已部署于Douyin搜索。

UEmbed:统一稀疏与稠密多模态嵌入

Hugging Face Daily Papers

UEmbed 是一个仅解码器的多模态嵌入模型,能够在一次前向传播中同时生成稀疏和稠密表示,已发布 2B、4B 和 9B 三种规模。它在 MMEB-v2 上优于现有基于公开数据训练的多模态嵌入模型,并在 BEIR 上保持竞争力。

MVEB:大规模视频嵌入基准

Hugging Face Daily Papers

本文介绍了MVEB,一个大规模的视频嵌入基准,涵盖23个任务,发现没有单一模型占据主导地位,并且音频的贡献取决于数据集注释的来源。它整合到MTEB生态系统中,用于统一的多模态评估。