tencent/WeMM-Embedding 9B/4B/2B

Reddit r/LocalLLaMA 模型

摘要

腾讯推出 WeMM-Embedding,这是一系列基于 Qwen3.5 构建的通用多模态嵌入模型,提供 9B、4B 和 2B 尺寸,支持文本、图像、视频和视觉文档的嵌入生成。

WeMM-Embedding-9B 是一款基于 Qwen3.5 构建的通用多模态嵌入模型。它接受文本、图像、视频、视觉文档以及交错的多模态输入,并返回一个 4096 维的 L2 归一化嵌入。不支持音频输入。https://huggingface.co/tencent/WeMM-Embedding-9B https://huggingface.co/tencent/WeMM-Embedding-4B https://huggingface.co/tencent/WeMM-Embedding-2B https://github.com/Tencent/WeMM-Embedding/blob/main/assets/WeMM_Embedding_tech_report.pdf
查看原文

相似文章

Nemotron-3-Embed 1B/8B

Reddit r/LocalLLaMA

NVIDIA 发布了 Nemotron-3-Embed 1B 和 8B 模型,这是最先进的多语言文本嵌入模型,用于检索和语义相似度,针对 RAG 系统进行了优化。

UEmbed:统一稀疏与稠密多模态嵌入

Hugging Face Daily Papers

UEmbed 是一个仅解码器的多模态嵌入模型,能够在一次前向传播中同时生成稀疏和稠密表示,已发布 2B、4B 和 9B 三种规模。它在 MMEB-v2 上优于现有基于公开数据训练的多模态嵌入模型,并在 BEIR 上保持竞争力。

Qwen3.7预览版登陆Arena(1分钟阅读)

TLDR AI

阿里巴巴Qwen宣布两大重要模型发布:Qwen3-Omni,首个原生端到端全模态AI,统一处理文本、图像、音频和视频;以及Qwen3-Next-80B-A3B,一款超高效MoE模型,每个token激活30亿参数,实现了SOTA性能,推理速度比Qwen3-32B快10倍。

tencent/EVIE-Preview-4.5B · Hugging Face

Reddit r/LocalLLaMA

EVIE-Preview-4.5B 是一款来自Tencent的最先进的多语言视觉文档检索模型,采用ColBERT风格的晚期交互,在ViDoRe基准测试中表现领先,使用128维的token嵌入。

Qwen3.8-27B

Hacker News Top

Qwen 发布了 Qwen3.8-27B 的开源权重,这是一个原生多模态稠密模型,拥有 27B 参数,整体性能超越 Qwen3.7-Plus,支持 262K 原生上下文并可扩展至 1M,采用 Apache 2.0 许可。