@berryxia: 兄弟们!Jina 今天直来了个大 的! Jina-embeddings-v5-omni 来了! 这是他们首个真正支持 text + image + audio + video 的统一 Embedding 模型!(多模态的EMB~!) 两个…
摘要
Jina 发布了首个支持文本、图像、音频和视频的统一多模态嵌入模型 Jina-embeddings-v5-omni。该模型提供 Small 和 Nano 两个版本,向后兼容原有索引且性能强劲,已上线 Hugging Face 及 Jina API。
兄弟们!Jina 今天直来了个大 的! Jina-embeddings-v5-omni 来了! 这是他们首个真正支持 text + image + audio + video 的统一 Embedding 模型!(多模态的EMB~!) 两个尺寸: Small(1.57B,1024维,32K 上下文) Nano(0.95B,768维,8K 上下文) 还支持 Matryoshka 截断到 32 维,超级灵活。 最爽的是完全向后兼容:你原来的 v5-text 索引不用动,直接换成 omni 就能开始搜图片、音频、视频了!同一向量空间,无需 reindexing。 性能也很猛,小模型就打平甚至超越好几个参数量大几倍的开源模型。 现在已经在 Hugging Face、Jina API、Elastic Inference Service 上架了。 这波多模态 embedding 真的要爽了兄弟们! 你们已经在做多模态 RAG 或者多媒体搜索了吗?
相似文章
@JinaAI_: jina-embeddings-v5-omni 正式发布!我们首个支持文本、图像、音频和视频的通用嵌入模型。现已在 t…
Jina AI 发布了 jina-embeddings-v5-omni,这是一款支持文本、图像、音频和视频的通用嵌入模型,具备向后兼容的索引功能。
jina-embeddings-v5-omni:通过冻结塔组合实现文本几何保持的多模态嵌入
本文介绍了 jina-embeddings-v5-omni,这是一套多模态嵌入模型,通过冻结塔组合技术将文本嵌入扩展至图像、音频和视频。该方法仅训练总权重的 0.35%,在保持文本几何结构的同时,以显著降低的计算成本实现了极具竞争力的最先进性能。
zsxkib/jina-clip-v2
Jina CLIP v2 是一个改进的多模态嵌入模型,支持 89 种语言、高分辨率图像和灵活的嵌入维度,性能比 v1 提升 3%,在多语言基准测试上达到最先进水平。
@_philschmid:Gemini Embedding 2 正式发布!一个能理解文本、图像、视频、音频和 PDF 的嵌入模型!5 种模态统一嵌入空间
Google 正式发布 Gemini Embedding 2,单一模型即可将文本、图像、视频、音频和 PDF 嵌入到统一空间,支持 100 多种语言,无需音频转录。
tencent/WeMM-Embedding 9B/4B/2B
腾讯推出 WeMM-Embedding,这是一系列基于 Qwen3.5 构建的通用多模态嵌入模型,提供 9B、4B 和 2B 尺寸,支持文本、图像、视频和视觉文档的嵌入生成。