@JinaAI_: jina-embeddings-v5-omni 正式发布!我们首个支持文本、图像、音频和视频的通用嵌入模型。现已在 t…

X AI KOLs Timeline 模型

摘要

Jina AI 发布了 jina-embeddings-v5-omni,这是一款支持文本、图像、音频和视频的通用嵌入模型,具备向后兼容的索引功能。

jina-embeddings-v5-omni 现已发布!这是我们首个支持文本、图像、音频和视频的通用嵌入模型。提供两种尺寸:small(15.7 亿参数,1024 维,32K 上下文)和 nano(9.5 亿参数,768 维,8K 上下文)。两者均支持降至 32 维的 Matryoshka 截断功能。v5-omni 具备向后兼容性:如果您已在使用 jina-embeddings-v5-text-small/nano,现有的文本索引可直接与 v5-omni 配合使用。无需重新索引文本,只需使用 v5-omni 索引您的多模态内容,即可开始搜索图像、音频和视频。
查看原文

相似文章

zsxkib/jina-clip-v2

Replicate Explore

Jina CLIP v2 是一个改进的多模态嵌入模型,支持 89 种语言、高分辨率图像和灵活的嵌入维度,性能比 v1 提升 3%,在多语言基准测试上达到最先进水平。

Fusion Embedding:文本、图像、视频与音频的统一嵌入空间

arXiv cs.CL

Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。