@JinaAI_: jina-embeddings-v5-omni 正式发布!我们首个支持文本、图像、音频和视频的通用嵌入模型。现已在 t…
摘要
Jina AI 发布了 jina-embeddings-v5-omni,这是一款支持文本、图像、音频和视频的通用嵌入模型,具备向后兼容的索引功能。
jina-embeddings-v5-omni 现已发布!这是我们首个支持文本、图像、音频和视频的通用嵌入模型。提供两种尺寸:small(15.7 亿参数,1024 维,32K 上下文)和 nano(9.5 亿参数,768 维,8K 上下文)。两者均支持降至 32 维的 Matryoshka 截断功能。v5-omni 具备向后兼容性:如果您已在使用 jina-embeddings-v5-text-small/nano,现有的文本索引可直接与 v5-omni 配合使用。无需重新索引文本,只需使用 v5-omni 索引您的多模态内容,即可开始搜索图像、音频和视频。
相似文章
@berryxia: 兄弟们!Jina 今天直来了个大 的! Jina-embeddings-v5-omni 来了! 这是他们首个真正支持 text + image + audio + video 的统一 Embedding 模型!(多模态的EMB~!) 两个…
Jina 发布了首个支持文本、图像、音频和视频的统一多模态嵌入模型 Jina-embeddings-v5-omni。该模型提供 Small 和 Nano 两个版本,向后兼容原有索引且性能强劲,已上线 Hugging Face 及 Jina API。
jina-embeddings-v5-omni:通过冻结塔组合实现文本几何保持的多模态嵌入
本文介绍了 jina-embeddings-v5-omni,这是一套多模态嵌入模型,通过冻结塔组合技术将文本嵌入扩展至图像、音频和视频。该方法仅训练总权重的 0.35%,在保持文本几何结构的同时,以显著降低的计算成本实现了极具竞争力的最先进性能。
zsxkib/jina-clip-v2
Jina CLIP v2 是一个改进的多模态嵌入模型,支持 89 种语言、高分辨率图像和灵活的嵌入维度,性能比 v1 提升 3%,在多语言基准测试上达到最先进水平。
@_philschmid:Gemini Embedding 2 正式发布!一个能理解文本、图像、视频、音频和 PDF 的嵌入模型!5 种模态统一嵌入空间
Google 正式发布 Gemini Embedding 2,单一模型即可将文本、图像、视频、音频和 PDF 嵌入到统一空间,支持 100 多种语言,无需音频转录。
Fusion Embedding:文本、图像、视频与音频的统一嵌入空间
Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。