zsxkib/jina-clip-v2
摘要
Jina CLIP v2 是一个改进的多模态嵌入模型,支持 89 种语言、高分辨率图像和灵活的嵌入维度,性能比 v1 提升 3%,在多语言基准测试上达到最先进水平。
zsxkib / jina-clip-v2
查看缓存全文
缓存时间: 2026/07/21 09:26
# zsxkib/jina-clip-v2 – Replicate
来源:https://replicate.com/zsxkib/jina-clip-v2
## 运行时间与费用
此模型在 Replicate 上运行大约花费 $0.0022,即每 $1 可运行约 454 次,但费用会根据输入内容有所变化。该模型为开源,您也可以使用 Docker 在本地运行(https://replicate.com/zsxkib/jina-clip-v2/api)。
此模型运行于 Nvidia T4 GPU 硬件(https://replicate.com/docs/billing)上。预测通常在 10 秒内完成。
## 说明
一个强大的多语言多模态嵌入模型,能够理解 89 种语言的文本和图像。
## 功能
- 从文本、图像或两者同时生成嵌入(数值化表示)
- 支持 89 种语言的文本输入
- 处理高分辨率图像(512x512)
- 可调节嵌入维度从 64 到 1024(Matryoshka 特性)
## 亮点
- **多语言**:支持 89 种语言,真正实现全球化
- **高分辨率**:更好地理解图像细节(512x512 对比常见的 224x224)
- **灵活的尺寸**:可在保持较强性能的同时减小嵌入大小
- **双重用途**:可单独处理文本、单独处理图像,或同时处理两者
## 行为
- 仅输入文本:返回一个文本嵌入
- 仅输入图像:返回一个图像嵌入
- 同时输入两者:返回两个嵌入 [text_embedding, image_embedding]
## 性能
- 相比 v1 在文本-图像和文本-文本检索上提升 3%
- 在多项基准测试中达到当前最优水平
- 即使降至 64 维(缩小 94%),仍保持超过 90% 的完整性能
## 最佳适用场景
- 跨语言图像搜索
- 语义图像理解
- 文本-图像相似度匹配
- 多语言文档检索
- 构建多模态 AI 应用
## 模型大小
- 总大小:0.9B 参数
- 文本编码器:561M 参数
- 图像编码器:304M 参数
### 输出
按照您选择的格式和维度返回嵌入:
- 文本输入 → 文本嵌入
- 图像输入 → 图像嵌入
### 性能与规格
- 模型大小:0.9B 参数(561M 文本 + 304M 图像)
- 质量:
- 比上一版本提升 3%
- 即使降至 64 维,准确率仍超过 90%
- 在多语言基准测试中达到当前最优水平
### 理想用例
- 全球图像搜索系统
- 跨语言文档匹配
- 视觉语义产品搜索
- 内容推荐
- AI 训练数据集
## 许可证
非商业用途遵循 CC BY-NC 4.0 许可。商业许可可通过 Jina AI 获取。
## 引用
``
@misc{2405.20204,
Author = {Andreas Koukounas and Georgios Mastrapas and Michael Günther and Bo Wang and Scott Martens and Isabelle Mohr and Saba Sturua and Mohammad Kalim Akram and Joan Fontanals Martínez and Saahil Ognawala and Susana Guzman and Maximilian Werk and Nan Wang and Han Xiao},
Title = {Jina CLIP: Your CLIP Model Is Also Your Text Retriever},
Year = {2024},
Eprint = {arXiv:2405.20204},
}
``
---
关注我的 Twitter/X(https://x.com/zsakib_)
模型创建于 1 年多前
相似文章
krthr/clip-embeddings
一个托管在 Replicate 上的基于 CLIP 的嵌入模型,使用 clip-vit-large-patch14 架构为图像和文本生成 768 维嵌入向量,每次运行费用约为 $0.00022。
@JinaAI_: jina-embeddings-v5-omni 正式发布!我们首个支持文本、图像、音频和视频的通用嵌入模型。现已在 t…
Jina AI 发布了 jina-embeddings-v5-omni,这是一款支持文本、图像、音频和视频的通用嵌入模型,具备向后兼容的索引功能。
@berryxia: 兄弟们!Jina 今天直来了个大 的! Jina-embeddings-v5-omni 来了! 这是他们首个真正支持 text + image + audio + video 的统一 Embedding 模型!(多模态的EMB~!) 两个…
Jina 发布了首个支持文本、图像、音频和视频的统一多模态嵌入模型 Jina-embeddings-v5-omni。该模型提供 Small 和 Nano 两个版本,向后兼容原有索引且性能强劲,已上线 Hugging Face 及 Jina API。
CLIP:连接文本与图像
CLIP 是 OpenAI 的视觉语言模型,从互联网上的文本-图像对中学习,实现零样本视觉分类,无需任务特定的训练数据。它通过减少对昂贵标注数据集的依赖并提高现实世界泛化能力,解决了传统计算机视觉的主要局限性。
jina-embeddings-v5-omni:通过冻结塔组合实现文本几何保持的多模态嵌入
本文介绍了 jina-embeddings-v5-omni,这是一套多模态嵌入模型,通过冻结塔组合技术将文本嵌入扩展至图像、音频和视频。该方法仅训练总权重的 0.35%,在保持文本几何结构的同时,以显著降低的计算成本实现了极具竞争力的最先进性能。