zsxkib/jina-clip-v2

Replicate Explore 模型

摘要

Jina CLIP v2 是一个改进的多模态嵌入模型,支持 89 种语言、高分辨率图像和灵活的嵌入维度,性能比 v1 提升 3%,在多语言基准测试上达到最先进水平。

zsxkib / jina-clip-v2
查看原文
查看缓存全文

缓存时间: 2026/07/21 09:26

# zsxkib/jina-clip-v2 – Replicate 来源:https://replicate.com/zsxkib/jina-clip-v2 ## 运行时间与费用 此模型在 Replicate 上运行大约花费 $0.0022,即每 $1 可运行约 454 次,但费用会根据输入内容有所变化。该模型为开源,您也可以使用 Docker 在本地运行(https://replicate.com/zsxkib/jina-clip-v2/api)。 此模型运行于 Nvidia T4 GPU 硬件(https://replicate.com/docs/billing)上。预测通常在 10 秒内完成。 ## 说明 一个强大的多语言多模态嵌入模型,能够理解 89 种语言的文本和图像。 ## 功能 - 从文本、图像或两者同时生成嵌入(数值化表示) - 支持 89 种语言的文本输入 - 处理高分辨率图像(512x512) - 可调节嵌入维度从 64 到 1024(Matryoshka 特性) ## 亮点 - **多语言**:支持 89 种语言,真正实现全球化 - **高分辨率**:更好地理解图像细节(512x512 对比常见的 224x224) - **灵活的尺寸**:可在保持较强性能的同时减小嵌入大小 - **双重用途**:可单独处理文本、单独处理图像,或同时处理两者 ## 行为 - 仅输入文本:返回一个文本嵌入 - 仅输入图像:返回一个图像嵌入 - 同时输入两者:返回两个嵌入 [text_embedding, image_embedding] ## 性能 - 相比 v1 在文本-图像和文本-文本检索上提升 3% - 在多项基准测试中达到当前最优水平 - 即使降至 64 维(缩小 94%),仍保持超过 90% 的完整性能 ## 最佳适用场景 - 跨语言图像搜索 - 语义图像理解 - 文本-图像相似度匹配 - 多语言文档检索 - 构建多模态 AI 应用 ## 模型大小 - 总大小:0.9B 参数 - 文本编码器:561M 参数 - 图像编码器:304M 参数 ### 输出 按照您选择的格式和维度返回嵌入: - 文本输入 → 文本嵌入 - 图像输入 → 图像嵌入 ### 性能与规格 - 模型大小:0.9B 参数(561M 文本 + 304M 图像) - 质量: - 比上一版本提升 3% - 即使降至 64 维,准确率仍超过 90% - 在多语言基准测试中达到当前最优水平 ### 理想用例 - 全球图像搜索系统 - 跨语言文档匹配 - 视觉语义产品搜索 - 内容推荐 - AI 训练数据集 ## 许可证 非商业用途遵循 CC BY-NC 4.0 许可。商业许可可通过 Jina AI 获取。 ## 引用 `` @misc{2405.20204, Author = {Andreas Koukounas and Georgios Mastrapas and Michael Günther and Bo Wang and Scott Martens and Isabelle Mohr and Saba Sturua and Mohammad Kalim Akram and Joan Fontanals Martínez and Saahil Ognawala and Susana Guzman and Maximilian Werk and Nan Wang and Han Xiao}, Title = {Jina CLIP: Your CLIP Model Is Also Your Text Retriever}, Year = {2024}, Eprint = {arXiv:2405.20204}, } `` --- 关注我的 Twitter/X(https://x.com/zsakib_) 模型创建于 1 年多前

相似文章

krthr/clip-embeddings

Replicate Explore

一个托管在 Replicate 上的基于 CLIP 的嵌入模型,使用 clip-vit-large-patch14 架构为图像和文本生成 768 维嵌入向量,每次运行费用约为 $0.00022。

CLIP:连接文本与图像

OpenAI Blog

CLIP 是 OpenAI 的视觉语言模型,从互联网上的文本-图像对中学习,实现零样本视觉分类,无需任务特定的训练数据。它通过减少对昂贵标注数据集的依赖并提高现实世界泛化能力,解决了传统计算机视觉的主要局限性。