krthr/clip-embeddings

Replicate Explore 工具

摘要

一个托管在 Replicate 上的基于 CLIP 的嵌入模型,使用 clip-vit-large-patch14 架构为图像和文本生成 768 维嵌入向量,每次运行费用约为 $0.00022。

krthr / clip-embeddings
查看原文
查看缓存全文

缓存时间: 2026/05/09 06:25

# 在 Replicate 上使用 CLIP 进行图像和文本嵌入 来源:https://replicate.com/krthr/clip-embeddings ## 运行时间与费用 该模型在 Replicate 上每次运行费用约为 $0.00022,即每 $1 可运行 4545 次,但具体费用会因输入内容而有所不同。该模型同时也是开源的,你可以[使用 Docker 在自己的电脑上运行它](https://replicate.com/krthr/clip-embeddings/api)。 该模型运行在 [Nvidia T4 GPU 硬件](https://replicate.com/docs/billing)上。预测通常在 1 秒内完成。 ## 说明 使用 CLIP 获取文本和图像嵌入向量。 ### 详细信息 - 使用的模型:`clip-vit-large-patch14` - 嵌入向量长度:`768` ### 响应格式 ``` { "embedding": [0.1, 0.2, ..., 0.5] } ``` 模型创建于 1 年前

相似文章

andreasjansson/clip-features

Replicate Explore

一个在Replicate上的模型,输出文本和图像的CLIP ViT-L/14特征,支持输入间的相似度计算。

zsxkib/jina-clip-v2

Replicate Explore

Jina CLIP v2 是一个改进的多模态嵌入模型,支持 89 种语言、高分辨率图像和灵活的嵌入维度,性能比 v1 提升 3%,在多语言基准测试上达到最先进水平。

beautyyuyanli/multilingual-e5-large

Replicate Explore

多语言 E5-large 嵌入模型现已上线 Replicate,单次运行约 0.00098 美元,在 Nvidia L40S 上约 1 秒完成。

CLIP:连接文本与图像

OpenAI Blog

CLIP 是 OpenAI 的视觉语言模型,从互联网上的文本-图像对中学习,实现零样本视觉分类,无需任务特定的训练数据。它通过减少对昂贵标注数据集的依赖并提高现实世界泛化能力,解决了传统计算机视觉的主要局限性。

zsxkib/embedding-gemma-300m

Replicate Explore

zsxkib/embedding-gemma-300m 是 Google 的 EmbeddingGemma-300M 模型在 Replicate 上的部署,用于生成 768 维文本嵌入,通过 Matryoshka 表示学习支持灵活的输出维度。