krthr/clip-embeddings
摘要
一个托管在 Replicate 上的基于 CLIP 的嵌入模型,使用 clip-vit-large-patch14 架构为图像和文本生成 768 维嵌入向量,每次运行费用约为 $0.00022。
krthr / clip-embeddings
查看缓存全文
缓存时间: 2026/05/09 06:25
# 在 Replicate 上使用 CLIP 进行图像和文本嵌入
来源:https://replicate.com/krthr/clip-embeddings
## 运行时间与费用
该模型在 Replicate 上每次运行费用约为 $0.00022,即每 $1 可运行 4545 次,但具体费用会因输入内容而有所不同。该模型同时也是开源的,你可以[使用 Docker 在自己的电脑上运行它](https://replicate.com/krthr/clip-embeddings/api)。
该模型运行在 [Nvidia T4 GPU 硬件](https://replicate.com/docs/billing)上。预测通常在 1 秒内完成。
## 说明
使用 CLIP 获取文本和图像嵌入向量。
### 详细信息
- 使用的模型:`clip-vit-large-patch14`
- 嵌入向量长度:`768`
### 响应格式
```
{
"embedding": [0.1, 0.2, ..., 0.5]
}
```
模型创建于 1 年前
相似文章
andreasjansson/clip-features
一个在Replicate上的模型,输出文本和图像的CLIP ViT-L/14特征,支持输入间的相似度计算。
zsxkib/jina-clip-v2
Jina CLIP v2 是一个改进的多模态嵌入模型,支持 89 种语言、高分辨率图像和灵活的嵌入维度,性能比 v1 提升 3%,在多语言基准测试上达到最先进水平。
beautyyuyanli/multilingual-e5-large
多语言 E5-large 嵌入模型现已上线 Replicate,单次运行约 0.00098 美元,在 Nvidia L40S 上约 1 秒完成。
CLIP:连接文本与图像
CLIP 是 OpenAI 的视觉语言模型,从互联网上的文本-图像对中学习,实现零样本视觉分类,无需任务特定的训练数据。它通过减少对昂贵标注数据集的依赖并提高现实世界泛化能力,解决了传统计算机视觉的主要局限性。
zsxkib/embedding-gemma-300m
zsxkib/embedding-gemma-300m 是 Google 的 EmbeddingGemma-300M 模型在 Replicate 上的部署,用于生成 768 维文本嵌入,通过 Matryoshka 表示学习支持灵活的输出维度。