andreasjansson/clip-features
Summary
A model on Replicate that outputs CLIP ViT-L/14 features for text and images, allowing similarity computation between inputs.
View Cached Full Text
Cached at: 05/08/26, 06:25 AM
Similar Articles
krthr/clip-embeddings
A CLIP-based embedding model hosted on Replicate that generates 768-dimensional embeddings for both images and text using the clip-vit-large-patch14 architecture, costing ~$0.00022 per run.
CLIP: Connecting text and images
CLIP is OpenAI's vision-language model that learns from text-image pairs from the internet, enabling zero-shot visual classification without task-specific training data. It addresses major limitations in traditional computer vision by reducing dependence on expensive labeled datasets and improving real-world generalization.
zsxkib/jina-clip-v2
Jina CLIP v2 is an improved multimodal embedding model supporting 89 languages, high-resolution images, and flexible embedding dimensions, with 3% better performance than v1 and state-of-the-art results on multilingual benchmarks.
openai/clip-vit-base-patch32
This is a model card for OpenAI's CLIP model, detailing its Vision Transformer architecture, zero-shot image classification capabilities, and intended use for research purposes.
noah-bjorner/dinov3-vit-large-distilled
Deployment of Meta's DINOv3 ViT-L/16 distilled model on Replicate, providing efficient visual embeddings for tasks like similarity search and retrieval.