noah-bjorner/dinov3-vit-large-distilled

Replicate Explore 模型

摘要

在Replicate上部署Meta的DINOv3 ViT-L/16蒸馏模型,提供高效的视觉嵌入,用于相似性搜索和检索等任务。

noah-bjorner / dinov3-vit-large-distilled
查看原文
查看缓存全文

缓存时间: 2026/09/13 02:17

# noah-bjorner/dinov3-vit-large-distilled – Replicate 来源:https://replicate.com/noah-bjorner/dinov3-vit-large-distilled ## 运行时间和成本 在 Replicate 上运行此模型大约需要 0.00025 美元,或者每 1 美元可运行 4000 次,但具体成本取决于您的输入。该模型也是开源的,您可以使用 Docker 在自己的计算机上运行(https://replicate.com/noah-bjorner/dinov3-vit-large-distilled/api)。 此模型运行在 Nvidia T4 GPU 硬件上(https://replicate.com/docs/billing)。预测通常在 2 秒内完成。该模型的预测时间根据输入的不同而有显著差异。 ## 说明 这是由 Meta FAIR 开发的 **DINOv3 (ViT-L/16 Distilled)** 的一个部署版本。它是一个在海量 **LVD-1689M** 数据集(16.9 亿张图像)上训练的自监督视觉 Transformer。 此特定模型使用了 **蒸馏版** 权重,在提供接近教师模型(来自 7B 模型)性能的同时,也足够高效,可在标准硬件上运行。 ## 模型详情 - **架构**:ViT-L/16(视觉 Transformer 大型,Patch 尺寸 16) - **参数**:约 3 亿 - **训练目标**:自监督学习(DINOv3) - **训练数据**:LVD-1689M ## 预期用途 此模型计算密集视觉嵌入向量。擅长于: - **视觉相似性搜索**:查找重复或近似重复的图像(例如,区分特定的徽标或商品标签)。 - **图像检索**:基于几何形状和纹理而非仅文本标题来查找相似的图像。 - **特征提取**:为下游分类或聚类任务生成嵌入向量。 ## 使用方法 此模型接受图像作为输入,并返回 **归一化的 CLS Token 嵌入向量**。 ### Python 示例 您可以使用输出向量来计算两张图像之间的余弦相似度。 `` import replicate import numpy as np from numpy.linalg import norm def cosine_similarity(a, b): return np.dot(a, b) / (norm(a) * norm(b)) # 1. 获取图像 A 的嵌入向量 output_a = replicate.run( "your-username/dinov3-vit-large-distilled:version_id", input={"image": open("tag_a.jpg", "rb")} ) # 2. 获取图像 B 的嵌入向量 output_b = replicate.run( "your-username/dinov3-vit-large-distilled:version_id", input={"image": open("tag_b.jpg", "rb")} ) # 3. 比较 score = cosine_similarity(output_a, output_b) print(f"Similarity Score: {score:.4f}") `` ## 归属和许可 此模型是对 Meta 发布的 DINOv3 权重的封装。原作者:Meta 基础人工智能研究实验室(FAIR) 仓库:facebookresearch/dinov3 许可证:此模型的使用需遵守 DINOv3 许可协议。 免责声明:这是一个第三方部署。有关原始源代码和研究论文,请参阅 Meta 官方仓库。 模型创建于 9 个月 1 周前

相似文章

adirik/grounding-dino

Replicate Explore

Grounding DINO 是一个开放词汇的目标检测模型,能够根据文本描述检测任意对象,现已在 Replicate 上可用。

探索视觉嵌入

Hacker News Top

本文通过生成与特定嵌入方向对应的图像,利用梯度优化和增强策略来反转模型,探索了DINOv3视觉嵌入。