noah-bjorner/dinov3-vit-large-distilled
摘要
在Replicate上部署Meta的DINOv3 ViT-L/16蒸馏模型,提供高效的视觉嵌入,用于相似性搜索和检索等任务。
noah-bjorner / dinov3-vit-large-distilled
查看缓存全文
缓存时间: 2026/09/13 02:17
# noah-bjorner/dinov3-vit-large-distilled – Replicate
来源:https://replicate.com/noah-bjorner/dinov3-vit-large-distilled
## 运行时间和成本
在 Replicate 上运行此模型大约需要 0.00025 美元,或者每 1 美元可运行 4000 次,但具体成本取决于您的输入。该模型也是开源的,您可以使用 Docker 在自己的计算机上运行(https://replicate.com/noah-bjorner/dinov3-vit-large-distilled/api)。
此模型运行在 Nvidia T4 GPU 硬件上(https://replicate.com/docs/billing)。预测通常在 2 秒内完成。该模型的预测时间根据输入的不同而有显著差异。
## 说明
这是由 Meta FAIR 开发的 **DINOv3 (ViT-L/16 Distilled)** 的一个部署版本。它是一个在海量 **LVD-1689M** 数据集(16.9 亿张图像)上训练的自监督视觉 Transformer。
此特定模型使用了 **蒸馏版** 权重,在提供接近教师模型(来自 7B 模型)性能的同时,也足够高效,可在标准硬件上运行。
## 模型详情
- **架构**:ViT-L/16(视觉 Transformer 大型,Patch 尺寸 16)
- **参数**:约 3 亿
- **训练目标**:自监督学习(DINOv3)
- **训练数据**:LVD-1689M
## 预期用途
此模型计算密集视觉嵌入向量。擅长于: - **视觉相似性搜索**:查找重复或近似重复的图像(例如,区分特定的徽标或商品标签)。 - **图像检索**:基于几何形状和纹理而非仅文本标题来查找相似的图像。 - **特征提取**:为下游分类或聚类任务生成嵌入向量。
## 使用方法
此模型接受图像作为输入,并返回 **归一化的 CLS Token 嵌入向量**。
### Python 示例
您可以使用输出向量来计算两张图像之间的余弦相似度。
``
import replicate
import numpy as np
from numpy.linalg import norm
def cosine_similarity(a, b):
return np.dot(a, b) / (norm(a) * norm(b))
# 1. 获取图像 A 的嵌入向量
output_a = replicate.run(
"your-username/dinov3-vit-large-distilled:version_id",
input={"image": open("tag_a.jpg", "rb")}
)
# 2. 获取图像 B 的嵌入向量
output_b = replicate.run(
"your-username/dinov3-vit-large-distilled:version_id",
input={"image": open("tag_b.jpg", "rb")}
)
# 3. 比较
score = cosine_similarity(output_a, output_b)
print(f"Similarity Score: {score:.4f}")
``
## 归属和许可
此模型是对 Meta 发布的 DINOv3 权重的封装。原作者:Meta 基础人工智能研究实验室(FAIR) 仓库:facebookresearch/dinov3 许可证:此模型的使用需遵守 DINOv3 许可协议。 免责声明:这是一个第三方部署。有关原始源代码和研究论文,请参阅 Meta 官方仓库。
模型创建于 9 个月 1 周前
相似文章
蚂蚁集团发布LingBot-Vision:DINO系列视觉骨干网络,提供四种规模,其中0.3B参数的ViT-L在NYUv2深度估计任务上以约23倍更少的参数量达到与DINOv3-7B相当的性能
蚂蚁集团发布了LingBot-Vision,这是一个包含四种规模的DINO风格视觉骨干网络系列;其中0.3B ViT-L在NYUv2深度估计任务上,以约23倍更少的参数量达到了DINOv3-7B的性能,展现了显著的效率提升。
DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation
DistilVDR is a compact 524M visual document retriever distilled from an 8B teacher via cosine alignment, achieving near-teacher accuracy on ViDoRe with 15.6x smaller indexes and faster indexing.
adirik/grounding-dino
Grounding DINO 是一个开放词汇的目标检测模型,能够根据文本描述检测任意对象,现已在 Replicate 上可用。
探索视觉嵌入
本文通过生成与特定嵌入方向对应的图像,利用梯度优化和增强策略来反转模型,探索了DINOv3视觉嵌入。
ColNanoVDR: 通过最优传输实现多向量视觉文档检索的无文档查询蒸馏
ColNanoVDR 引入了首个用于多向量视觉文档检索的无文档查询蒸馏框架,利用最优传输对齐学生与教师的查询嵌入,实现更快的编码同时保持高性能。