zsxkib/embedding-gemma-300m
摘要
zsxkib/embedding-gemma-300m 是 Google 的 EmbeddingGemma-300M 模型在 Replicate 上的部署,用于生成 768 维文本嵌入,通过 Matryoshka 表示学习支持灵活的输出维度。
zsxkib / embedding-gemma-300m
查看缓存全文
缓存时间: 2026/06/03 23:38
# zsxkib/embedding-gemma-300m – Replicate
来源:https://replicate.com/zsxkib/embedding-gemma-300m
## 运行时间与成本
该模型在 Replicate 上的运行成本约为 0.00022 美元,即每次运行约 4545 次/1 美元,实际费用取决于您的输入。它也是开源的,您可以通过 Docker 在自己的计算机上运行(https://replicate.com/zsxkib/embedding-gemma-300m/api)。
该模型运行于 Nvidia T4 GPU 硬件(https://replicate.com/docs/billing)。预测通常在 1 秒内完成。
## Readme
## EmbeddingGemma-300M 🧠✨
## 概览 🔊
**EmbeddingGemma-300M** 是一款将任意文本转换为 768 维嵌入向量的文本到向量模型。该工具基于 Google DeepMind(https://deepmind.google/)及其 EmbeddingGemma 研究(https://arxiv.org/abs/2408.10957)的杰出成果。我们将他们的 `embedding-gemma-300m` 模型(https://huggingface.co/google/embedding-gemma-300m)封装到了 Replicate 上!从而能够为搜索、推荐和 AI 应用生成高质量的嵌入向量。
支持 Google DeepMind,并通过以下内容了解他们的工作:
- EmbeddingGemma 论文(https://arxiv.org/abs/2408.10957)
- Hugging Face 上的模型卡片(https://huggingface.co/google/embedding-gemma-300m)
## 预加载效率 🚀
EmbeddingGemma-300M 预先加载了 **base64 输出格式**,可立即使用,响应体积比数组格式小 3 倍。
## 获取不同维度 💥
您可以通过 Matryoshka 表示学习自定义 EmbeddingGemma-300M 的输出。方法如下:
1. 选择您的嵌入维度:128、256、512 或 768
2. 将 `embedding_dim` 参数设置为所需大小
3. 模型会自动将完整的 768 维嵌入截断为您选择的大小
4. 示例用法:
5. `embedding_dim = 256` → 获取 256 维向量
6. `embedding_dim = 512` → 获取 512 维向量
7. `embedding_dim = 768` → 获取完整的 768 维向量(默认)
*注意:较小的维度非常适合优化存储,同时在大多数任务中仍能保持良好性能。*
## 代码示例 📚
**Python:**
```python
import replicate, base64, numpy as np
# 获取 base64 嵌入(默认)
b64 = replicate.run("zsxkib/embedding-gemma-300m", input={"text": "Hello world"})
# 解码为 numpy 数组
vec = np.frombuffer(base64.b64decode(b64), dtype=np.float32)
print(vec.shape) # (768,)
```
**JavaScript:**
```javascript
const b64 = await replicate.run("zsxkib/embedding-gemma-300m", { input: { text: "Hello world" } });
const embedding = new Float32Array(Buffer.from(b64, 'base64').buffer);
console.log(embedding.length); // 768
```
## 使用条款 📚
禁止将该嵌入模型用于以下目的:
- 为有害或恶意内容生成嵌入向量。
- 创建旨在操纵或欺骗用户的系统。
- 构建违反用户隐私或数据保护法律的应用程序。
- 未经 Google 适当许可的商业使用。
- 未经许可重新分发模型权重。
- 使用嵌入向量创建偏见或歧视性系统。
## 免责声明 !!️
对于因使用/误用或无法使用本软件而产生的任何直接、间接、附带、特殊或后果性损害,我概不负责。
---
⭐ 在 GitHub 上收藏本仓库(https://github.com/zsxkib/cog-google-embeddinggemma-300m)! 🐦 在 X 上关注 @zsakib_(https://twitter.com/zsakib_) 💻 在 GitHub 上查看更多项目 @zsxkib(https://github.com/zsxkib)
模型创建于 8 个月零 4 周前
相似文章
@QuixiAI: QuixiAI/embeddinggemma.c - 极速跨平台嵌入推理引擎。用C编写,可随处运行。推理…
QuixiAI发布embeddinggemma.c,一个用C编写的快速跨平台嵌入推理引擎,支持多种后端(CPU、Metal、CUDA、ROCm、SYCL)以及Matryoshka嵌入,并提供标准HTTP API。
google/diffusiongemma-26B-A4B-it
Google DeepMind 发布了 DiffusionGemma,这是一个 26B 参数的 Mixture-of-Experts 模型,使用离散扩散实现更快的文本生成,支持多模态输入和 256K token 上下文。
推出 Gemma 3
Google 推出了 Gemma 3,这是一套轻量级开源模型集合(1B、4B、12B、27B),设计用于在单个 GPU 或 TPU 上运行,支持 140+ 种语言、128k 上下文窗口和多模态功能。这些模型在保持高效性能的同时,性能超越了 Llama 3 和 DeepSeek-V3 等更大的竞品,适合边缘设备部署。
Google Gemma 4 12B
谷歌的 Gemma 4 12B 模型通过无编码器架构实现本地多模态AI。
google/gemma-4-26B-A4B-it
Google DeepMind 发布 Gemma 4,一系列开放权重的多模态模型,参数量从2.3B到31B,支持文本、图像、视频和音频输入。模型具有256K上下文窗口,MoE和密集架构,增强的推理能力,并针对从移动设备到服务器的部署进行优化。