@QuixiAI: QuixiAI/embeddinggemma.c - 极速跨平台嵌入推理引擎。用C编写,可随处运行。推理…

X AI KOLs Following 工具

摘要

QuixiAI发布embeddinggemma.c,一个用C编写的快速跨平台嵌入推理引擎,支持多种后端(CPU、Metal、CUDA、ROCm、SYCL)以及Matryoshka嵌入,并提供标准HTTP API。

QuixiAI/embeddinggemma.c - 极速跨平台嵌入推理引擎。用C编写,可随处运行。 仅推理 embeddinggemma-300M-qat-q4_0-GGUF(2k上下文) 针对CPU、Metal、CUDA、ROCm、SYCL优化内核。 支持768、512、256、128维度的Matryoshka嵌入。 标准HTTP API。 我说过它很快吗?
查看原文
查看缓存全文

缓存时间: 2026/07/21 16:47

QuixiAI/embeddinggemma.c - 极速跨平台嵌入推理引擎,纯C编写,跑遍天下。

仅推理 embeddinggemma-300M-qat-q4_0-GGUF(2k上下文)

为CPU、Metal、CUDA、ROCm、SYCL优化的内核。

支持768、512、256、128维度的Matryoshka嵌入。

标准HTTP API。

需要我再强调一遍它有多快吗?

相似文章

zsxkib/embedding-gemma-300m

Replicate Explore

zsxkib/embedding-gemma-300m 是 Google 的 EmbeddingGemma-300M 模型在 Replicate 上的部署,用于生成 768 维文本嵌入,通过 Matryoshka 表示学习支持灵活的输出维度。

@QuixiAI: https://x.com/QuixiAI/status/2073936537213915611

X AI KOLs Following

QuixiAI 发布了 QuixiCore,这是一系列面向现代加速器的原生高性能 AI 内核库,为 CUDA、Metal、ROCm、XPU 和 Gaudi 后端提供了独立的实现,所有实现共享一个通用契约但没有共享代码。

推出 Gemma 3n 预览版:功能强大、高效、移动优先的 AI

Google DeepMind Blog

Google 推出 Gemma 3n 预览版,这是一个移动优先的开源 AI 模型,针对手机、平板电脑和笔记本电脑上的本地推理进行了优化。该模型采用与高通和联发科等硬件合作伙伴共同开发的新架构,利用分层嵌入等创新技术,在最少内存占用(2-3GB)的情况下实现快速性能,同时支持多模态功能。