Inkling-Small 276B-A12B 在低于10GB内存下约2.9 tok/s

Reddit r/LocalLLaMA 工具

摘要

Mference,一个基于 Swift + Metal 的推理引擎,现已支持 Inkling-Small 276B-A12B,在低于10GB内存下以约2.9 tok/s运行,使得大型MoE模型能够在消费级Apple硬件上运行。

这是Mference发布后的后续更新,现在它支持并运行Inkling-Small 276B-A12B。Inkling-Small(Thinking Machines,Apache 2.0)来自pipenetwork/Inkling-Small-MLX-4bit转换:总计276B,约12B激活,常驻内存3.4 GB,磁盘占用约148 GB。在我的M5(24GB)上测量:提示类型 提示/生成 预填充(不含加载) 解码 峰值内存占用 简短说明 59 / 416 8.4 s 2.86 tok/s 9.48 GB 中等评测 421 / 560 60.1 s 2.93 tok/s 9.59 GB 长综合 2,785 / 294 535.9 s 2.56 tok/s 9.56 GB 同样的三种情况在256 GB M3 Ultra上达到5.31–6.92 tok/s。问题:长提示的预填充效果很差(2,785个token到首个token需要将近9分钟),并且目前仅支持文本。现在支持四个模型系列:Gemma 4 26B-A4B(约2 GB)、Qwen 3.6 35B-A3B(约1.45 GB)、DeepSeek-V4-Flash 284B-A13B(约6.8 GB)、Inkling-Small 276B-A12B(约9.5 GB)。我还获得了几台M3 Ultra的使用权限,因此我也会针对更高配置进行测试和优化。但主要目标不变:在消费级硬件上运行大型MoE模型。仓库:https://github.com/NeelM0906/Mference — 基于 Swift + Metal,不是 MLX 或 llama.cpp 的封装。提供 Mac 应用、CLI 以及兼容 OpenAI 的服务器。欢迎贡献。
查看原文

相似文章

Inkling-Small(4分钟阅读)

TLDR AI

Thinking Machines发布了Inkling-Small,这是一个高效的开放权重混合专家模型,总参数量276B,激活参数12B。它的大小仅为更大版本Inkling的四分之一,但性能与之相当。该模型原生支持音频和图像推理,具备可变的思考深度,并拥有100万token的上下文窗口。

thinkingmachines/Inkling

Hugging Face Models Trending

Inkling is a large open-weights multimodal model (975B total, 41B active parameters) using a sparse MoE architecture, accepting text, image, and audio inputs and generating text outputs, intended for agentic systems, coding assistants, and chatbots.

DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行

Reddit r/LocalLLaMA

一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。