Inkling-Small 276B-A12B 在低于10GB内存下约2.9 tok/s
摘要
Mference,一个基于 Swift + Metal 的推理引擎,现已支持 Inkling-Small 276B-A12B,在低于10GB内存下以约2.9 tok/s运行,使得大型MoE模型能够在消费级Apple硬件上运行。
相似文章
Inkling-Small(4分钟阅读)
Thinking Machines发布了Inkling-Small,这是一个高效的开放权重混合专家模型,总参数量276B,激活参数12B。它的大小仅为更大版本Inkling的四分之一,但性能与之相当。该模型原生支持音频和图像推理,具备可变的思考深度,并拥有100万token的上下文窗口。
Qwen3.8-27B在M5 Max MacBook Pro上实现144 tok/s速度
Inco Splash是一款针对Apple silicon优化的开源推理引擎,在M系列MacBook上运行Qwen3.8-27B等AI模型时提供了显著的速度提升。
thinkingmachines/Inkling
Inkling is a large open-weights multimodal model (975B total, 41B active parameters) using a sparse MoE architecture, accepting text, image, and audio inputs and generating text outputs, intended for agentic systems, coding assistants, and chatbots.
@modal:在 Modal 上对 Inkling-Small 的 Day 0 支持。 - 276B 参数 MoE,12B 激活 - 1M 上下文 - 可变思考强度 …
Thinking Machines 发布了 Inkling-Small,这是一个 276B 参数的混合专家模型,具有 12B 激活参数、1M 上下文以及原生图像/音频理解能力,现已在 Modal 上可用,并支持 NVIDIA B300。
DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行
一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。