Show HN:Maple-Preview——在 iPhone 上以 120 tok/s 运行的三值 20B MoE
摘要
Maple-Preview 是一个三值 20B MoE 模型,在 iPhone 上每秒可运行 120 个 token,展现了高效的端侧推理能力。
暂无内容
相似文章
我已将 Maple-Preview 添加到 Mference,在 Air M4 上仅用 500MB 内存实现了 40 tps 的生成速度
作者为 Mference 添加了 Maple-Preview 支持。Mference 是一款通过从磁盘流式加载 MoE 专家来在低内存设备上运行大型模型的工具,作者在 Air M4 上实现了仅用 500MB 内存达到 40 tps 的速度。
deepgrove/maple-preview
DeepGrove 发布了 Maple-Preview,这是一款开源的 20B-A1B 三值权重推理大语言模型,在同类权重规模中推理能力达到最先进水平,在 Mac mini M4 上每秒可生成 200+ tokens,并与更大模型相比具有竞争力。
Edge0/Edge0-35B-A3B-preview
Edge0-35B-A3B-preview 是一个稀疏的MoE模型,通过流式专家卸载和量化技术,实现移动设备上的高效AI推理,以低于3 GiB的内存达到15 tok/s的性能。
Show HN:在 Mac 上仅用 4.3 GB 内存运行 80B Qwen,以及在 iPhone 上运行 35B
演示了在 Mac 上仅用 4.3 GB 内存运行 80B Qwen 模型,以及在 iPhone 上运行 35B 模型,展示了本地 LLM 推理的极致内存优化。
@rohanpaul_ai: 设备端小模型的可能性太多了。@adrgrondin 正在 iPhone 17 Pro 上运行 Google 的 Gemma 4 E2B。大约 4…
Google 的 Gemma 4 E2B 通过 MLX 优化在 iPhone 17 Pro 上运行演示,达到约 40 tokens/秒,支持 128K 上下文以及离线思考模式,适用于编程和数学。