@ashxhart: 一直在给我的 M3 Ultra Studio 精心调校,并摆弄 MLX。下午开始时速度为 42 tok/s。现在:73 tok/s,而且…
摘要
一位作者改进了 M3 Ultra Studio 上的 MLX 性能,使 4 位量化的 Qwen3.8-Flash-Next 模型达到 73 tok/s,其智能评分与 GPT-5.6 Sol 相当,凸显了本地 AI 日益增长的潜力。
查看缓存全文
缓存时间: 2026/09/09 03:48
最近给我的M3 Ultra Studio做了些优化,尝试在MLX框架下进行机器学习调优。
下午启动时处理速度为42 tok/s。
现在:73 tok/s,而且还有提升空间。
正在本地运行Qwen3.8-Flash-Next @ 4-bit量化版本。
接下来是惊人部分:人工智能分析智能指数 v4.3:
GPT-5.6 Sol 39 (中等推理)
GPT-5.6 Sol 42 (高阶推理)
Qwen3.8-Flash-Next 42
GPT-5.6 Sol 44 (超高阶推理)
GPT-5.6 Sol 47 (极限推理)
Grok 4.5 39 (高阶推理)
Claude Sonnet 5 38 (极限推理)
*Qwen评分目前由人工智能分析平台估算。
一个运行在书桌下方Mac电脑上的4位量化开源模型,以73 tok/s的速度运行…智能评分估测与高阶推理模式的GPT-5.6 Sol持平。
本地AI发展速度简直不可思议。🔥
此外,这个模型对于轻度对抗性测试也相当配合。
待我调试满意后,会为@jundotkim的oMLX项目提交PR请求 :)
相似文章
@Prince_Canuma:我的 MLX 与研究家用计算平台:• M3 Ultra — 512GB(由社区与 @wai_protocol 赞助)• RTX PRO 6000 — 96GB…
一位研究人员分享了用于 MLX 和 AI 研究的家用计算配置,包含配备 512GB 的 M3 Ultra、配备 96GB 的 RTX PRO 6000,以及用于模型移植与压力测试的配备 96GB 的 M3 Max。
M2 Ultra/Qwen3.8 Flash 最新更新 - 最新 oMLX 引入重大加速
最新 oMLX 更新为 Apple 的 M2 Ultra 芯片和 Qwen3.8 Flash AI 模型带来重大加速,提升性能和效率。
Nex-N2.5-mini-MLX-4bit 在 Apple M5 Max 上 — 133.6 tok/s — llm-bench.io
Nex-N2.5-mini-MLX-4bit 模型在 Apple M5 Max 硬件上的基准测试结果,生成速度达到 133.6 tokens/s,研究任务中的质量分数高达 85.80。
@rohanpaul_ai: Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上达到每秒34个token,本地使用 atomic[.]chat,接受率达90%,即……
Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上本地运行,实现每秒34个token,草稿接受率达90%,通过 TurboQuant、GGUF 和 llama.cpp 实现,展示了笔记本AI推理的重大进步。
@nicekate8888: 最近二十天我都在折腾一件事——怎么让 Qwen3.6-27B 在我的 Mac 上跑得又快又好。 一开始我用 Unsloth Q5,18 tok/s,风扇呼啦呼啦响。 后来换成 MLX 6bit + DFlash,提到 22 tok/s,还…
用户分享在Mac上通过不同量化方法(Unsloth Q5、MLX 6bit + DFlash、MTPLX 4bit)优化Qwen3.6-27B推理速度的经验,最终达到43 tok/s。