@ashxhart: 一直在给我的 M3 Ultra Studio 精心调校,并摆弄 MLX。下午开始时速度为 42 tok/s。现在:73 tok/s,而且…

X AI KOLs Timeline 新闻

摘要

一位作者改进了 M3 Ultra Studio 上的 MLX 性能,使 4 位量化的 Qwen3.8-Flash-Next 模型达到 73 tok/s,其智能评分与 GPT-5.6 Sol 相当,凸显了本地 AI 日益增长的潜力。

一直在给我的 M3 Ultra Studio 精心调校,并摆弄 MLX。 下午开始时速度为 42 tok/s。 现在:73 tok/s,而且还有提升空间。 本地运行 4 位量化的 Qwen3.8-Flash-Next。 现在来看疯狂的部分:Artificial Analysis 智能指数 v4.3: GPT-5.6 Sol 39(中等) GPT-5.6 Sol 42(高) Qwen3.8-Flash-Next 42 GPT-5.6 Sol 44(极高) GPT-5.6 Sol 47(最大) Grok 4.5 39(高) Claude Sonnet 5 38(最大) *Qwen 评分目前由 Artificial Analysis 估算。 一个 4 位开放权重模型在桌下的 Mac 上以 73 tok/s 运行……其估算智能评分与 GPT-5.6 Sol 在高推理水平上相当。 本地 AI 正变得令人难以置信。🔥 此外,这个模型不拒绝一点红队测试。 一旦我对它满意,我将为 @jundotkim 的 oMLX 提交 PR :)
查看原文
查看缓存全文

缓存时间: 2026/09/09 03:48

最近给我的M3 Ultra Studio做了些优化,尝试在MLX框架下进行机器学习调优。
下午启动时处理速度为42 tok/s。
现在:73 tok/s,而且还有提升空间。

正在本地运行Qwen3.8-Flash-Next @ 4-bit量化版本。

接下来是惊人部分:人工智能分析智能指数 v4.3:
GPT-5.6 Sol 39 (中等推理)
GPT-5.6 Sol 42 (高阶推理)
Qwen3.8-Flash-Next 42
GPT-5.6 Sol 44 (超高阶推理)
GPT-5.6 Sol 47 (极限推理)
Grok 4.5 39 (高阶推理)
Claude Sonnet 5 38 (极限推理)

*Qwen评分目前由人工智能分析平台估算。

一个运行在书桌下方Mac电脑上的4位量化开源模型,以73 tok/s的速度运行…智能评分估测与高阶推理模式的GPT-5.6 Sol持平。

本地AI发展速度简直不可思议。🔥
此外,这个模型对于轻度对抗性测试也相当配合。

待我调试满意后,会为@jundotkim的oMLX项目提交PR请求 :)

相似文章