@AlmustyFX: 这才是真正重要的本地AI测试。一个7.9B MoE模型在M4 Pro上以152 tok/s运行,配备64GB统一内存…

X AI KOLs Timeline 新闻

摘要

一个7.9B MoE模型在M4 Pro上以每秒152个令牌的速度运行,配备64GB统一内存,能够离线处理敏感合同数据,并展示了本地AI的实际应用。

这才是真正重要的本地AI测试。 一个7.9B MoE模型在M4 Pro上以152 tok/s运行,配备64GB统一内存,同时完全离线处理敏感合同数据。 无需云端。数据不离开机器。只是一个轻量级模型在不到一秒内完成有用的工作。 本地AI正从演示工具转变为真正的实用工具。
查看原文
查看缓存全文

缓存时间: 2026/08/29 16:07

这正是那种真正有意义的本地AI测试场景。

一台搭载64GB统一内存的M4 Pro设备,以152 tok/s的速度运行7.9B参数MoE模型,全程离线处理敏感合同数据。

无需云端介入,数据永不离开设备。轻量化模型在一秒内即可完成实用工作。

本地AI正从演示阶段转变为真正的生产力工具。

洛一可🍥 (@luoyike2003): 把Ling-3.0-tiny的MLX 4bit版本拉到本地跑了一圈,记录实现流程、选型原因与遇到的问题

【硬件配置】Apple M4 Pro / 64GB统一内存 / macOS 26.5.1

【选择4bit版本的原因】

Ling-3.0-tiny采用7.9B总参数的稀疏MoE架构:每token仅激活1.3B参数,通过128个路由专家选取top-8并融合1个共享专家,网络深度24层,注意力机制为…

相似文章