@berryxia: 我靠,这不直接抢了苹果的活儿啊! 6.6B的小模型直接把Siri和一堆云端巨头干到闭嘴,还只吃7GB内存就跑在Mac本地。 CJ Zafir他们搞的Mac-1,不光参数小到离谱,还一次性接了487个Mac原生工具,能链式调用、自动推理、连…
摘要
CJ Zafir团队推出了Mac-1,一个6.6B参数的小模型,可在Mac本地运行仅需7GB内存,能链式调用487个Mac原生工具,推理速度达65 tok/s,旨在颠覆云端大模型主导的Agent范式。
查看缓存全文
缓存时间: 2026/06/08 21:32
我靠,这不直接抢了苹果的活儿啊!
6.6B的小模型直接把Siri和一堆云端巨头干到闭嘴,还只吃7GB内存就跑在Mac本地。
CJ Zafir他们搞的Mac-1,不光参数小到离谱,还一次性接了487个Mac原生工具,能链式调用、自动推理、连发邮件订会议都行,速度65 tok/s,UI还是纯Mac风。
以前大家都觉得agent要靠大模型+云端才能靠谱,结果这个本地小家伙直接把“模型越大越强”的理论快要掀桌子了。
它真正厉害的地方是把应用层做成了Mac原生体验,人用着舒服,Agent后台自己干活。
云端SaaS的agent时代,可能还没真正开始,就已经被本地小模型+原生工具的组合终结了。 感觉苹果没有做成的事儿,被这家公司嘿干了啊!
完了实际测测支持中文方便是否也丝滑~
CJ Zafir (@cjzafir): Here’s a teaser of our Mac-1 model.
> 6.6B model > runs locally (on any Mac) > requires 7GB RAM (12GB ideal) > can use 487 MacOS native tools > perform multi-tool chained tasks > reasoning: ON > output: ~65 tok/s
We built a robust application layer around the model to make
相似文章
@berryxia: Apple 一直其实在赌端侧模型的应用! 统一架构内存就是端侧模型的天然温床! 统一内存也就是,内存即显存。 也看到越来越多的优秀端侧模型出现。 OpenBMB 把 MiniCPM-V 4.6 这个 1.3B 的多模态模型放出来了,我看完…
OpenBMB 发布了 MiniCPM-V 4.6,一个 1.3B 参数的多模态模型,通过高分辨率视觉处理和高效压缩技术,在消费级硬件和手机上实现快速推理,性能超过同类大模型,且全面开源支持多种推理和量化框架。
@sitinme: 有一个挺有意思的开源项目,叫 Cider,专门给 Apple Silicon 芯片的 Mac 做本地 AI 推理加速。 很多人买了 Mac mini、MacBook Pro ,想在本地跑模型,但总会出现速度不够快、内存吃得猛的情况 其实 …
Cider 是一个开源项目,专为 Apple Silicon Mac 设计,通过充分利用 M 系列芯片的算力来加速本地 AI 推理,适配 MLX 生态,支持 Qwen、Llama 等模型,安装简单。
@laobaishare: 这哥们出去溜达,他这一桌子自己在赚钱。 3台Mac Mini、9个AI代理、月费1万美元。零云服务账单。 三台设备: 开发机、管理机和一台24小时运转的。 9个代理并行工作,5层内存架构, 每个prompt都在自己硬件上运行。 数据永远不…
一名开发者使用3台Mac Mini和9个AI代理搭建完全本地化的AI工作流,实现零云服务账单并月入1万美元。
@QingQ77: 纯 Swift 写的 Apple Silicon LLM 推理服务器,不用 Python,低内存 Mac 也能跑大模型。 https://github.com/SharpAI/SwiftLM SwiftLM 是个 Swift 原生的推理服…
SwiftLM is a Swift-native LLM inference server for Apple Silicon that runs large models without Python, using SSD streaming to load MoE weights and enabling 122B models on 64 GB Macs.
@cevenif: 用苹果电脑跑本地大模型的朋友,有个工具值得盯上——Rapid-MLX。它在 M 系列芯片上的推理速度比 Ollama 快 2 到 4 倍,因为它是直接基于苹果的 MLX 框架开发的,对芯片架构的压榨更彻底。 几个关键点: KV 缓存裁剪加…
Rapid-MLX 是一个针对苹果 M 系列芯片优化的本地大模型推理工具,基于 MLX 框架开发,推理速度比 Ollama 快 2 到 4 倍,支持多种模型、工具调用及 OpenAI API 兼容接口。