M5 Ultra Mac Studio 评测:本地 AI 智能体的梦幻 Mac
摘要
M5 Ultra Mac Studio 被评为用于运行本地 AI 智能体的顶级机器,提供令人印象深刻的性能并实现无需云的 AI 工作流程。它与 M3 Ultra 和 RTX 5090 进行比较,评测者赞扬其速度、热效率以及与 Qwen3.8-Flash-Next 等 AI 模型的集成。
暂无内容
查看缓存全文
缓存时间: 2026/09/21 15:51
# M5 Ultra Mac Studio 评测:本地AI智能体的理想之选
来源:https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
过去几天,我一直在测试这款([目前](https://forums.macrumors.com/threads/mac-studio-with-m5-ultra-chip-and-512gb-of-ram-launching-in-october.2487936/))顶配**搭载256GB内存的M5 Ultra Mac Studio**。
直入主题:M5 Ultra Mac Studio是运行本地AI智能体的梦想设备。这台电脑能让你以出色的性能运行本地模型驱动的个人助手,且无需支付额外的云服务费用。如果你曾因怀疑本地模型远不及云模型的智能与速度而犹豫是否尝试[OpenClaw](https://openclaw.ai/)或[Hermes Agent](https://hermes-agent.nousresearch.com/),这台Mac会改变你的看法。
自上周四起,我一直在将这款Mac Studio与其前代产品[配备512GB内存的M3 Ultra](https://www.macstories.net/notes/testing-deepseek-r1-0528-on-the-m3-ultra-mac-studio-and-installing-local-gguf-models-with-ollama-on-macos/)以及我自己搭载RTX 5090的桌面游戏PC进行对比。就其尺寸、价格、散热性能——更不用说Apple的统一内存架构——而言,M5 Ultra Mac Studio从根本上改变了我对本地运行模型及其当前能力的认知。当然,RTX 5090凭借其[更高的显存带宽](https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/)仍略胜一筹。但考虑到我PC机箱的巨大体积、发热和噪音,我随时都会选择M5 Ultra Mac Studio。它还是一台Mac,拥有界面美观且稳定的系统,外加活跃的应用生态系统。(Windows粉丝,*抱歉*,微软的软件从来得不到我的青睐。)
正如我将在本文中探讨的,在M5 Ultra Mac Studio上运行最新的[Qwen3.8-Flash-Next](https://qwen.ai/blog?id=qwen3.8-flash-next)模型体验非常出色且迅速,我已将其设为[iOS版Open Minis](https://openminis.app/)和Hermes Agent的默认模型。没错:我最常用的个人助手——甚至比Siri AI[用得还多](https://www.macstories.net/reviews/open-minis-is-the-ios-agent-i-wish-siri-ai-could-be/)——现在完全由在Mac Studio上本地运行的模型驱动。此外,得益于M5 Ultra更快的GPU和更高的显存带宽,这些智能体响应更快,在更大上下文窗口中保持高速,并且能在长时间多轮对话中持续运行而不至于因会话增长而显著变慢。因此,我也在Mac上的Codex应用中使用本地模型——作为主线程或由GPT-6 Astra编排的子智能体——体验非常出色。
我需要预先说明,**我不是专业的AI开发者**:我既不训练也不微调模型。我本质上是个**折腾爱好者**,至今已[玩转本地AI模型](https://www.macstories.net/notes/notes-on-mac-studio-ai-benchmarks-with-qwen3-235b-a22b-and-qwen2-5-vl-72b/)超过一年了。今年夏天,我全身心投入本地AI的应用,用于一个大型项目——下文会详细说明。
我撰写本文的目标是提供两方面的内容:基于四天内(大量)测试得出的数据与可视化分析,以及我在MacStories工作流程中如何应用本地AI完成实际任务的用例说明。
让我们开始吧。
### 为何选择本地AI?
首先来解决核心问题:既然云端前沿模型更优且通常更快,为何还要费心搞本地AI?
这是个合理的问题。运行这些模型需要昂贵的硬件,等你收回投资成本时,可能已经用最昂贵的Anthropic订阅好几年了,还能省钱并获得更好性能。
对此,不同人有不同答案。有人会说使用本地模型是出于隐私考虑:他们宁愿依靠本地智能处理敏感数据和文档,也不愿上传到外部云服务。也有人认为这纯粹很*酷*——我深表赞同。对某些人来说,这是工作需要:如果你是AI开发者,拥有一套优秀的本地环境来训练自己的适配器或微调模型非常合理。
对我而言,踏入本地AI领域的旅程兼具“*酷,何乐而不为?*”的探索乐趣以及对隐私和成本的考量。
正如我本周晚些时候将与[Club MacStories会员](https://www.macstories.net/plans/)分享的那样,我今年夏天的[iOS和iPadOS 27评测](https://www.macstories.net/stories/ios-and-ipados-27-review/)研究与写作流程正是由本地AI赋能并实现的。早在六月,我创建了一个名为**Desk**的内部应用,用于整理与iOS和iPadOS 27相关的数百篇笔记、会话记录、PDF文档、网页剪藏,以及评测的各个章节。到结束时,该项目共包含310份文档。在Desk中,一组智能体团队——全部基于[DeepSeek V4 Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash),PDF处理则使用[olmOCR](https://github.com/allenai/olmocr/tree/main)——全天候运行了99天,执行以下任务:
- 转录我最喜欢的WWDC演讲视频(使用[`summarize`](https://github.com/steipete/summarize)工具及LLM处理)
- 从剪藏的网页、视频会话、PDF指南和我自己的笔记中提取iOS和iPadOS 27的功能特性
- 跨不同来源交叉引用功能特性,并记录哪些功能属于评测的哪个章节
- 从我上传的截图中提取功能特性和错误
- 通过Notion API在多个数据库中组织所有内容
今年六月初开始使用这套配置时,我很快意识到,对于这种持续运行的后台任务,依赖OpenAI或Anthropic API的成本将高得...令人咋舌。因此我转向了本地AI,结果就是你能在MacStories上读到的这篇[iOS和iPadOS 27评测](https://www.macstories.net/stories/ios-and-ipados-27-review/)。文章全部由我以传统人工方式撰写,但整个研究体系、笔记间的深度链接,以及新功能和测试版的追踪,全部由我的智能体在Mac Studio上本地运行完成,总成本为0美元。
如果你不觉得这很酷,或不认为这是个值得探索的强大概念,那么本文可能不适合你——我理解。处理这些模型很繁琐,我绝不会推荐给那些(理所当然地)只想支付20美元使用Claude Cowork的人。这类配置从定义上讲,就是当前AI工作流程的前沿领域。
不过,如果你属于另一端,觉得这类东西很酷...让我告诉你:M5 Ultra Mac Studio为基于[MLX](https://github.com/ml-explore/mlx)的本地模型带来了性能的巨大飞跃,我有几个例子可以证明。
### 提示词处理与生成的飞跃
正如你可能从[公告](https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute/)和[我的初步报道](https://www.macstories.net/notes/the-potential-of-m6-and-m5-ultra-for-local-ai-on-macos/)中看到的,M5 Ultra Mac Studio的外观与替代的M3 Ultra型号完全相同,但它采用了全新的Apple芯片架构,通过UltraFusion连接两个双芯片M5 Max,形成四芯片架构——这在Apple生态系统中尚属首次。就本地AI工作负载而言,有两个领域需要我们关注(自去年报道[用于本地AI的M5 iPad Pro](https://www.macstories.net/stories/ipad-pro-m5-neural-benchmarks-mlx/)以来我一直在跟踪):GPU和显存带宽。
M5 Ultra拥有下一代GPU,配备80个核心,每个核心都包含神经加速器,使其AI峰值GPU计算能力相比M3 Ultra提升高达4.5倍。至于内存,Apple的统一内存架构仍然最高为512GB(尽管该型号将在十月下旬推出),但其带宽已从819GB/s跃升至1.2TB/s,比M3 Ultra高出50%。
了解这些数字后,我开始将M5 Ultra与配备512GB内存的M3 Ultra及我的RTX 5090进行对比测试。更多测试细节将在后文分享,但简而言之:使用M5 Ultra,模型读取你的提示词并开始生成响应所需等待的时间大大减少;一旦开始回答,文本出现的速度也比在M3 Ultra上快得多。仅这两项改进,就使这台机器适用于需要快速模型迭代、从而使用更大上下文窗口的现代智能体循环。
在我的日常体验中,在M5 Ultra上运行的智能体所带来的这些对token预填充(即提示词处理速度)和token生成速度的提升,是我立即注意到的改变。当使用iOS上的Open Minis将M3 Ultra和M5 Ultra上运行的模型进行并排比较时,M5 Ultra生成响应的平均速度**比M3 Ultra快约70%**。正如我们稍后将看到的,像Qwen3.8-Flash-Next这样的模型在短提示下能突破100 tokens/秒,即使在背后有64K到256K上下文时仍能以60到85 tokens/秒的速度生成文本,这非常了不起。它使你和模型之间那种智能体式的来回交互体验*极佳*,尤其是在涉及工具调用时。
然而,令我印象更深刻的是token预填充性能的提升。当你使用Hermes或Codex这类智能体助手时,模型会接收包含系统提示词、用户个性化与会话记忆、技能和MCP描述等内容的一大段指令。有些智能体在精简发送的指令方面做得更好,但通常,只要你使用现代智能体,你都不是从一个空白的上下文窗口开始的。因此,我一直无法持续使用本地模型来运行这波新智能体:它们能工作,但我会盯着空白屏幕和加载指示器,等待模型开始生成响应。而且在每轮对话中,性能都会变差(因为会话上下文变大),我又得等待更长时间。
在我的测试中,**提示词处理速度平均比M3 Ultra提升了150%**——比我之前的配置快约2.5倍。仅这一项改变,就使得本地模型成为Open Minis和Hermes Agent等应用中可靠的选择。当我在M5 Ultra上使用[RemCTL](https://github.com/viticci/remctl)向Flash-Next询问我本周任务时,我无需等待智能体处理我的提示词和Open Minis的指令:短短几秒内,它就能开始推理、执行工具调用等。当我在处理大型项目时,如下文提到的体素竞技场演示,模型能够快速处理多轮对话循环,调度和协调子智能体,并且在整个线程变长的过程中都保持60到85 tokens/秒的速度。
我非常推崇既能回答问题又能智能执行任务的助手,但为了使用体验流畅,它们必须足够快。过去几个月,我在Open Minis上测试了几家“精品”云服务提供商:[Inco](https://inco.ai/blog/inco-platform-aa/),提供超过300 TPS的Kimi K3;[Cerebras](https://inference-docs.cerebras.ai/models/qwen-3.8-27b),其Qwen3.8-27B高达惊人的1,800 TPS;以及像[Fireworks](https://fireworks.ai/)和[Baseten](https://www.baseten.co/)这样的服务商,每家都突破了150 TPS。所有这些提供商在Open Minis和Hermes中都感觉极其流畅,但它们很昂贵(上周我10分钟就烧掉了20美元的Inco额度),而且,当然,当我使用它们时,所有数据都会去往...*某个地方*。当我使用Flash-Next和正在创建的Apple CLI工具集启动Open Minis时,一切数据都留在本地,保存在我随时可见并能重启的电脑里。
最重要的是:像Flash-Next这样的模型可以“小”到在256GB内存的M5 Ultra上以更高[量化精度](https://en.wikipedia.org/wiki/Large_language_model#Quantization)运行(我可以完全在内存中运行5-bit量化;6-bit和8-bit可以利用[这种新架构](https://qwen.ai/blog?id=qwen3.8-flash-next)将[其n-gram表](https://huggingface.co/blog/Blackroot/what-the-engram)卸载到SSD),同时又足够智能,能维持长对话和多次智能体工具调用。
就我的口味而言,5-bit量化在这个版本的Ultra上达到了智能、性能和内存消耗之间的最佳平衡点。但我已经知道,如果将来我能测试512GB内存的M5 Ultra,我会*非常*有兴趣测试不卸载到SSD的8-bit量化性能。
我还没花太多时间尝试将我各种项目的编码任务卸载到本地模型,但我做了一些有趣的实验。凭借这种性能,特别是考虑到在[oMLX](https://github.com/jundot/omlx)中使用256GB内存可以叠加最多三个并发的Flash-Next会话和子智能体(后文详述),我现在可以现实地考虑将较简单的编码任务交给本地模型,并让前沿云端模型审查其工作。例如,我已经在Codex中设置了Qwen3.8-Flash-Next,这让我可以在Codex运行时环境中使用本地模型。这意味着我可以让一个主GPT模型编排本地子智能体,让Flash-Next协调其自身的子智能体,甚至只是在iOS上使用Codex Remote在手机上使用该模型。
我很好奇从即将获得M5 Ultra的真实开发者那里读到更多关于这个主题的内容。随着开源权重模型现在在*消费级硬件*上超越约10个月前被视为“前沿”的水平,并且M5 Ultra的性能现在使智能体编码变得可行,我认为我们很快将看到MLX社区的一些精彩实验。
### M5 Ultra vs. RTX 5090
正如你将在本文后续的可视化图表中看到的,NVIDIA的RTX 5090尽管“仅”有32GB显存,但仍然比Apple的M5 Ultra更快,原因有二。
提示词处理速度由计算能力决定:模型通过一个巨大的[矩阵乘法](https://en.wikipedia.org/wiki/Matrix_multiplication)读取整个提示词,而这正是[NVIDIA的Tensor核心](https://www.nvidia.com/en-us/data-center/tensor-cores/)所擅长的工作。Apple新的神经加速器(M5 Ultra 80个GPU核心中各有一个)缩小了差距,但未能超越。在6000 token的提示词下,M5 Ultra的读取速度约为1,700 tok/s;而我在LM Studio中测试的Qwen模型在5090上达到了惊人的~3,000 tok/s。另一方面,token生成速度取决于带宽:模型一次生成一个token,并为每个token将整个模型从内存中调出,因此5090的1.79 TB/s对比M5 Ultra的1.2 TB/s,使其在每种提示词长度下都稳定领先约25%。5090所不具备的是大容量内存:在256K上下文时,5090最终只能使用8-bit注意力缓存。32GB显存毕竟有限。
然而,这种比较存在两个问题。首先,虽然5090在使用较小模型时仍略优于M5 Ultra,但其缺乏统一内存池意味着,如果我想以极快速度运行模型,就会被限制在GPU的32GB显存内。一旦我想运行任何超过32GB的模型(例如上述的Flash-Next更高精度量化版),5090必须通过PCIe将模型层卸载到(慢得多的)系统RAM。
相似文章
M5 Ultra Mac Studio 在我们的基准测试中表现出色
M5 Ultra Mac Studio 展现了出色的基准测试性能,针对 AI 开发者和高要求工作负载,配备强大规格和高端定价。
@ai_xiaomu: Mac Studio M5 牛比的地方不是 512G, 这个配置 M3 就有了,区别在于: 内存带宽1.2TB/s 36核CPU+80核GPU,GPU核心带独立NPU 最高512GB统一内存 雷电5+RDMA,支持多台Mac分布式AI推理…
Mac Studio M5 的亮点在于其内存带宽、CPU/GPU核心数、独立NPU以及支持多台Mac分布式AI推理的能力,AI算力相比M3 Ultra提升4.3倍,适合本地模型工作站。
Apple 发布新款 Mac Studio,配备 M5 Max 和 M5 Ultra - 统一内存高达 512GB
Apple 发布了新款 Mac Studio,搭载 M5 Max 和 M5 Ultra 芯片,提供高达 4.3 倍更快的 AI 性能和 512GB 统一内存,适用于设备端 AI 和专业工作流程。
Apple发布新款Mac Studio,搭载其“史上最强大芯片”——M5 Ultra
Apple发布搭载M5 Ultra芯片的新款Mac Studio,号称史上最强大芯片,AI计算速度最高提升4.3倍,起售价5,499美元,随macOS 27 Golden Gate一同推出。
Apple的512GB M5 Ultra几乎可以在本地运行所有主要的开放权重模型
Apple的M5 Ultra芯片拥有512GB统一内存,能够在本地运行大型开放权重AI模型,从多GPU系统转向单台桌面机。