@no_stp_on_snek: 精彩视频 @digitalix 。苹果的新小烤箱真是个性能怪兽!https://youtu.be/c_58D7ixOQI 现在得考虑卖哪个肾了……
摘要
苹果的M5 Ultra芯片与M3 Ultra相比,本地LLM的token生成速度提升高达1.5倍,提示处理速度提升4倍,内存带宽和存储速度有所提升,但代价高昂。
查看缓存全文
缓存时间: 2026/09/24 10:29
精彩视频 @digitalix。苹果的新款“小烤箱”性能确实强劲!https://youtu.be/c_58D7ixOQI 现在就得考虑该卖哪颗肾了。
M5 Ultra 评测:Token生成速度提升1.5倍,提示处理速度最高提升4倍,但代价是高昂的价格与惊人的功耗。
M5 Ultra 介绍与配置
M5 Ultra 已登场,并与 M3 Ultra 进行了直接对比。苹果声称其本地AI性能比上一代快高达4.3倍,存储速度加倍,CPU速度提升1.3倍。内存带宽额定为1.2TB/s。
本次测试的具体配置为:80核GPU、256GB内存(512GB版本将于下月推出)和8TB存储。这套配置的价格约为14,299美元。评测所用机器由苹果提供,而用于对比的M3 Ultra则是个人购买。
CPU与开发者性能
对于开发者任务,M5 Ultra被描述为“性能过剩”。在Speedometer基准测试中,M5 Ultra得分为60.2,远高于M3 Ultra的47。
在一项包含10万个命名空间和类的大型.NET编译测试中:
- M3 Ultra: 71.7秒
- M5 Ultra: 52.4秒
一项Python 曼德博集合计算测试显示出更显著的提升,任务完成速度几乎快了一倍:
- M3 Ultra: 10.25秒
- M5 Ultra: 5.8秒
存储速度提升
苹果“速度加倍”的宣称通过Amorphous Disk Mark在8TB硬盘上进行了测试。结果实际上超出了营销宣传,尤其是在写入速度方面。
顺序读写速度测试结果:
- M3 Ultra: 读取 ~6500 MB/s (6.5 GB/s),写入 ~2700 MB/s (2.7 GB/s)
- M5 Ultra: 读取 ~14,888 MB/s,写入 ~20,000 MB/s
随机读写速度也提升了一倍多,这对于涉及大量小文件的开发者任务以及快速加载大型AI模型至关重要。
本地大语言模型性能:Token生成与提示处理
对于本地大语言模型,关键指标是Token生成和提示处理。Token生成速度取决于内存带宽,而提示处理速度则依赖于计算资源(GPU核心)。
M5 Ultra 的一个关键架构改变是在每个GPU核心内增加了神经网络加速器,使其具备专用的矩阵乘法硬件。Llama CPP 确认了这一点:M5 Ultra上显示tensor = true,而M3 Ultra上则为tensor = false。
Token生成性能
不同模型类型的Token生成速度均获得稳定提升,与实测的内存带宽增长相符。
- Deepseek V4 Flash (284B参数,MoE模型):
- M3 Ultra:37 tokens/秒
- M5 Ultra:53 tokens/秒 (快约1.4倍)
- GPTOSS120B (120B参数,MoE模型):
- M3 Ultra:90 tokens/秒
- M5 Ultra:130 tokens/秒
- Qwen 3.8-27B (27B参数,密集模型):
- M3 Ultra:37 tokens/秒
- M5 Ultra:54 tokens/秒 (快1.47倍)
提示处理性能
神经网络加速器极大地提升了提示处理速度,尤其是在处理较长提示时。
- Deepseek V4 Flash 提示处理:
- M3 Ultra:483 tokens/秒
- M5 Ultra:1485 tokens/秒 (快3.1倍)
- Qwen 3.8-27B 提示处理:
- M3 Ultra:430 tokens/秒
- M5 Ultra:1800 tokens/秒 (快超过4.2倍)
- 实际编码示例(14,000 Token提示):
- M3 Ultra:33秒
- M5 Ultra:8秒
4倍的提升在较长提示上最为显著。对于约4,500个Token的提示,加速比达到4倍。对于较短提示(约350个Token),提升依然存在但较小,约为1.6倍。
多请求性能
初步测试显示,同时处理8个请求时,M5 Ultra输出速度为134 tokens/秒,而M3 Ultra为75 tokens/秒。
内存带宽测量
内存带宽通过CPU和GPU基准测试进行了测量。
CPU内存带宽(Stream Triad基准测试):
- M3 Ultra: 583.6 GB/s (苹果额定值:819 GB/s)
- M5 Ultra: 1039 GB/s
GPU内存带宽(微基准测试):
- M3 Ultra: 724 GB/s (苹果额定值:819 GB/s)
- M5 Ultra: 1039 GB/s (苹果额定值:1.2TB/s)
M5 Ultra实测的GPU内存带宽高出1.4倍,这与观测到的约1.5倍Token生成速度提升相关。
功耗与散热
M5 Ultra的高性能伴随着更高的功耗和发热量。
- 空闲功耗: M5 Ultra约8-10W(低于M3 Ultra的11-12W)。
- AI生成负载(GPU): M5 Ultra约45W vs M3 Ultra约36W。这导致Token生成的每瓦性能提升仅约12%。
- 最大GPU负载: M5 Ultra功耗超过400W,远高于M3 Ultra的近200W。
在持续负载下,M5 Ultra运行温度明显更高(约43-44°C)且风扇噪音更大,在测试中主导了环境音。
结论与未来测试
M5 Ultra实现了苹果对AI任务的性能宣称:Token生成速度约快1.5倍,提示处理速度快2倍到超过4倍不等(取决于提示长度)。这对开发者和AI工作负载是一次重大升级。
显著的性能提升伴随着高昂的价格、更高的功耗和更多的热量。即将到来的512GB内存配置将能够运行更大、更快的模型。
未来的测试将包括MLX与Llama CPP的深入对比、8位量化模型的评估以及多用户并发性能分析。
来源:https://www.youtube.com/watch?v=c_58D7ixOQI
相似文章
Nex-N2.5-mini-MLX-4bit 在 Apple M5 Max 上 — 133.6 tok/s — llm-bench.io
Nex-N2.5-mini-MLX-4bit 模型在 Apple M5 Max 硬件上的基准测试结果,生成速度达到 133.6 tokens/s,研究任务中的质量分数高达 85.80。
Apple 发布 M5 Ultra,带宽达 1.2TB/s
Apple 推出 M6 chip,其首款2纳米处理器,以及采用四芯片架构的 M5 Ultra,带来显著的性能和AI计算提升。
@svpino: DeepSeek-V4-Flash 在 Mac M5 Pro 上运行速率达到 5.71 token/秒。每天,我们都能在消费级硬件上运行更好的模型…
这条推文强调了 DeepSeek-V4-Flash 在 Mac M5 Pro 上以每秒 5.71 个 token 的速率运行,突显了消费级硬件上本地 AI 推理的进步,并提到了腾讯的开源 Palm-Infra 用于 Apple Silicon 优化。
@ivanfioravanti: Apple M5 Max + MLX = 原始算力!看看我正在玩的“FasterLivePortrait-MLX”演示,我从 MPS 开始,但结果不……
作者演示了在搭载 M5 Max 芯片的设备上,将 LivePortrait 的实现从 MPS 迁移到 Apple 的 MLX 框架后,性能和速度有了显著提升。
@Arm:我们的合作伙伴 @Apple 刚刚宣布了一件大事!基于 Arm 构建的新款 M6 和 M5 Ultra 芯片代表着一项重大进步……
Arm 宣布 Apple 推出基于 Arm 架构的新款 M6 和 M5 Ultra 芯片,这标志着在 AI 计算和性能方面的一次重大进步。