@no_stp_on_snek: 精彩视频 @digitalix 。苹果的新小烤箱真是个性能怪兽!https://youtu.be/c_58D7ixOQI 现在得考虑卖哪个肾了……

X AI KOLs Following 产品

摘要

苹果的M5 Ultra芯片与M3 Ultra相比,本地LLM的token生成速度提升高达1.5倍,提示处理速度提升4倍,内存带宽和存储速度有所提升,但代价高昂。

精彩视频 @digitalix 。苹果的新小烤箱真是个性能怪兽!https://youtu.be/c_58D7ixOQI 现在我需要卖掉哪个肾呢。
查看原文
查看缓存全文

缓存时间: 2026/09/24 10:29

精彩视频 @digitalix。苹果的新款“小烤箱”性能确实强劲!https://youtu.be/c_58D7ixOQI 现在就得考虑该卖哪颗肾了。


M5 Ultra 评测:Token生成速度提升1.5倍,提示处理速度最高提升4倍,但代价是高昂的价格与惊人的功耗。

M5 Ultra 介绍与配置

M5 Ultra 已登场,并与 M3 Ultra 进行了直接对比。苹果声称其本地AI性能比上一代快高达4.3倍,存储速度加倍,CPU速度提升1.3倍。内存带宽额定为1.2TB/s。

本次测试的具体配置为:80核GPU、256GB内存(512GB版本将于下月推出)和8TB存储。这套配置的价格约为14,299美元。评测所用机器由苹果提供,而用于对比的M3 Ultra则是个人购买。

CPU与开发者性能

对于开发者任务,M5 Ultra被描述为“性能过剩”。在Speedometer基准测试中,M5 Ultra得分为60.2,远高于M3 Ultra的47。

在一项包含10万个命名空间和类的大型.NET编译测试中:

  • M3 Ultra: 71.7秒
  • M5 Ultra: 52.4秒

一项Python 曼德博集合计算测试显示出更显著的提升,任务完成速度几乎快了一倍:

  • M3 Ultra: 10.25秒
  • M5 Ultra: 5.8秒

存储速度提升

苹果“速度加倍”的宣称通过Amorphous Disk Mark在8TB硬盘上进行了测试。结果实际上超出了营销宣传,尤其是在写入速度方面。

顺序读写速度测试结果:

  • M3 Ultra: 读取 ~6500 MB/s (6.5 GB/s),写入 ~2700 MB/s (2.7 GB/s)
  • M5 Ultra: 读取 ~14,888 MB/s,写入 ~20,000 MB/s

随机读写速度也提升了一倍多,这对于涉及大量小文件的开发者任务以及快速加载大型AI模型至关重要。

本地大语言模型性能:Token生成与提示处理

对于本地大语言模型,关键指标是Token生成和提示处理。Token生成速度取决于内存带宽,而提示处理速度则依赖于计算资源(GPU核心)。

M5 Ultra 的一个关键架构改变是在每个GPU核心内增加了神经网络加速器,使其具备专用的矩阵乘法硬件。Llama CPP 确认了这一点:M5 Ultra上显示tensor = true,而M3 Ultra上则为tensor = false。

Token生成性能

不同模型类型的Token生成速度均获得稳定提升,与实测的内存带宽增长相符。

  • Deepseek V4 Flash (284B参数,MoE模型):
    • M3 Ultra:37 tokens/秒
    • M5 Ultra:53 tokens/秒 (快约1.4倍)
  • GPTOSS120B (120B参数,MoE模型):
    • M3 Ultra:90 tokens/秒
    • M5 Ultra:130 tokens/秒
  • Qwen 3.8-27B (27B参数,密集模型):
    • M3 Ultra:37 tokens/秒
    • M5 Ultra:54 tokens/秒 (快1.47倍)

提示处理性能

神经网络加速器极大地提升了提示处理速度,尤其是在处理较长提示时。

  • Deepseek V4 Flash 提示处理:
    • M3 Ultra:483 tokens/秒
    • M5 Ultra:1485 tokens/秒 (快3.1倍)
  • Qwen 3.8-27B 提示处理:
    • M3 Ultra:430 tokens/秒
    • M5 Ultra:1800 tokens/秒 (快超过4.2倍)
  • 实际编码示例(14,000 Token提示):
    • M3 Ultra:33秒
    • M5 Ultra:8秒

4倍的提升在较长提示上最为显著。对于约4,500个Token的提示,加速比达到4倍。对于较短提示(约350个Token),提升依然存在但较小,约为1.6倍。

多请求性能

初步测试显示,同时处理8个请求时,M5 Ultra输出速度为134 tokens/秒,而M3 Ultra为75 tokens/秒。

内存带宽测量

内存带宽通过CPU和GPU基准测试进行了测量。

CPU内存带宽(Stream Triad基准测试):

  • M3 Ultra: 583.6 GB/s (苹果额定值:819 GB/s)
  • M5 Ultra: 1039 GB/s

GPU内存带宽(微基准测试):

  • M3 Ultra: 724 GB/s (苹果额定值:819 GB/s)
  • M5 Ultra: 1039 GB/s (苹果额定值:1.2TB/s)

M5 Ultra实测的GPU内存带宽高出1.4倍,这与观测到的约1.5倍Token生成速度提升相关。

功耗与散热

M5 Ultra的高性能伴随着更高的功耗和发热量。

  • 空闲功耗: M5 Ultra约8-10W(低于M3 Ultra的11-12W)。
  • AI生成负载(GPU): M5 Ultra约45W vs M3 Ultra约36W。这导致Token生成的每瓦性能提升仅约12%。
  • 最大GPU负载: M5 Ultra功耗超过400W,远高于M3 Ultra的近200W。

在持续负载下,M5 Ultra运行温度明显更高(约43-44°C)且风扇噪音更大,在测试中主导了环境音。

结论与未来测试

M5 Ultra实现了苹果对AI任务的性能宣称:Token生成速度约快1.5倍,提示处理速度快2倍到超过4倍不等(取决于提示长度)。这对开发者和AI工作负载是一次重大升级。

显著的性能提升伴随着高昂的价格、更高的功耗和更多的热量。即将到来的512GB内存配置将能够运行更大、更快的模型。

未来的测试将包括MLX与Llama CPP的深入对比、8位量化模型的评估以及多用户并发性能分析。

来源:https://www.youtube.com/watch?v=c_58D7ixOQI

相似文章