首个 M5 Ultra 基准测试
摘要
M5 Ultra 芯片的非官方基准测试显示,使用 Qwen 3.8 27B q4 模型时推理速度令人期待,在 8k 上下文中,线程处理速度达到每秒 50 个 token,预填充速度达到每秒 1800 个 token。
刚刚在 omlx 网站上看到一些关于 M5 Ultra 的基准测试(不确定这些测试的官方性,但看起来合理):链接 对于 Qwen 3.8 27B q4,它在 8k 上下文中线程处理速度为 50 token/秒,预填充速度为 1800 token/秒,且没有使用 mtp。看起来非常有前景!
相似文章
M5 ultra AI 测试结果
M5 ultra AI 测试结果显示,提示处理速度比 M3 ultra 快 4 到 4.5 倍,令牌生成速度快 1.5 倍,但功耗翻倍,风扇噪音增大,温度更高。
M5 Ultra 和 M6 芯片基准测试结果揭示图形性能
Apple的M5 Ultra和M6芯片的基准测试结果显示GPU性能显著提升,其中M5 Ultra在Geekbench上的Metal得分比M3 Ultra高出多达59%,而M6芯片得分比M5高出34%。
Qwen3.8-Next 流式传输 - M5 Air 上预填充 150 tps,解码 3.6 tps
一位用户在 Apple M5 Air 上测试了 Qwen3.8-Next 模型,采用 3 位量化,实现了预填充 150 令牌/秒和解码 3.6 令牌/秒,在某些指标上超过了密集 270 亿参数模型。
GLM 5.3 Flash Q4 在 M3 Ultra 上达到 60 token/秒 / 550 token/秒
GLM 5.3 Flash 在 Apple M3 Ultra 上的优化通过内核融合和高效内存使用,实现了最高 550 token/秒的预填充速度和 38 token/秒的推理速度,且无质量损失。
Nex-N2.5-mini-MLX-4bit 在 Apple M5 Max 上 — 133.6 tok/s — llm-bench.io
Nex-N2.5-mini-MLX-4bit 模型在 Apple M5 Max 硬件上的基准测试结果,生成速度达到 133.6 tokens/s,研究任务中的质量分数高达 85.80。