首个 M5 Ultra 基准测试

Reddit r/LocalLLaMA 新闻

摘要

M5 Ultra 芯片的非官方基准测试显示,使用 Qwen 3.8 27B q4 模型时推理速度令人期待,在 8k 上下文中,线程处理速度达到每秒 50 个 token,预填充速度达到每秒 1800 个 token。

刚刚在 omlx 网站上看到一些关于 M5 Ultra 的基准测试(不确定这些测试的官方性,但看起来合理):链接 对于 Qwen 3.8 27B q4,它在 8k 上下文中线程处理速度为 50 token/秒,预填充速度为 1800 token/秒,且没有使用 mtp。看起来非常有前景!
查看原文

相似文章

M5 ultra AI 测试结果

Reddit r/LocalLLaMA

M5 ultra AI 测试结果显示,提示处理速度比 M3 ultra 快 4 到 4.5 倍,令牌生成速度快 1.5 倍,但功耗翻倍,风扇噪音增大,温度更高。