@ollama:Gemma 4 在 Apple Silicon 上使用 Ollama 和 MLX 提速近 90%!性能提升得益于改进的多 token 预…

X AI KOLs Following 模型

摘要

Ollama 宣布,Gemma 4 在 Apple Silicon 上使用 MLX 后速度提升近 90%,这得益于默认启用的改进多 token 预测机制,并支持自动调节以避免减速。

Gemma 4 在 Apple Silicon 上使用 Ollama 和 MLX 后速度提升近 90%! 性能提升来自改进的多 token 预测(MTP),该功能现已在 Gemma 4 中默认开启,后续更多模型也将支持。 Ollama 会在运行过程中自动调整要预测的 token 数量,从而在推测不再带来提速时避免生成速度下降。
查看原文
查看缓存全文

缓存时间: 2026/07/01 10:05

Gemma 4 现在在 Apple Silicon 上使用 Ollama 和 MLX 快了近 90%!

这一加速得益于改进的多令牌预测(MTP),该功能现已在 Gemma 4 上默认启用,未来还会有更多模型支持。

Ollama 会在运行时自动调整预测的令牌数,因此当推测不再有助于加速时,生成速度永远不会变慢。

相似文章