mistral.rs v0.9.0:在x86和ARM上CPU解码速度比llama.cpp快达1.8倍!

Reddit r/LocalLLaMA 工具

摘要

mistral.rs v0.9.0 在x86和ARM上实现了比llama.cpp快达1.8倍的CPU解码速度,优化覆盖所有CPU规格,并保证基准测试完全可重现。

https://preview.redd.it/nuk5rxceptbh1.png?width=1448&format=png&auto=webp&s=300344dd4c6552379e8536b81ba288be3d6dca3f 在Qwen3 4B Q4_K上,我们在x86(Sapphire Rapids)和ARM(GB10)上测量的每一层上下文深度中,mistral.rs的解码速度都快于llama.cpp。我们对mistral.rs进行了细粒度的优化,以实现对所有模型的通用加速。此外,我们的优化适用于所有规格的CPU:从支持AVX2或AVX512的x86,到支持NEON的ARM处理器。我们希望确保这次比较对两个引擎都处于最佳状态。为此,我们对mistral.rs和llama.cpp的各种配置进行了扫描,并为每个引擎在每个测试点上使用了最佳配置进行测试。方法、完整表格和重现脚本可在此找到:https://github.com/EricLBuehler/mistral.rs/blob/master/releases/v0.9.0/report.md 如果你想尝试,安装mistral.rs非常简单: # Mac/Linux: curl --proto '=https' --tlsv1.2 -sSf https://raw.githubusercontent.com/EricLBuehler/mistral.rs/master/install.sh | sh # Windows irm https://raw.githubusercontent.com/EricLBuehler/mistral.rs/master/install.ps1 | iex 然后,你可以使用mistral.rs的ISQ系统直接从Hugging Face运行你喜欢的任何模型(Qwen 3.5/3.6、Gemma 4、LFM 2.5):mistralrs run -m google/gemma-4-E4B-it --quant 4 欢迎进行复现,特别是在我未直接测试过的硬件上!
查看原文

相似文章