mistral.rs v0.9.0:在x86和ARM上CPU解码速度比llama.cpp快达1.8倍!
摘要
mistral.rs v0.9.0 在x86和ARM上实现了比llama.cpp快达1.8倍的CPU解码速度,优化覆盖所有CPU规格,并保证基准测试完全可重现。
https://preview.redd.it/nuk5rxceptbh1.png?width=1448&format=png&auto=webp&s=300344dd4c6552379e8536b81ba288be3d6dca3f 在Qwen3 4B Q4_K上,我们在x86(Sapphire Rapids)和ARM(GB10)上测量的每一层上下文深度中,mistral.rs的解码速度都快于llama.cpp。我们对mistral.rs进行了细粒度的优化,以实现对所有模型的通用加速。此外,我们的优化适用于所有规格的CPU:从支持AVX2或AVX512的x86,到支持NEON的ARM处理器。我们希望确保这次比较对两个引擎都处于最佳状态。为此,我们对mistral.rs和llama.cpp的各种配置进行了扫描,并为每个引擎在每个测试点上使用了最佳配置进行测试。方法、完整表格和重现脚本可在此找到:https://github.com/EricLBuehler/mistral.rs/blob/master/releases/v0.9.0/report.md 如果你想尝试,安装mistral.rs非常简单:
# Mac/Linux: curl --proto '=https' --tlsv1.2 -sSf https://raw.githubusercontent.com/EricLBuehler/mistral.rs/master/install.sh | sh
# Windows irm https://raw.githubusercontent.com/EricLBuehler/mistral.rs/master/install.ps1 | iex
然后,你可以使用mistral.rs的ISQ系统直接从Hugging Face运行你喜欢的任何模型(Qwen 3.5/3.6、Gemma 4、LFM 2.5):mistralrs run -m google/gemma-4-E4B-it --quant 4
欢迎进行复现,特别是在我未直接测试过的硬件上!
相似文章
mistral.rs v0.8.2:在GB10、B200和H100上CUDA推理速度比llama.cpp快2.8倍
Mistral.rs v0.8.2 在 GB10、B200 和 H100 GPU 上的 CUDA 推理速度比 llama.cpp 快达 2.8 倍,Gemma 4 模型的基准测试显示,在各种量化类型上均有一致的性能提升。
@pupposandro: https://x.com/pupposandro/status/2054241934164492328
该文章宣布了 llama.cpp 对 AMD Strix Halo 集成 GPU (iGPU) 上的 DFlash 和 PFlash 投机解码的支持,并展示了使用 ROCm 时推理性能的显著提升。
一个 llama.cpp PR 让 Q2_0 在 x86 CPU 上提速 3.0–3.6 倍,8B 解码从 2.39 升至 8.20 tok/s
一个 llama.cpp 拉取请求为 Q2_0 × Q8_0 点积添加了 x86 VNNI 实现,在 Bonsai 模型上实现了 3.0–3.6 倍的纯 CPU 加速,内核级逐位精确,且 token 一致性达 99.2%。
llama.cpp MTP推测解码简化:2026年7月在密集模型上大获成功,MoE上表现平平
对llama.cpp中原生MTP推测解码的分析表明,像Qwen3.6-27B这样的密集模型获得了显著的加速(1.4倍至2.2倍),但在MoE架构上结果不尽人意,由于每步开销已经很低,收益微乎其微。
llama.cpp PR 报告:仅切换一个 SYCL 内核,Intel Battlemage 上量化 KV 解码在 118K 上下文最高提速 169%
llama.cpp 的一个 PR 提议将 Intel Battlemage 上的量化 KV 解码从 VEC 切换到 TILE SYCL 内核,据报道在 118K 上下文下解码速度提升最高约 169%。该 PR 目前处于开放状态,存在一些注意事项,且独立验证有限。