mistral.rs v0.8.2:在GB10、B200和H100上CUDA推理速度比llama.cpp快2.8倍
摘要
Mistral.rs v0.8.2 在 GB10、B200 和 H100 GPU 上的 CUDA 推理速度比 llama.cpp 快达 2.8 倍,Gemma 4 模型的基准测试显示,在各种量化类型上均有一致的性能提升。
大家好!我一直在优化 mistral.rs 的 CUDA 性能,v0.8.2 主要聚焦于 CUDA 吞吐量。结果是:在 Gemma 4(密集型和 MoE)上,[mistral.rs](http://mistral.rs) 在我的 GB10/H100/B200 发布测试中每一点都快于 llama.cpp。以下是 GB10 和 B200 上的部分结果:https://preview.redd.it/jmdsjkrbfo4h1.png?width=3312&format=png&auto=webp&s=8a69286b73a8fad4edc671cb9ca8ad3f3cd74d1c
完整报告包含复现这些结果的所有步骤。这些结果在量化类型(eQ8\_0、Q4K)、模型(密集型和 MoE)以及 GPU 上均保持一致。更多详情请参阅完整报告:https://github.com/EricLBuehler/mistral.rs/blob/master/releases/v0.8.2/report.md
如果你想尝试,可以轻松安装 [mistral.rs](http://mistral.rs):
# Mac/Linux:
curl --proto '=https' --tlsv1.2 -sSf https://raw.githubusercontent.com/EricLBuehler/mistral.rs/master/install.sh | sh
# Windows:
irm https://raw.githubusercontent.com/EricLBuehler/mistral.rs/master/install.ps1 | iex
之后,你可以在 1234 端口启动一个兼容 OpenAI 的服务器以及带有内置 Agent 功能的 Web 聊天界面:
`mistralrs serve --agent -m google/gemma-4-E4B-it --quant 4`
欢迎复现、批评以及基准测试建议!更多详情、文档和示例请查看 GitHub:https://github.com/EricLBuehler/mistral.rs
https://reddit.com/link/1tttevw/video/z0ayf1f1go4h1/player
相似文章
mistral.rs v0.9.0:在x86和ARM上CPU解码速度比llama.cpp快达1.8倍!
mistral.rs v0.9.0 在x86和ARM上实现了比llama.cpp快达1.8倍的CPU解码速度,优化覆盖所有CPU规格,并保证基准测试完全可重现。
Llama.cpp PR 带来 8% 速度提升
一个 llama.cpp PR 将采样从 CPU 移至 GPU,在 RTX 5090 上为 Qwen3.6-35B 推理带来 8% 的 token 速度提升,在 Tesla P40 上约为 4%。
我在 vLLM 和 llama.cpp 上对 Gemma 4 和 Qwen 3.6 测试了 MTP —— 推理速度提升 3.34 倍,这是我的发现(RTX 6000 PRO)。
使用 vLLM 和 llama.cpp 对 Gemma 4 31B 和 Qwen 3.6 27B 进行的多令牌预测(MTP)基准测试显示,推理速度最高提升 3.34 倍,最优推测令牌数量因模型和引擎而异。
@leopardracer: 同一GPU、同一模型、同一上下文,速度翻倍!RTX 4060,Gemma 4 12B,48k上下文,仅切换量化方式从 q4_k_m 到 q4_k_xl…
在 llama.cpp 中,将量化从 q4_k_m 切换为 q4_k_xl,可在相同 GPU(RTX 4060)上使推理速度翻倍,无需更换硬件或驱动,如 Gemma 4 12B 所示。
@pupposandro:在 Strix Halo 上比 llama.cpp 快 2.5 倍。我们刚刚为 AMD Ryzen AI MAX+ 395 iGPU(gfx1151,……)发布了 DFlash + PFlash
一套新工具集(DFlash + PFlash)在 AMD Ryzen AI MAX+ 395 iGPU 上实现了比 llama.cpp 快 2.5 倍的推理速度,展示了 Qwen3.6-27B 在 128 GiB 统一内存下的显著加速效果。