ExLlamaV3 被低估了
摘要
作者推荐ExLlamaV3,这是一个被低估的本地AI推理工具,在NVIDIA硬件上性能优于llama.cpp,最近的更新如CPU MoE卸载提升了其性能。
我发布这个可能会被喷,但我觉得这个软件没被充分讨论,这么好的软件浪费了很可惜。Exl3 非常出色,虽然我认为只有NVIDIA显卡才行?Exl3的量化质量更高,KLD指标低得多,速度更快,所有这些相比llama.cpp,都是基于我对我本地模型的一些个人测试(不是基准测试)。从我读到的信息看,CPU MoE卸载是最近才添加的,所以也许这就是为什么之前用的人不多?从那以后也有很多更新,我只是对它感到兴奋。这就像我玩过ik_llama、beellama、llamacpp等之后,找到了一个新玩具。我一直在用tabbyAPI exl3 backend + qwen 3.8 27b sc 6bpw H6和qwen 3.8 flash next 4bpw作为我的日常工具,它能做的事情太不可思议了。我希望这个软件能被更多人知道。我和他们没有任何关联,我只是想分享。它太酷了,请试一试!!
相似文章
ExLlamaV3 v1.0.0 - 重大性能升级
ExLlamaV3 v1.0.0 为本地运行大型语言模型带来了重大性能升级。
exllamav3 在我的配置下轻松击败运行 CPU 卸载 Qwen-3.8-Flash-Next 的 llama.cpp!
一位用户对 exllamav3 和 llama.cpp 进行了 CPU 卸载推理的基准测试,显示 exllamav3 对于 Qwen 模型更快,但对于其他模型更慢,具体取决于硬件和模型架构。
ExLlamav3 最新更新:CPU卸载、GLM-5.3-FLASH、Qwen3.8-Flash、SC Quants ++
ExLlamav3 发布了重大更新,包括 MoE 专家的 CPU 卸载、对新 AI 模型如 GLM-5.3-Flash 和 Qwen-3.8-Flash 的支持,以及各种性能优化。
ExLlamaV3 重大更新!
ExLlamaV3 发布了一系列重大更新,包括对 Gemma 4 的支持、缓存效率的提升,以及新的 DFlash 技术,可显著提高各类模型的推理速度。
@no_stp_on_snek: 当所有人都在讨论 @SpaceXAI、@AnthropicAI 和 @OpenAI 的更新(但 @GoogleAI 呢?)... 我去测试了…
Unsloth 的 NVFP4 量化模型在 vLLM 和 llama.cpp 之间推理性能的详细比较,重点说明了 vLLM 在预填充速度上的优势,但 llama.cpp 在单流智能体工作负载中的解码和缓存优势。