ExLlamaV3 被低估了

Reddit r/LocalLLaMA 工具

摘要

作者推荐ExLlamaV3,这是一个被低估的本地AI推理工具,在NVIDIA硬件上性能优于llama.cpp,最近的更新如CPU MoE卸载提升了其性能。

我发布这个可能会被喷,但我觉得这个软件没被充分讨论,这么好的软件浪费了很可惜。Exl3 非常出色,虽然我认为只有NVIDIA显卡才行?Exl3的量化质量更高,KLD指标低得多,速度更快,所有这些相比llama.cpp,都是基于我对我本地模型的一些个人测试(不是基准测试)。从我读到的信息看,CPU MoE卸载是最近才添加的,所以也许这就是为什么之前用的人不多?从那以后也有很多更新,我只是对它感到兴奋。这就像我玩过ik_llama、beellama、llamacpp等之后,找到了一个新玩具。我一直在用tabbyAPI exl3 backend + qwen 3.8 27b sc 6bpw H6和qwen 3.8 flash next 4bpw作为我的日常工具,它能做的事情太不可思议了。我希望这个软件能被更多人知道。我和他们没有任何关联,我只是想分享。它太酷了,请试一试!!
查看原文

相似文章

ExLlamaV3 重大更新!

Reddit r/LocalLLaMA

ExLlamaV3 发布了一系列重大更新,包括对 Gemma 4 的支持、缓存效率的提升,以及新的 DFlash 技术,可显著提高各类模型的推理速度。