ExLlamav3 最新更新:CPU卸载、GLM-5.3-FLASH、Qwen3.8-Flash、SC Quants ++
摘要
ExLlamav3 发布了重大更新,包括 MoE 专家的 CPU 卸载、对新 AI 模型如 GLM-5.3-Flash 和 Qwen-3.8-Flash 的支持,以及各种性能优化。
turboderp 带来更多重大更新:
- MoE 专家的 CPU 卸载
- Qwen-3.8-Flash-Next 的 ngram 磁盘卸载
- GLM-5.3-Flash
- 新的自校准优化技术
- 无数其他优化和改进
如果您有 NVIDIA 显卡并且最近没有尝试,可能会错过一些东西。附上的猫图像是使用 Qwen-3.8-Flash-Next-3.05bpw-exl3 和这个提示词生成的:创建一个可爱小猫骑着魔法乌龟进入太空的详细 SVG 图像。快来加入 exllama 的 Discord 团队,在 exllama sub 上查看更多新闻。
相似文章
ExLlamaV3 重大更新!
ExLlamaV3 发布了一系列重大更新,包括对 Gemma 4 的支持、缓存效率的提升,以及新的 DFlash 技术,可显著提高各类模型的推理速度。
ExLlamaV3 v1.0.0 - 重大性能升级
ExLlamaV3 v1.0.0 为本地运行大型语言模型带来了重大性能升级。
BeeLlama.cpp:支持推理和视觉的先进 DFlash 与 TurboQuant。在 RTX 3090 上以 200k 上下文运行 Qwen 3.6 27B Q5,速度比基线快 2-3 倍(峰值 135 tps!)
BeeLlama.cpp 是一个专注于性能的 llama.cpp 分支,引入了 DFlash 投机解码和 TurboQuant KV 缓存压缩技术,使得在消费级硬件上也能高速本地运行像 Qwen 3.6 27B 这样的大型模型。
GLM-5.3-Flash
发布 GLM-5.3-Flash,这是一款针对快速推理和性能更新进行了优化的 AI 语言模型。
llama.cpp 已合并对 Qwen3.8-Flash-Next 的支持
对 Qwen3.8-Flash-Next 模型的支持已合并至 llama.cpp,增强了其 C/C++ 本地大语言模型推理的能力。