ExLlamav3 最新更新:CPU卸载、GLM-5.3-FLASH、Qwen3.8-Flash、SC Quants ++

Reddit r/LocalLLaMA 工具

摘要

ExLlamav3 发布了重大更新,包括 MoE 专家的 CPU 卸载、对新 AI 模型如 GLM-5.3-Flash 和 Qwen-3.8-Flash 的支持,以及各种性能优化。

turboderp 带来更多重大更新: - MoE 专家的 CPU 卸载 - Qwen-3.8-Flash-Next 的 ngram 磁盘卸载 - GLM-5.3-Flash - 新的自校准优化技术 - 无数其他优化和改进 如果您有 NVIDIA 显卡并且最近没有尝试,可能会错过一些东西。附上的猫图像是使用 Qwen-3.8-Flash-Next-3.05bpw-exl3 和这个提示词生成的:创建一个可爱小猫骑着魔法乌龟进入太空的详细 SVG 图像。快来加入 exllama 的 Discord 团队,在 exllama sub 上查看更多新闻。
查看原文

相似文章

ExLlamaV3 重大更新!

Reddit r/LocalLLaMA

ExLlamaV3 发布了一系列重大更新,包括对 Gemma 4 的支持、缓存效率的提升,以及新的 DFlash 技术,可显著提高各类模型的推理速度。

GLM-5.3-Flash

Hacker News Top

发布 GLM-5.3-Flash,这是一款针对快速推理和性能更新进行了优化的 AI 语言模型。