Tag
ExLlamav3 has released major updates including CPU offload for MoE experts, support for new AI models like GLM-5.3-Flash and Qwen-3.8-Flash, and various performance optimizations.
ExLlamaV3 v1.0.0 brings major performance upgrades for running large language models locally.