标签
llama.cpp的一个新PR将ROCm上的提示处理速度提升了约15%,并修复了一个bug,使Q2_K量化速度提升了28倍。
GLM 5.2模型使用Q2_K量化路由专家(有效2.6位)在M5 Max 128GB计算机上通过SSD流式运行。