首次本地LLM调优尝试:在RTX 5080 16GB上实现Qwen3.8-27B真实Q4_K_M量化,上下文长度约50-61K时速度为13.2 tok/s

Reddit r/LocalLLaMA 新闻

摘要

一位用户详细描述了他们首次在RTX 5080 16GB上对Qwen3.8-27B模型进行Q4_K_M量化的调优尝试,通过选择性将FFN张量卸载到CPU,在50-61K上下文长度下实现了约13.2 tokens per second的速度,以提升性能。

这是我首次认真尝试调优本地LLM。起初,Qwen3.8-27B IQ3在我的RTX 5080上运行速度很快,但编码质量令我失望,而且我在LM Studio中尝试的Q4配置文件比这里的报告慢得多。硬件:RTX 5080 16 GB,i5-14600K,64 GB DDR5-5600(4根DIMM条),Windows。最终模型/运行时:Unsloth Qwen3.8-27B UD-Q4_K_M,未修改(16.46 GB),官方 llama.cpp b10760 CUDA 13.3 构建 65,536 上下文,单槽 Q4_0 K/V 缓存,Flash Attention 中等思考,仅文本 Pi 作为编码代理。结果:49,738 输入 tokens:13.247 / 13.260 / 13.261 tok/s 跨三次运行;61,238 输入 tokens:13.055 tok/s;每次运行中 4/4 检索成功。Pi 读取了一个破损的实现和一个单独的测试,仅编辑了实现,运行 PowerShell,并通过了测试。有用的改变是选择性FFN放置。我将注意力/KV和大部分张量保留在GPU上,但将16个最大的FFN张量组(约2.764 GiB)移动到CPU。在LM Studio中整个层卸载仅给我在约50K时6.633 tok/s。MTP在这台机器上在深度上下文时表现更差。MTP1达到8.654 tok/s,MTP3达到7.810 tok/s,而禁用MTP达到13.256 tok/s。我猜测是CPU端的草稿与溢出的FFN竞争RAM带宽。我最初追逐最近关于5080的约75 tok/s的帖子,但链接的13.5 GB自定义量化使用IQ3_S作为其FFN张量。这是一个有效的速度权衡,但我特别想要真实的Q4权重和深度上下文测量。我在这里发布了确切的Windows启动器、张量覆盖、Pi配置、基准测试工具、原始结果、模型SHA、失败的配置和方法:https://github.com/johnconnor2020/qwen38-27b-rtx5080-16gb。注意事项:召回提示是合成的,Pi任务是实际的冒烟测试,而非LiveCodeBench/SWE-bench,运行2/3重用了提示缓存进行摄取(解码速度保持不变)。这也可能对RAM带宽和llama.cpp版本敏感。我非常有兴趣看到其他16 GB卡上类似的真实Q4 50K+结果,或建议一个更好的编码质量基准,便于在本地运行。
查看原文

相似文章

Qwen3.6:35b UD Q4_K_M 在 Nvidia P40 上实现 80 tok/s

Reddit r/LocalLLaMA

一位用户分享在单个 Nvidia P40 上使用 TheTom 的 TurboQuant 版 llama.cpp,以 Q4_K_M 量化方式和 100k 上下文运行 Qwen3.6 35B 模型,实现了 80 tok/s,并强调了多种优化。