@QuixiAI: 教训总结:始终使用BF16 KV缓存。我之前用的是turboquant。是的,VRAM消耗很糟糕——所以另一个技巧是…
摘要
作者分享了使用BF16 KV缓存而非turboquant进行AI模型优化的技术经验,并在SlimServe中为Qwen模型实现了CPU卸载以管理VRAM消耗。
查看缓存全文
缓存时间: 2026/08/29 12:04
经验教训:
务必使用 BF16 缓存键值对。
我曾使用 turboquant 方案,
VRAM占用确实很严重——因此另一个优化技巧是将键值对缓存卸载至CPU。
已在 SlimServe 中为 3090 显卡与 Qwen 模型实现此方案(需经过大量调试才能完善)
后续计划将其扩展为支持所有模型的通用方案。
目前正通过 Clearwing 平台评估 Quen3.8-Flash-Next 模型性能。
Eric Hartford (@QuixiAI): 使用 Qwen3.8-Flash-Next 时发现,它甚至无法跟踪多轮对话。该模型会回答我两轮对话前提问的内容。 以上结论基于 FP8 精度测试。
相似文章
16GB显存炼狱讨论帖
一个讨论帖,分享在16GB显存Windows系统上运行AI模型如Qwen3.8-27B的配置和技巧,专注于内存优化技术。
Qwen3.8-27b q8 KV缓存似乎确实损害模型性能
本文讨论了基于Qwen3.8-27B的实验,如何实时KV缓存量化因累积误差而降低长上下文模型的性能。
@sakurayukiai: 通过计算推测模型的KV缓存字节数(而非将其隐藏在平坦的显存缓冲中),Unsloth将Qwen…
Unsloth通过精确计算推测模型的KV缓存字节数(而非使用平坦的显存缓冲),将Qwen3.6-27B Q6_K在单张32GB显卡上的上下文长度从23K提升至64K。
@TheAhmadOsman: 一直在玩@PrismML的新模型,该模型将Qwen 3.5 27B变成了子4GB和子6GB的权重,令我印象深刻 C…
PrismML发布了一个压缩版的Qwen 3.5 27B,可以装入子4GB和子6GB内存中,实现了令人印象深刻的本地AI性能。
@TraffAlex: 32GB VRAM的AI模型 — 前17名速查表 调用HuggingFace API,获取了真实的.gguf Q4大小。每个链接均为直接下载…
一份速查表,列出了使用GGUF Q4量化针对32GB VRAM优化的顶级AI模型,并提供来自HuggingFace的直接下载链接。包含Qwen、DeepSeek、Llama和Mistral系列的模型,以及关于量化和上下文设置的提示。