有人似乎成功复制了V4.1 flash在KV上为Qwen实现快速预填充的功能

Reddit r/LocalLLaMA 新闻

摘要

有人复制了一种类似于V4.1 flash的技术,使用KV缓存为Qwen模型实现快速预填充,并有一个演示可供在27B版本上测试。

我想知道是否有人能找到在27B上实现这个的方法?在页面https://kishida.github.io/webdemos/llkvapprox/上添加Qwen3用于演示。
查看原文

相似文章

Qwen3.8 Flash AP Quants

Reddit r/LocalLLaMA

该帖子宣布了Qwen3.8 Flash模型的新量化版本,通过改进的KLD测量和优化的预填充性能,超越了其他高质量量化版本。

您可以将Qwen3.8-Flash-Next模型的大部分KV缓存卸载到RAM中,而不会明显影响解码速度。 在使用8bit量化的Qwen3.8-Flash-Next模型时,KV缓存大小约为每token 12.5MB。通过将大部分KV缓存从显存移至RAM,并只在显存中保留少量热数据,可以显著扩大显存能够支持的上下文长度。这种混合存储方式仅会增加约1.2ms的延迟,对实际推理速度影响微乎其微,为处理超长上下文提供了一种高效且低成本的解决方案。

Reddit r/LocalLLaMA

演示了将Qwen3.8-Flash-Next模型的KV缓存卸载至系统内存的技术,通过利用该模型高效架构,可在最大程度减少解码速度下降的情况下支持长上下文推理。