KV缓存对本地模型可能比参数数量更成问题

Reddit r/LocalLLaMA 新闻

摘要

文章强调KV缓存在长上下文推理中是本地AI模型的关键内存瓶颈,并指出未来的优化将从减少参数数量转向减少内存移动和持久状态。

大家都一直在讨论如何将更大的模型适配到本地硬件,但参数数量并不是全部。对于长上下文推理,KV缓存可能成为真正的内存瓶颈。每个新token都需要保持键值状态可用,因此一个在VRAM中运行良好的模型,在100k或200k上下文时可能会变得棘手。GQA和MQA通过减少KV头来帮助,KV缓存量化更有帮助,但缓存仍随上下文增长。这让我想到,未来的本地模型优化将不那么关注简单减少参数数量,而更多关注减少内存移动和持久状态。有趣的问题是,我们最终是否会围绕模型'需要记住多少'来优化,而不是仅仅看它有多少参数。
查看原文

相似文章