期待优化后的更智能的未来模型 .... 如 DeepSeek-V4.1-Flash (KVCache + Engram) 在小/中/大尺寸上的应用

Reddit r/LocalLLaMA 新闻

摘要

文章表达了对未来AI模型的期望,这些模型采用KVCache和Engram等优化技术来减少内存使用,使得更大的模型能够在显存有限的消费级GPU上运行。

对于许多人来说,在GPU上运行中等尺寸(约300亿参数)的Q8量化模型,配合未量化的KVCache(256K上下文)仍然是一个梦想。如果所有未来模型都能采用DeepSeek-V4.1-Flash的KVCache + Engram技术,那将非常棒。即使是大模型也是如此。Engram - 据说大约占模型大小的1/3到1/2。可能也会有不同的尺寸范围。因此对于300亿参数的模型,大约需要10-15 GB。这里列出了一些模型及其近似数值。当前模型在奇数行,未来/假设模型在偶数行(加粗)。尽管DeepSeek-V4.1-Flash对于100万上下文仅需1GB,但我下面仍为256K上下文标注了1GB。 型号 模型大小 256K KVCache F16 MTP Vision 总GB Qwen3.8-27B-Q8 29 16 1 1 47 **Qwen4.0-27B-Q8** 29 1 1 1 32 Qwen3.8-27B-Q4_K_M 17 16 1 1 35 **Qwen4.0-27B-Q4_K_M** 17 1 1 1 20 Muse-Glimmer-30B-Q8 30 16 1 1 48 **Muse-Glimmer-2-30B-Q8** 30 1 1 1 33 Gemma-4-31B 33 16 1 1 51 **Gemma-5-31B** 33 1 1 1 36 Qwen3.6-35B-A3B-Q4_K_M 23 6 1 1 31 **Qwen4.0-35B-A3B-Q4_K_M** 23 1 1 1 26 Gemma-4-26B-A4B-Q8 27 6 1 1 35 **Gemma-5-26B-A4B-Q8** 27 1 1 1 30 可能还有其他一些方法(请分享)可以进一步降低这些数值。因此,我认为32GB显存对于未来(优化后更智能)的模型来说绰绰有余。内存足以容纳Engram。基于上述逻辑(以Qwen4.0-27B为例),人们可以在相同的32GB显存下运行540亿参数的Q4量化模型。也许从明年开始,新技术可能使24GB显存足以运行类似尺寸的模型。
查看原文

相似文章

FlashMemory DeepSeek-V4 检索器(GitHub仓库)

TLDR AI

介绍了FlashMemory DeepSeek-V4检索器,这是一个轻量级模型,通过预测接下来将关注哪些块来稀疏化DeepSeek-V4的CSA KV缓存,仅保留约10-15%在设备上,同时匹配全注意力性能。

@karminski3: 魔法! DeepSeekV4 上下文内存压缩到1/10! 大家都知道 DeepSeekV4 是支持1M上下文的, 而且经过了极度优化, 如果要真的用到1M上下文, 显存占用只需要10G左右, (对比之下 DeepSeek-V3.2 大概需…

X AI KOLs Following

FlashMemory-DeepSeek-V4提出了一种名为Lookahead Sparse Attention(LSA)的新型推理范式,通过神经内存索引器主动预测未来上下文需求,将物理KV缓存占用压缩至全上下文基线的13.5%,同时平均精度提升0.6%。该方法采用解耦训练策略,无需加载基座模型即可独立训练索引器,显著降低训练成本。