FlashMemory-DeepSeek-V4:通过前瞻稀疏注意力实现闪电索引超长上下文
摘要
提出在DeepSeek-V4上结合神经记忆索引器的前瞻稀疏注意力,将GPU内存使用降至全上下文基线的约13.5%,同时保持或略微提升准确率。
查看缓存全文
缓存时间: 2026/06/09 08:42
论文页面 - FlashMemory-DeepSeek-V4: 通过前瞻稀疏注意力实现闪电般超长上下文
来源:https://huggingface.co/papers/2606.09079
作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
基于神经记忆索引器的前瞻稀疏注意力,通过主动式键值缓存管理和解耦训练,在保持准确性的同时降低了长上下文大语言模型推理的GPU内存占用。
传统大语言模型(https://huggingface.co/papers?q=LLMs)在解码(https://huggingface.co/papers?q=decoding)过程中保持完整键值缓存(https://huggingface.co/papers?q=KV%20cache)加载,导致超长上下文服务出现严重的GPU内存瓶颈。在本文中,我们提出前瞻稀疏注意力(https://huggingface.co/papers?q=Lookahead%20Sparse%20Attention)(LSA),这是一种基于DeepSeek-V4架构构建的神经记忆索引器(https://huggingface.co/papers?q=Neural%20Memory%20Indexer)驱动的新型推理范式。LSA并非被动地关注所有历史词元,而是主动预测未来上下文需求,仅将查询关键的键值块保留在GPU内存中。关键之处在于,我们通过无主干的解耦训练策略实例化了该架构。通过将索引器构建为标准双编码器架构(https://huggingface.co/papers?q=dual-encoder%20architecture),我们使用标准检索训练框架独立训练该索引器,无需将庞大的主干模型加载到GPU内存中。我们证明这种“少即是多“的范式在显著提升服务效率的同时,能够在依赖长期全局记忆的任务中充当有效的注意力去噪器(https://huggingface.co/papers?q=attention%20denoiser)。在主要的长上下文评估(https://huggingface.co/papers?q=long-context%20evaluation)套件(如LongBench-v2、LongMemEval和RULER)上,FM-DS-V4将平均物理键值缓存(https://huggingface.co/papers?q=KV%20cache)占用压缩至完整上下文基线的仅13.5%,同时一致保持或略微提升下游准确性(平均绝对边际+0.6%)。至关重要的是,在极端500K规模下,FlashMemory(https://huggingface.co/papers?q=FlashMemory)将物理键值缓存(https://huggingface.co/papers?q=KV%20cache)开销抑制超过90%,且不会破坏主干的核心推理能力。
查看arXiv页面(https://arxiv.org/abs/2606.09079)查看PDF(https://arxiv.org/pdf/2606.09079)GitHub1(https://github.com/libertywing/FlashMemory-Deepseek-V4)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.09079)
在你的智能体中获取此论文:
hf papers read 2606\.09079
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型1个
libertywing/FlashMemory-Deepseek-V4 更新于约5小时前 • 6(https://huggingface.co/libertywing/FlashMemory-Deepseek-V4)
引用本论文的数据集0个
没有链接该论文的数据集
在数据集的README.md中引用arxiv.org/abs/2606.09079,即可从此页面链接。
引用本论文的Space0个
没有链接该论文的Space
在Space的README.md中引用arxiv.org/abs/2606.09079,即可从此页面链接。
包含本论文的收藏2个
相似文章
FlashMemory DeepSeek-V4 检索器(GitHub仓库)
介绍了FlashMemory DeepSeek-V4检索器,这是一个轻量级模型,通过预测接下来将关注哪些块来稀疏化DeepSeek-V4的CSA KV缓存,仅保留约10-15%在设备上,同时匹配全注意力性能。
@karminski3: 魔法! DeepSeekV4 上下文内存压缩到1/10! 大家都知道 DeepSeekV4 是支持1M上下文的, 而且经过了极度优化, 如果要真的用到1M上下文, 显存占用只需要10G左右, (对比之下 DeepSeek-V3.2 大概需…
FlashMemory-DeepSeek-V4提出了一种名为Lookahead Sparse Attention(LSA)的新型推理范式,通过神经内存索引器主动预测未来上下文需求,将物理KV缓存占用压缩至全上下文基线的13.5%,同时平均精度提升0.6%。该方法采用解耦训练策略,无需加载基座模型即可独立训练索引器,显著降低训练成本。
DeepSeek v4 Flash 在 4090 + DDR5 上的体验
一位用户分享了在 24GB 显卡和 DDR5 内存上运行 DeepSeek v4 Flash 模型的体验,包括性能数据和优化技巧。
Deepseek V4 Flash 在 RTX 5090 MoE 上运行
用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。
SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力
SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。