FlashMemory-DeepSeek-V4:通过前瞻稀疏注意力实现闪电索引超长上下文
摘要
提出在DeepSeek-V4上结合神经记忆索引器的前瞻稀疏注意力,将GPU内存使用降至全上下文基线的约13.5%,同时保持或略微提升准确率。
查看缓存全文
缓存时间: 2026/06/09 08:42
论文页面 - FlashMemory-DeepSeek-V4: 通过前瞻稀疏注意力实现闪电般超长上下文
来源:https://huggingface.co/papers/2606.09079
作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
基于神经记忆索引器的前瞻稀疏注意力,通过主动式键值缓存管理和解耦训练,在保持准确性的同时降低了长上下文大语言模型推理的GPU内存占用。
传统大语言模型(https://huggingface.co/papers?q=LLMs)在解码(https://huggingface.co/papers?q=decoding)过程中保持完整键值缓存(https://huggingface.co/papers?q=KV%20cache)加载,导致超长上下文服务出现严重的GPU内存瓶颈。在本文中,我们提出前瞻稀疏注意力(https://huggingface.co/papers?q=Lookahead%20Sparse%20Attention)(LSA),这是一种基于DeepSeek-V4架构构建的神经记忆索引器(https://huggingface.co/papers?q=Neural%20Memory%20Indexer)驱动的新型推理范式。LSA并非被动地关注所有历史词元,而是主动预测未来上下文需求,仅将查询关键的键值块保留在GPU内存中。关键之处在于,我们通过无主干的解耦训练策略实例化了该架构。通过将索引器构建为标准双编码器架构(https://huggingface.co/papers?q=dual-encoder%20architecture),我们使用标准检索训练框架独立训练该索引器,无需将庞大的主干模型加载到GPU内存中。我们证明这种“少即是多“的范式在显著提升服务效率的同时,能够在依赖长期全局记忆的任务中充当有效的注意力去噪器(https://huggingface.co/papers?q=attention%20denoiser)。在主要的长上下文评估(https://huggingface.co/papers?q=long-context%20evaluation)套件(如LongBench-v2、LongMemEval和RULER)上,FM-DS-V4将平均物理键值缓存(https://huggingface.co/papers?q=KV%20cache)占用压缩至完整上下文基线的仅13.5%,同时一致保持或略微提升下游准确性(平均绝对边际+0.6%)。至关重要的是,在极端500K规模下,FlashMemory(https://huggingface.co/papers?q=FlashMemory)将物理键值缓存(https://huggingface.co/papers?q=KV%20cache)开销抑制超过90%,且不会破坏主干的核心推理能力。
查看arXiv页面(https://arxiv.org/abs/2606.09079)查看PDF(https://arxiv.org/pdf/2606.09079)GitHub1(https://github.com/libertywing/FlashMemory-Deepseek-V4)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.09079)
在你的智能体中获取此论文:
hf papers read 2606\.09079
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型1个
libertywing/FlashMemory-Deepseek-V4 更新于约5小时前 • 6(https://huggingface.co/libertywing/FlashMemory-Deepseek-V4)
引用本论文的数据集0个
没有链接该论文的数据集
在数据集的README.md中引用arxiv.org/abs/2606.09079,即可从此页面链接。
引用本论文的Space0个
没有链接该论文的Space
在Space的README.md中引用arxiv.org/abs/2606.09079,即可从此页面链接。
包含本论文的收藏2个
相似文章
FlashMemory DeepSeek-V4 检索器(GitHub仓库)
介绍了FlashMemory DeepSeek-V4检索器,这是一个轻量级模型,通过预测接下来将关注哪些块来稀疏化DeepSeek-V4的CSA KV缓存,仅保留约10-15%在设备上,同时匹配全注意力性能。
@karminski3: 魔法! DeepSeekV4 上下文内存压缩到1/10! 大家都知道 DeepSeekV4 是支持1M上下文的, 而且经过了极度优化, 如果要真的用到1M上下文, 显存占用只需要10G左右, (对比之下 DeepSeek-V3.2 大概需…
FlashMemory-DeepSeek-V4提出了一种名为Lookahead Sparse Attention(LSA)的新型推理范式,通过神经内存索引器主动预测未来上下文需求,将物理KV缓存占用压缩至全上下文基线的13.5%,同时平均精度提升0.6%。该方法采用解耦训练策略,无需加载基座模型即可独立训练索引器,显著降低训练成本。
FlashPrefill V2:面向长上下文LLM服务的块稀疏预填充注意力
FlashPrefill V2通过均值校正的稀疏注意力和优化的GPU算子改善了长上下文LLM服务,相比FlashAttention-2和稠密基线提供了显著的加速。
DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行
一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。
@jakevin7: 哇靠,这太惊人了!DeepSeek,这真的只是小版本的微调吗???V4.1 Flash 做了大量……
DeepSeek V4.1 Flash 引入了针对长上下文处理的架构改进,包括因果编码器-解码器、CSA2、分层稀疏索引器和量化,从而大幅优化了内存和计算。