FlashMemory-DeepSeek-V4:通过前瞻稀疏注意力实现闪电索引超长上下文

Hugging Face Daily Papers 论文

摘要

提出在DeepSeek-V4上结合神经记忆索引器的前瞻稀疏注意力,将GPU内存使用降至全上下文基线的约13.5%,同时保持或略微提升准确率。

传统大语言模型在解码过程中保持完整KV缓存加载,导致超长上下文服务时出现严重的GPU内存瓶颈。在本报告中,我们提出前瞻稀疏注意力(LSA),一种基于DeepSeek-V4架构构建的神经记忆索引器驱动的新型推理范式。LSA并非被动关注所有历史词元,而是主动预测未来上下文需求,仅将查询关键的KV块保留在GPU内存中。关键在于,我们通过无骨干解耦训练策略实例化该架构。通过将索引器构建为标准双编码器架构,我们使用标准检索训练框架独立训练它,而无需将庞大的骨干模型加载到GPU内存中。 我们证明,这种“少即是多”范式显著最大化服务效率,同时在依赖长期全局记忆的任务中充当有效的注意力去噪器。在主要长上下文评估套件(如LongBench-v2、LongMemEval和RULER)中,FM-DS-V4将平均物理KV缓存占用压缩至全上下文基线的仅13.5%,同时持续保持或略微提升下游准确率(平均绝对提升+0.6%)。关键的是,在极端500K规模下,FlashMemory将物理KV缓存开销抑制超过90%,且不破坏骨干核心推理能力的稳定性。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:42

论文页面 - FlashMemory-DeepSeek-V4: 通过前瞻稀疏注意力实现闪电般超长上下文

来源:https://huggingface.co/papers/2606.09079

作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

基于神经记忆索引器的前瞻稀疏注意力,通过主动式键值缓存管理和解耦训练,在保持准确性的同时降低了长上下文大语言模型推理的GPU内存占用。

传统大语言模型(https://huggingface.co/papers?q=LLMs)在解码(https://huggingface.co/papers?q=decoding)过程中保持完整键值缓存(https://huggingface.co/papers?q=KV%20cache)加载,导致超长上下文服务出现严重的GPU内存瓶颈。在本文中,我们提出前瞻稀疏注意力(https://huggingface.co/papers?q=Lookahead%20Sparse%20Attention)(LSA),这是一种基于DeepSeek-V4架构构建的神经记忆索引器(https://huggingface.co/papers?q=Neural%20Memory%20Indexer)驱动的新型推理范式。LSA并非被动地关注所有历史词元,而是主动预测未来上下文需求,仅将查询关键的键值块保留在GPU内存中。关键之处在于,我们通过无主干的解耦训练策略实例化了该架构。通过将索引器构建为标准双编码器架构(https://huggingface.co/papers?q=dual-encoder%20architecture),我们使用标准检索训练框架独立训练该索引器,无需将庞大的主干模型加载到GPU内存中。我们证明这种“少即是多“的范式在显著提升服务效率的同时,能够在依赖长期全局记忆的任务中充当有效的注意力去噪器(https://huggingface.co/papers?q=attention%20denoiser)。在主要的长上下文评估(https://huggingface.co/papers?q=long-context%20evaluation)套件(如LongBench-v2、LongMemEval和RULER)上,FM-DS-V4将平均物理键值缓存(https://huggingface.co/papers?q=KV%20cache)占用压缩至完整上下文基线的仅13.5%,同时一致保持或略微提升下游准确性(平均绝对边际+0.6%)。至关重要的是,在极端500K规模下,FlashMemory(https://huggingface.co/papers?q=FlashMemory)将物理键值缓存(https://huggingface.co/papers?q=KV%20cache)开销抑制超过90%,且不会破坏主干的核心推理能力。

查看arXiv页面(https://arxiv.org/abs/2606.09079)查看PDF(https://arxiv.org/pdf/2606.09079)GitHub1(https://github.com/libertywing/FlashMemory-Deepseek-V4)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.09079)

在你的智能体中获取此论文:

hf papers read 2606\.09079

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型1个

libertywing/FlashMemory-Deepseek-V4 更新于约5小时前 • 6(https://huggingface.co/libertywing/FlashMemory-Deepseek-V4)

引用本论文的数据集0个

没有链接该论文的数据集

在数据集的README.md中引用arxiv.org/abs/2606.09079,即可从此页面链接。

引用本论文的Space0个

没有链接该论文的Space

在Space的README.md中引用arxiv.org/abs/2606.09079,即可从此页面链接。

包含本论文的收藏2个

相似文章

FlashMemory DeepSeek-V4 检索器(GitHub仓库)

TLDR AI

介绍了FlashMemory DeepSeek-V4检索器,这是一个轻量级模型,通过预测接下来将关注哪些块来稀疏化DeepSeek-V4的CSA KV缓存,仅保留约10-15%在设备上,同时匹配全注意力性能。

@karminski3: 魔法! DeepSeekV4 上下文内存压缩到1/10! 大家都知道 DeepSeekV4 是支持1M上下文的, 而且经过了极度优化, 如果要真的用到1M上下文, 显存占用只需要10G左右, (对比之下 DeepSeek-V3.2 大概需…

X AI KOLs Following

FlashMemory-DeepSeek-V4提出了一种名为Lookahead Sparse Attention(LSA)的新型推理范式,通过神经内存索引器主动预测未来上下文需求,将物理KV缓存占用压缩至全上下文基线的13.5%,同时平均精度提升0.6%。该方法采用解耦训练策略,无需加载基座模型即可独立训练索引器,显著降低训练成本。

Deepseek V4 Flash 在 RTX 5090 MoE 上运行

Reddit r/LocalLLaMA

用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。

SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力

arXiv cs.CL

SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。