DeepSeek-V4.1-Flash:推动KV缓存压缩的极限

Hugging Face Daily Papers 论文

摘要

介绍了DeepSeek-V4.1-Flash,一个多模态混合专家(MoE)模型,拥有552B参数,采用先进的KV缓存压缩技术,以降低部署成本并提升长上下文代理工作负载的效率。

长期代理的广泛采用使得模型工作负载日益以输入为主。尽管先前的工作已大幅降低了长上下文计算的成本,但预填充阶段仍然计算开销巨大,而大型KV缓存继续对HBM和SSD的容量及数据传输带宽造成压力。这些计算、存储和带宽需求共同构成了进一步降低部署成本的主要瓶颈。为了解决这一挑战,我们推出了DeepSeek-V4.1-Flash,一个多模态混合专家(MoE)模型,具有552B主干参数,支持多达一百万令牌的上下文。借助其因果编码器-解码器(CED)架构,该模型在解码时激活16B参数,而在预填充时仅激活8B参数,从而显著提升了代理工作负载的成本效率。为了推动KV缓存压缩的极限,DeepSeek-V4.1-Flash将压缩稀疏注意力2(CSA2)中的跨层KV缓存重用与FP4 KV缓存相结合。这些设计将其全局KV缓存占用空间(始终位于HBM中)减少到每令牌890字节,大约是DeepSeek-V4-Flash对应占用空间的四分之一。此外,通过一种称为SWA Bounded Replay的专用部署优化,DeepSeek-V4.1-Flash将其持久KV缓存占用空间(始终位于SSD或主机内存中)减少到DeepSeek-V4-Flash的大约八分之一。尽管KV缓存占用空间更小,但该模型的性能显著优于基线。此外,我们精简了DeepSeek-V4架构,并引入了多种高效的架构扩展。我们在包含45T令牌的多模态语料库上对DeepSeek-V4.1-Flash进行了预训练,并进行了全面的后训练,使其在多种基于文本和多模态的代理场景中表现出色。模型检查点可在https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash获取。
查看原文
查看缓存全文

缓存时间: 2026/09/18 02:59

论文页面 - DeepSeek-V4.1-Flash:突破KV缓存压缩的极限

来源: https://huggingface.co/papers/2609.19969 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

长期智能体的广泛采用使模型工作负载日益倾向于输入密集型。尽管先前工作已显著降低了长上下文计算的成本,但预填充阶段的计算开销依然高昂,而大型KV缓存持续对高带宽内存和固态硬盘的容量及数据传输带宽造成压力。这些计算、存储和带宽需求共同构成了进一步降低部署成本的主要瓶颈。为应对这一挑战,我们推出了DeepSeek-V4.1-Flash——一个支持多达百万级上下文长度的多模态混合专家模型,其主干网络包含552B参数。凭借因果编码器-解码器架构,该模型在解码阶段激活16B参数,而在预填充阶段仅激活8B参数,显著提升了面向智能体工作负载的成本效率。为突破KV缓存压缩的极限,DeepSeek-V4.1-Flash结合了压缩稀疏注意力2中的跨层KV缓存复用机制与FP4 KV缓存量化技术。这些设计使其全局KV缓存占用量降至890字节/标记(始终存储于高带宽内存),约为DeepSeek-V4-Flash对应占用量的四分之一。此外,通过名为“滑动窗口有界重放”的专用部署优化,DeepSeek-V4.1-Flash将其持久化KV缓存占用量(始终存储于固态硬盘或主机内存)降至DeepSeek-V4-Flash的大约八分之一。尽管KV缓存占用量大幅缩减,该模型性能仍显著优于基线模型。同时,我们精简了DeepSeek-V4架构并引入了多项高效架构扩展。我们在包含45万亿标记的多模态语料库上对DeepSeek-V4.1-Flash进行了预训练,并执行了全面的后训练,使其在各类基于文本和多模态的智能体场景中均展现出卓越性能。模型检查点可在 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash 获取。

查看arXiv页面 (https://arxiv.org/abs/2609.19969) 查看PDF (https://arxiv.org/pdf/2609.19969) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.19969)

引用本文的模型 0

无模型链接本文

在模型README.md中引用 arxiv.org/abs/2609.19969 以从此页面链接。

引用本文的数据集 0

无数据集链接本文

在数据集README.md中引用 arxiv.org/abs/2609.19969 以从此页面链接。

引用本文的Space 0

无Space链接本文

在Space README.md中引用 arxiv.org/abs/2609.19969 以从此页面链接。

包含本文的收藏夹 0

无收藏夹包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

FlashMemory DeepSeek-V4 检索器(GitHub仓库)

TLDR AI

介绍了FlashMemory DeepSeek-V4检索器,这是一个轻量级模型,通过预测接下来将关注哪些块来稀疏化DeepSeek-V4的CSA KV缓存,仅保留约10-15%在设备上,同时匹配全注意力性能。

DeepSeek-V4-Flash-0731

Product Hunt

DeepSeek 宣布推出 DeepSeek-V4-Flash-0731,这是一款以 Flash 级别定价提供先进能力的前沿智能体模型。

deepseek-ai/DeepSeek-V4-Flash-DSpark

Hugging Face Models Trending

DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。

DeepSeek v4.1 Flash

Hacker News Top

DeepSeek 推出了 DeepSeek-V4.1-Flash,这是一款旨在增强能力、提升推理速度、实现原生视觉理解并具备可扩展性的新型 AI 模型,是其最新架构系列的一部分。