@modal:DeepSeek-V4-Flash 总参数为 284B,每个 token 激活 13B。结合混合压缩注意力机…
摘要
DeepSeek-V4-Flash 是一个 284B 参数的 MoE 模型,每 token 激活 13B 参数,采用混合压缩注意力机制,可降低 1M token 上下文的 KV 缓存需求。可使用 Modal 上的 SGLang 提供服务,在单个 B300 上实现快速解码。
查看缓存全文
缓存时间: 2026/08/04 14:13
DeepSeek-V4-Flash 总参数为 284B,每个 token 激活 13B 参数。
结合混合压缩注意力机制,大幅降低了 1M token 上下文任务的 KV 缓存需求。
使用 SGLang 在 Modal 上部署。在单个 B300 上快速解码,无需支付 https://t.co/CslBGcsQFH
相似文章
deepseek-ai/DeepSeek-V4-Flash-DSpark
DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。
deepseek-ai/DeepSeek-V4-Flash
DeepSeek 发布 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro,新一代 MoE 语言模型,支持 100 万 token 上下文,效率和性能均有提升。
deepseek-ai/DeepSeek-V4-Pro-DSpark
DeepSeek 发布了其 V4 系列的预览版本,包括 DeepSeek-V4-Pro(1.6T 参数,49B 激活)和 DeepSeek-V4-Flash(284B 参数,13B 激活),两者均支持百万 Token 上下文,并采用混合注意力、流形约束超连接和 Muon 优化器。
DeepSeek-V4:百万Token上下文,真正可供智能体使用
DeepSeek发布V4,这是一款MoE模型,拥有100万Token上下文窗口,通过混合注意力机制和降低KV缓存需求,针对智能体任务进行了优化。
@modal: Modal上Step 3.7 Flash的Day 0支持 - 198B参数的MoE,11B激活参数 - 256K上下文 - 3个推理层级 - N…
Modal宣布为Step 3.7 Flash AI模型提供Day 0支持,该模型拥有198B参数的MoE(11B激活参数)、256K上下文、三个推理层级,以及原生图像和视频理解能力。