@modal:DeepSeek-V4-Flash 总参数为 284B,每个 token 激活 13B。结合混合压缩注意力机…

X AI KOLs Following 模型

摘要

DeepSeek-V4-Flash 是一个 284B 参数的 MoE 模型,每 token 激活 13B 参数,采用混合压缩注意力机制,可降低 1M token 上下文的 KV 缓存需求。可使用 Modal 上的 SGLang 提供服务,在单个 B300 上实现快速解码。

DeepSeek-V4-Flash 总参数量为 284B,每个 token 激活 13B。 结合混合压缩注意力机制,它可显著降低 1M token 上下文任务的 KV 缓存需求。 使用 Modal 上的 SGLang 提供服务。可在单个 B300 上快速解码,无需支付 https://t.co/CslBGcsQFH
查看原文
查看缓存全文

缓存时间: 2026/08/04 14:13

DeepSeek-V4-Flash 总参数为 284B,每个 token 激活 13B 参数。

结合混合压缩注意力机制,大幅降低了 1M token 上下文任务的 KV 缓存需求。

使用 SGLang 在 Modal 上部署。在单个 B300 上快速解码,无需支付 https://t.co/CslBGcsQFH

相似文章

deepseek-ai/DeepSeek-V4-Flash-DSpark

Hugging Face Models Trending

DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。

deepseek-ai/DeepSeek-V4-Flash

Hugging Face Models Trending

DeepSeek 发布 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro,新一代 MoE 语言模型,支持 100 万 token 上下文,效率和性能均有提升。

deepseek-ai/DeepSeek-V4-Pro-DSpark

Hugging Face Models Trending

DeepSeek 发布了其 V4 系列的预览版本,包括 DeepSeek-V4-Pro(1.6T 参数,49B 激活)和 DeepSeek-V4-Flash(284B 参数,13B 激活),两者均支持百万 Token 上下文,并采用混合注意力、流形约束超连接和 Muon 优化器。