@no_stp_on_snek:DeepSeek-V4.1-Flash 运行于 2 张 Sparks 上。thinking 设为高,TP=2。处理了 55M tokens。这是实际的内核优化工作,并非演示。它阅读了笔记并…
摘要
本文描述了针对 DeepSeek-V4.1-Flash AI 模型在 Metal 硬件上的一项优化,改进了注意力内核,使其仅启动必要的 tile 块,从而减少了计算浪费并提升了推理速度。
查看缓存全文
缓存时间: 2026/09/16 12:04
DeepSeek-V4.1-Flash 在 2 张 Spark 卡上的运行。思考深度设置为高,TP=2。55M tokens。这是实际内核作业,不是演示。
它读取了笔记和产品需求文档,运行了 A 对比 B 的测试,确认了胜出,然后直接提交了一个 PR。
我目睹了它发布。我自己没有动手写。
这个修复方案一眼看上去: 因果注意力是一个“三角形”,但内核仍在启动一个方形矩阵。
所有严格未来的 tile 仍然会占用一个线程组槽位,被唤醒后询问“我被允许计算吗?”,然后退出。在大型 GPU 上,这点开销可以忽略不计。但在 Metal 上,当你实际在本地模型中输入 128–192 个 token 的前缀填充时,启动成本是首 token 延迟时间中相当可观的一部分。
因此,我们只启动位于对角线及以下的 tile。数量从 T×T 降为 T(T+1)/2。数学计算量不变,但唤醒次数减少了。
在 M5 Max 上,完整注意力链路,交替运行 A/B 方案,共 15 轮测试:使用 bf16 格式,序列长度 192 时性能为 0.924倍(−7.6%),15 组配对测试全部获胜。在序列长度 128 时,16 个 tile 中只需保留 10 个。有三分之一的启动本来就是无效的。
这不是一个新的矩阵乘法优化。我们只是停止为那些已被掩码丢弃的计算买单。胜利幅度很小,但这正是税收(必要开销)而非性能把戏的特征。
相似文章
@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……
MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。
deepseek-ai/DeepSeek-V4-Pro-DSpark
DeepSeek 发布了其 V4 系列的预览版本,包括 DeepSeek-V4-Pro(1.6T 参数,49B 激活)和 DeepSeek-V4-Flash(284B 参数,13B 激活),两者均支持百万 Token 上下文,并采用混合注意力、流形约束超连接和 Muon 优化器。
@ViC305: 18小时后:DeepSeek-V4.1-Flash 现已量化至 4.75 bpw EXL3,适用于 4× DGX Spark TP4 目标。权重已完…
DeepSeek-V4.1-Flash 已量化至 4.75 bpw EXL3,以便部署在 4× DGX Spark 上,优化内存使用并实现高效本地推理,同时有计划进行验证和进一步优化。
Deepseek V4 Flash 在 RTX 5090 MoE 上运行
用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。
deepseek-ai/DeepSeek-V4-Flash-DSpark
DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。