@no_stp_on_snek:DeepSeek-V4.1-Flash 运行于 2 张 Sparks 上。thinking 设为高,TP=2。处理了 55M tokens。这是实际的内核优化工作,并非演示。它阅读了笔记并…

X AI KOLs Timeline 模型

摘要

本文描述了针对 DeepSeek-V4.1-Flash AI 模型在 Metal 硬件上的一项优化,改进了注意力内核,使其仅启动必要的 tile 块,从而减少了计算浪费并提升了推理速度。

DeepSeek-V4.1-Flash 运行于 2 张 Sparks 上。thinking 设为高,TP=2。处理了 55M tokens。这是实际的内核优化工作,并非演示。 它阅读了笔记和 PRD,运行了 A 与 B 方案的对比测试,确认了改进效果,然后提交了一个拉取请求(PR)。 我看到了它发布代码。这不是我写的。 修复要点一览: 因果注意力(causal attention)是一个“三角形”。但之前的内核启动的还是整个“正方形”。 每一个严格未来的 tile 块仍然会占用一个线程组槽位,唤醒后检查“我是否被允许执行?”,然后才退出。在强大的 GPU 上,这可以忽略不计。但在 Metal 上,当你在本地模型中实际输入 128–192 个 token 的预填充(prefill)时,启动开销在首 token 时间(time-to-first-token)中占据了相当大的比例。 因此,我们只启动对角线及其下方的 tile 块。数量为 T(T+1)/2 而非 T*T。数学运算量相同,但唤醒的线程更少。 在 M5 Max 上,完整注意力链,交错 A/B 方案,测试 15 轮:bf16 格式,seq=192:性能比为 0.924x(−7.6%),在 15 对比较中全部获胜。在 token 数为 128 时,16 个 tile 块中有 6 个被保留(仅使用 10 个)。有三分之一的启动在执行前就是无效的。 这不是一个新的矩阵乘法(matmul)。我们只是停止为那些已被掩码(mask)丢弃的计算付费。提升幅度很小。这恰恰说明这是固有的开销,而非一种测试场上的技巧。
查看原文
查看缓存全文

缓存时间: 2026/09/16 12:04

DeepSeek-V4.1-Flash 在 2 张 Spark 卡上的运行。思考深度设置为高,TP=2。55M tokens。这是实际内核作业,不是演示。

它读取了笔记和产品需求文档,运行了 A 对比 B 的测试,确认了胜出,然后直接提交了一个 PR。

我目睹了它发布。我自己没有动手写。

这个修复方案一眼看上去: 因果注意力是一个“三角形”,但内核仍在启动一个方形矩阵。

所有严格未来的 tile 仍然会占用一个线程组槽位,被唤醒后询问“我被允许计算吗?”,然后退出。在大型 GPU 上,这点开销可以忽略不计。但在 Metal 上,当你实际在本地模型中输入 128–192 个 token 的前缀填充时,启动成本是首 token 延迟时间中相当可观的一部分。

因此,我们只启动位于对角线及以下的 tile。数量从 T×T 降为 T(T+1)/2。数学计算量不变,但唤醒次数减少了。

在 M5 Max 上,完整注意力链路,交替运行 A/B 方案,共 15 轮测试:使用 bf16 格式,序列长度 192 时性能为 0.924倍(−7.6%),15 组配对测试全部获胜。在序列长度 128 时,16 个 tile 中只需保留 10 个。有三分之一的启动本来就是无效的。

这不是一个新的矩阵乘法优化。我们只是停止为那些已被掩码丢弃的计算买单。胜利幅度很小,但这正是税收(必要开销)而非性能把戏的特征。

相似文章

deepseek-ai/DeepSeek-V4-Pro-DSpark

Hugging Face Models Trending

DeepSeek 发布了其 V4 系列的预览版本,包括 DeepSeek-V4-Pro(1.6T 参数,49B 激活)和 DeepSeek-V4-Flash(284B 参数,13B 激活),两者均支持百万 Token 上下文,并采用混合注意力、流形约束超连接和 Muon 优化器。

Deepseek V4 Flash 在 RTX 5090 MoE 上运行

Reddit r/LocalLLaMA

用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。

deepseek-ai/DeepSeek-V4-Flash-DSpark

Hugging Face Models Trending

DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。