DeepSeek V4 Flash 0731 在 Strix Halo 上:草稿模型、n_max 参数扫描和实际有帮助的启动行

Reddit r/LocalLLaMA 新闻

摘要

本文介绍了 DeepSeek V4 Flash 0731 在 Strix Halo 硬件上的基准测试结果,展示了不同草稿模型和 n_max 设置下的性能,得出结论 n_max=3 提供了最佳的速度平衡。

我知道现在首页全是 Qwen3.8 27B。好模型。我刚完成在 Strix Halo 机器上对 DeepSeek-V4-Flash-0731 进行了一周的测试,趁还没忘记实际测量结果,赶紧把它们放在这里。硬件是 Strix Halo 迷你电脑,Ubuntu 系统,128 GB 统一内存。目标是 Unsloth 的 UD-IQ3_XXS 配 Q6 注意力(约 96 GB)。在 264k 上下文、无上下文量化时,进程占用约 114 GB。在 64k 时,我看到预填充 200–220 tok/s,解码 20–22 tok/s,无草稿。这是我在下面使用的所有基线:20.48 tok/s。我比较了两个 DSpark 草稿器,Q8_0(10.15 GB)和我自己量化的 Q2_K_S(6.45 GB),在 n_max 2–7、7 种提示类型、每种 5 次运行。整个过程采样相同:温度 0.9、top_p 0.95、min_p 0.01。开启思考(为扫描设置 reasoning_effort=low 以免花费一周时间)。扫描期间 ngram-mod 关闭,所以 draft_n 仅来自草稿器。简短版本:n_max=3 是峰值。两种草稿的平均值为 28.5 tok/s,是无草稿基线的 1.39 倍。Q2 和 Q8 不相上下。每个 n_max、每个类别,它们都在 1–3% 的范围内。所以我实际会保留 6.45 GB 文件。关于 28.5 平均值的一个警告:该套件包含许多推测解码喜欢的任务(重复、数学、代码),并且提示仅使用了约 32k 上下文。不要将其视为在混合聊天/编码日、更完整窗口下的情况。实际上,我会预算 22–28 tok/s。各类别最佳 n_max(平均值 vs 20.48 tok/s):代码 — n_max 3 — 28.99 t/s — 1.42× json — n_max 3 — 28.59 — 1.40× 数学 — n_max 3 — 31.22 — 1.52× 对话 — n_max 3 — 25.48 — 1.24× 翻译 — n_max 2 — 25.09 — 1.22× 散文 — n_max 2 — 23.38 — 1.14× 重复 — n_max 5 — 40.17 — 1.96× n_max 5–7 仅在高接受率内容(重复、部分数学)上有效。对于散文/翻译/对话,额外的草稿令牌只会被拒绝,导致性能下降。如果你想看整体表格:n_max 2: 27.12 t/s, 1.32×, 接受率 0.69 n_max 3: 28.50, 1.39×, 0.60 n_max 4: 27.73, 1.35×, 0.52 n_max 5–7: ~26.4–26.5, 1.29×, 接受率 ~0.45 我日常使用时以 128k 运行,ngram-mod 堆叠在草稿器上,思考设置为最大。这不是扫描使用的(扫描窗口为 64k,实际填充约 32k,仅草稿,思考=低),所以不要将 28.5 视为此精确行的承诺。n_max=3 的结果是我保留的;22–28 tok/s 是我在混合使用时会引用的。llama-server \ -m DeepSeek-V4-Flash-0731-UD-IQ3_XXS-q6kattn.gguf \ -a DeepSeek-V4-Flash-0731-UD-IQ3_XXS \ --no-ui -ngl 999 -c 131072 --jinja -fa 1 --port 9989 \ --no-mmap --no-warmup -np 1 \ --temp 0.9 --top-p 0.95 --min-p 0.01 --host 0.0.0.0 \ -ngld 999 -fit off \ -md DeepSeek-V4-Flash-0731-DSpark-Drafter-Q2_K_S-dflash.gguf \ --spec-type ngram-mod,draft-dspark --spec-draft-n-max 3 \ -ub 1024 --cache-ram 2048 \ --chat-template-kwargs '{"reasoning_effort":"max"}' Fork 是 strix-halo-llamacpp(FA + MoE 预填充修复,捆绑 Mesa,Vulkan/HIP)。上游仍然是 llama.cpp。基础权重:deepseek-ai/DeepSeek-V4-Flash-0731。我实际加载的 GGUF:unsloth/DeepSeek-V4-Flash-0731-GGUF。草稿器:Lynxpda/DeepSeek-V4-Flash-0731-DSpark-Drafter-Q2_K_S-GGUF。来自扫描的图表(基线设为 20.48):dashboard speedup_grouped_bars 如果你使用 Strix Halo 并且已经有了 Flash 0731,--spec-draft-n-max 3 和 Q2 草稿器是我会开始使用的。如果有什么看起来不对的地方,我很乐意回答关于这次扫描的问题。
查看原文

相似文章