Qwen3.8-Flash-Next + MTP 在 Strix Halo 上:Vulkan 运行时备注
摘要
在 Strix Halo 硬件上使用 llama.cpp 的 Vulkan 后端运行 Qwen3.8-Flash-Next 和 MTP 的基准测试结果,包括性能指标和对输出质量的观察。
以下是使用 llama.cpp 的 Vulkan 后端在 Strix Halo 上运行 Qwen3.8-Flash-Next 与 MTP 模型的基准测试结果。
硬件项目详情
CPU AMD Ryzen AI MAX+ 395 (16核/32线程)
GPU Radeon 8060S (集成, RADV STRIX_HALO)
RAM 128GB 统一内存
软件项目详情
操作系统 Ubuntu 26.04.1 LTS / 内核 7.0.0-30
Vulkan Mesa 26.0.8 / Vulkan API 1.4.335
内核启动参数 (摘录)
amdgpu.gttsize=126976
amdgpu.noretry=0
ttm.pages_limit=28835840
ttm.page_pool_size=14417920
iommu=off
llama.cpp 使用 Laurent Zuijdwijk 的分支:
git clone https://github.com/LaurentZuijdwijk/llama.cpp
cd llama.cpp && git checkout vulkan/qwen4exp-rocmfpx
模型
主模型:Qwen3.8-Flash-Next-AD-5.00bpw-Q5_K_M-M64 (AtomicChat)
MTP 草稿模型:Qwen3.8-Flash-Next-MTP-Q4_K_M.gguf (dzannotti)
启动命令
./build/bin/llama-server \
--host 0.0.0.0 --port 8080 \
--model ./models/Qwen3.8-Flash-Next-AD-5.00bpw-Q5_K_M-M64/Qwen3.8-Flash-Next-AD-5.00bpw-Q5_K_M-M64-00001-of-00033.gguf \
-c 262144 --n-predict 32768 \
-t 2 --threads-batch 8 \
-ngl 999 --parallel 1 \
-b 8192 --ubatch-size 512 \
--load-mode mlock \
-fa on -cb \
-ctk f16 -ctv f16 \
--cache-reuse 1024 \
--jinja --reasoning on --reasoning-preserve \
--cache-prompt \
--chat-template-kwargs '{"reasoning_effort":"medium"}' \
-md ./models/Qwen3.8-Flash-Next-MTP-Q4_K_M.gguf \
--spec-type draft-mtp --spec-draft-n-max 3 --spec-draft-p-min 0.75
基准测试结果 ($n=85$)
指标 最大值 最小值 平均值 中位数
PP (令牌/秒) 305.45 19.90 138.61 131.66
TG (令牌/秒) 46.76 17.11 26.67 26.69
观察结果
与 Qwen3.8-27B 相比,用于架构和设计任务(如 OpenSpec 提案)的输出质量明显更优。根据提供的指令,它偶尔会在尝试“改进”输出时偏离主题,但整体性能完全令人满意。
我使用 Claude(Opus4.6) 生成了日语文本,然后使用 Gemini(Flash 3.6) 进行了翻译。
相似文章
Qwen 3.6-27B Dense 与 MTP 在 Strix Halo Windows 上的基准测试
Qwen 3.6-27B Dense 和 MTP 变体在 Strix Halo Windows 上通过 llama.cpp 运行的社区基准测试,展示了各项任务的 token/s 速度。
Strix Halo ROCm + MTP 笔记 (2026年5月)
技术基准测试,比较 ROCm 和 Vulkan 后端在 Strix Halo 硬件上运行 LLM 推理的性能,MTP 合并到 llama.cpp 之后,结果显示 ROCm 在全上下文时性能严重下降,而 Vulkan 保持稳定。
Ling 3.0 Flash 在 Strix Halo 上的表现
推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。
@Snixtp: https://x.com/Snixtp/status/2055734339346768225
某用户使用llama.cpp在单张RTX 3090上对Qwen3.6 27B的MTP变体与普通版本进行了基准测试,发现MTP在长上下文(32k-64k)下生成速度最高可提升2.37倍,但预填充较慢且暂不支持并发。
Qwen3.8-Flash-Next MTP 集成至 ik_llama.cpp(集成头或单独 -md 文件)... 在 5090 + 128GB 上 45 → 90 tok/s,甚至可在 12GB 4070 上运行
文章详细描述了将 Multi-Token Prediction (MTP) 支持合并至 ik_llama.cpp 的过程,这显著提升了 Qwen3.8-Flash-Next 模型的令牌生成速度,基准测试显示在高端硬件上速度最高可提升一倍。