Qwen3.8-Flash-Next + MTP 在 Strix Halo 上:Vulkan 运行时备注

Reddit r/LocalLLaMA 新闻

摘要

在 Strix Halo 硬件上使用 llama.cpp 的 Vulkan 后端运行 Qwen3.8-Flash-Next 和 MTP 的基准测试结果,包括性能指标和对输出质量的观察。

以下是使用 llama.cpp 的 Vulkan 后端在 Strix Halo 上运行 Qwen3.8-Flash-Next 与 MTP 模型的基准测试结果。 硬件项目详情 CPU AMD Ryzen AI MAX+ 395 (16核/32线程) GPU Radeon 8060S (集成, RADV STRIX_HALO) RAM 128GB 统一内存 软件项目详情 操作系统 Ubuntu 26.04.1 LTS / 内核 7.0.0-30 Vulkan Mesa 26.0.8 / Vulkan API 1.4.335 内核启动参数 (摘录) amdgpu.gttsize=126976 amdgpu.noretry=0 ttm.pages_limit=28835840 ttm.page_pool_size=14417920 iommu=off llama.cpp 使用 Laurent Zuijdwijk 的分支: git clone https://github.com/LaurentZuijdwijk/llama.cpp cd llama.cpp && git checkout vulkan/qwen4exp-rocmfpx 模型 主模型:Qwen3.8-Flash-Next-AD-5.00bpw-Q5_K_M-M64 (AtomicChat) MTP 草稿模型:Qwen3.8-Flash-Next-MTP-Q4_K_M.gguf (dzannotti) 启动命令 ./build/bin/llama-server \ --host 0.0.0.0 --port 8080 \ --model ./models/Qwen3.8-Flash-Next-AD-5.00bpw-Q5_K_M-M64/Qwen3.8-Flash-Next-AD-5.00bpw-Q5_K_M-M64-00001-of-00033.gguf \ -c 262144 --n-predict 32768 \ -t 2 --threads-batch 8 \ -ngl 999 --parallel 1 \ -b 8192 --ubatch-size 512 \ --load-mode mlock \ -fa on -cb \ -ctk f16 -ctv f16 \ --cache-reuse 1024 \ --jinja --reasoning on --reasoning-preserve \ --cache-prompt \ --chat-template-kwargs '{"reasoning_effort":"medium"}' \ -md ./models/Qwen3.8-Flash-Next-MTP-Q4_K_M.gguf \ --spec-type draft-mtp --spec-draft-n-max 3 --spec-draft-p-min 0.75 基准测试结果 ($n=85$) 指标 最大值 最小值 平均值 中位数 PP (令牌/秒) 305.45 19.90 138.61 131.66 TG (令牌/秒) 46.76 17.11 26.67 26.69 观察结果 与 Qwen3.8-27B 相比,用于架构和设计任务(如 OpenSpec 提案)的输出质量明显更优。根据提供的指令,它偶尔会在尝试“改进”输出时偏离主题,但整体性能完全令人满意。 我使用 Claude(Opus4.6) 生成了日语文本,然后使用 Gemini(Flash 3.6) 进行了翻译。
查看原文

相似文章

Strix Halo ROCm + MTP 笔记 (2026年5月)

Reddit r/LocalLLaMA

技术基准测试,比较 ROCm 和 Vulkan 后端在 Strix Halo 硬件上运行 LLM 推理的性能,MTP 合并到 llama.cpp 之后,结果显示 ROCm 在全上下文时性能严重下降,而 Vulkan 保持稳定。

Ling 3.0 Flash 在 Strix Halo 上的表现

Reddit r/LocalLLaMA

推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。

@Snixtp: https://x.com/Snixtp/status/2055734339346768225

X AI KOLs Timeline

某用户使用llama.cpp在单张RTX 3090上对Qwen3.6 27B的MTP变体与普通版本进行了基准测试,发现MTP在长上下文(32k-64k)下生成速度最高可提升2.37倍,但预填充较慢且暂不支持并发。