Qwen3.8-Flash-Next 在 Strix Halo 上支持 100万上下文:解码速度达 38 tok/s,预填充仅需 18 分钟 (Halogen 0.12.0)

Reddit r/LocalLLaMA 工具

摘要

Halogen 版本 0.12.0 修复了高上下文深度下的性能下降问题,展示了在 AMD Ryzen AI Max+ 硬件上,Qwen3.8-Flash-Next 在 100万令牌上下文时的解码和预填充速度的提升。

大家好。我看到一些反馈说 Halogen 在上下文深度上性能下降。所以我修复了这个问题。通过镜像部署,同一台机器、同一会话、同一提示,版本 0.11.10 与 0.12.0 的比较:在 1,004,581 令牌上下文下解码:从 27.3 tok/s 提升至 38.3 tok/s(使用默认投机生成器);在 258,794 令牌上下文下解码:从 42.9 tok/s 提升至 45.0 tok/s;在 1,004,581 令牌上下文下预填充:从 790 tok/s 提升至 937 tok/s,冷启动时间从 21.2 分钟缩短至 17.9 分钟;在 258,794 令牌上下文下预填充:从 1,086 tok/s 提升至 1,114 tok/s。测试条件:Ryzen AI Max+ 395,128 GB 内存。262k 和 1M 行的数据是在 1M 配置下(HALOGEN_ROPE_YARN=4 HALOGEN_CTX=1048576),每次冷请求,使用贪心模式,64 令牌,速度来自响应的 `timings` 报告。32k 行是标准的十次提示服务的平均值,没有变化。在 1M 上下文下,通过提示缓存进行后续轮次,首个令牌响应时间约为 0.55 秒;以上数字为冷启动路径。要在 1M 下运行:在 README 的 podman 命令行中添加 -e HALOGEN_ROPE_YARN=4 -e HALOGEN_CTX=1048576;需要 128 GB 内存的机器。发布说明和完整表格:https://github.com/peonist-ai/halogen-flash-server 如果您有自己的 1M 测试结果,我希望能看到在 0.12.0 版本上重新运行的结果。感谢所有支持,特别是 https://huggingface.co/nightvich
查看原文

相似文章

Qwen3.8-Flash-Next NVFP4 第3天对4xV100的支持

Reddit r/LocalLLaMA

RadixArk/Qwen3.8-Flash-Next-NVFP4 现已在 SGLang-V100 中得到支持,使得在 4xV100 GPU 上能够进行全上下文操作,性能指标显示高吞吐量,上下文处理能力高达 256k tokens。