Qwen3.8-Flash-Next 在 Strix Halo 上支持 100万上下文:解码速度达 38 tok/s,预填充仅需 18 分钟 (Halogen 0.12.0)
摘要
Halogen 版本 0.12.0 修复了高上下文深度下的性能下降问题,展示了在 AMD Ryzen AI Max+ 硬件上,Qwen3.8-Flash-Next 在 100万令牌上下文时的解码和预填充速度的提升。
大家好。我看到一些反馈说 Halogen 在上下文深度上性能下降。所以我修复了这个问题。通过镜像部署,同一台机器、同一会话、同一提示,版本 0.11.10 与 0.12.0 的比较:在 1,004,581 令牌上下文下解码:从 27.3 tok/s 提升至 38.3 tok/s(使用默认投机生成器);在 258,794 令牌上下文下解码:从 42.9 tok/s 提升至 45.0 tok/s;在 1,004,581 令牌上下文下预填充:从 790 tok/s 提升至 937 tok/s,冷启动时间从 21.2 分钟缩短至 17.9 分钟;在 258,794 令牌上下文下预填充:从 1,086 tok/s 提升至 1,114 tok/s。测试条件:Ryzen AI Max+ 395,128 GB 内存。262k 和 1M 行的数据是在 1M 配置下(HALOGEN_ROPE_YARN=4 HALOGEN_CTX=1048576),每次冷请求,使用贪心模式,64 令牌,速度来自响应的 `timings` 报告。32k 行是标准的十次提示服务的平均值,没有变化。在 1M 上下文下,通过提示缓存进行后续轮次,首个令牌响应时间约为 0.55 秒;以上数字为冷启动路径。要在 1M 下运行:在 README 的 podman 命令行中添加 -e HALOGEN_ROPE_YARN=4 -e HALOGEN_CTX=1048576;需要 128 GB 内存的机器。发布说明和完整表格:https://github.com/peonist-ai/halogen-flash-server 如果您有自己的 1M 测试结果,我希望能看到在 0.12.0 版本上重新运行的结果。感谢所有支持,特别是 https://huggingface.co/nightvich
相似文章
Qwen3.8-Flash-Next 在单张96 GB显卡上支持170K上下文窗口,速度约110 tokens/秒。
本文介绍了一种使用量化n-gram运行Qwen3.8-Flash-Next模型的方法,可在单张96GB显卡上实现超过17万token的上下文长度。通过INT4量化技术配合内存映射磁盘访问,处理速度最高可达每秒110个token。
Qwen3.8-Flash-Next 在 MLX-serve 上发布,支持 100 万上下文!
该文章宣布了 Qwen3.8-Flash-Next 在 MLX-serve 上的发布,支持 100 万 token 上下文,并在 M5 Max 硬件上使用量化权重实现了高效性能。
Qwen3.8-Flash-Next 在双 RTX 3090 + DDR4 上:解码速度从 17 提升至 25-29 令牌/秒,使用专家缓存 PR
用户基准测试并详述了 llama.cpp 中的 GPU 常驻专家缓存 PR,该 PR 将 Qwen3.8-Flash-Next 在双 RTX 3090 系统上的解码速度从 17 提升至 25-29 令牌/秒。
Qwen3.8-Flash-Next NVFP4 第3天对4xV100的支持
RadixArk/Qwen3.8-Flash-Next-NVFP4 现已在 SGLang-V100 中得到支持,使得在 4xV100 GPU 上能够进行全上下文操作,性能指标显示高吞吐量,上下文处理能力高达 256k tokens。
Qwen3.8-Flash-Next 将 4xR9700 变成一个本地AI强机!使用优化的vLLM,单请求120 t/s 生成速度和12k t/s 预填充
文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。