Qwen3.8-Flash-Next NVFP4 第3天对4xV100的支持
摘要
RadixArk/Qwen3.8-Flash-Next-NVFP4 现已在 SGLang-V100 中得到支持,使得在 4xV100 GPU 上能够进行全上下文操作,性能指标显示高吞吐量,上下文处理能力高达 256k tokens。
RadixArk/Qwen3.8-Flash-Next-NVFP4 现已在 SGLang-V100 中得到支持。4 个 V100 32GB 运行全上下文。略多于 50 GB 的 ngram 卸载到系统 RAM。预填充约为 4000tks,解码约为 60 tks,直到 256k 上下文的末尾。Prompt TTFT 无 MTP TTFT MTP ITL 无 MTP ITL MTP Prefill 无 MTP Prefill MTP Output 无 MTP Output MTP 10k 2,154 2,307 16.75 12.33 4,655 4,354 59.93 81.39 30k 6,395 6,747 16.83 15.22 4,696 4,454 59.64 65.97 50k 11,381 11,497 16.89 18.17 4,397 4,353 59.45 55.26 70k 15,272 16,015 16.97 15.50 4,586 4,374 59.17 64.76 90k 19,830 20,777 17.00 18.92 4,541 4,334 59.04 53.06 110k 24,733 25,856 17.09 12.34 4,449 4,256 58.74 81.33 130k 29,553 30,950 17.14 12.19 4,400 4,202 58.57 82.33 150k 34,736 36,319 17.23 16.32 4,320 4,131 58.26 61.53 170k 39,705 41,747 17.36 17.42 4,283 4,073 57.83 57.64 190k 45,259 47,513 17.45 17.20 4,199 4,000 57.53 58.37 210k 51,017 53,538 17.59 16.10 4,117 3,923 57.07 62.36 230k 57,273 60,011 17.61 14.62 4,017 3,833 57.00 68.65 250k 63,451 66,587 17.66 16.04 3,941 3,755 56.85 62.58 并发数 8192->1024 并发数 Output 无 MTP (tok/s) Output MTP (tok/s) MTP 差异 TTFT 无 MTP (ms) TTFT MTP (ms) ITL 无 MTP (ms) ITL MTP (ms) MTP 接受长度 1 55.12 74.82 +35.7% 1,552.28 1,637.65 16.62 11.76 3.375 4 137.26 149.25 +8.7% 4,856.90 5,049.17 24.39 20.04 3.089 8 172.98 194.13 +12.2% 8,000.80 8,329.74 38.43 28.94 3.130 16 239.36 183.87 -23.2% 14,063.34 14,524.25 53.12 55.64 3.048 https://github.com/haohervchb/sglang-V100
相似文章
Qwen3.8-Flash-Next 在单张96 GB显卡上支持170K上下文窗口,速度约110 tokens/秒。
本文介绍了一种使用量化n-gram运行Qwen3.8-Flash-Next模型的方法,可在单张96GB显卡上实现超过17万token的上下文长度。通过INT4量化技术配合内存映射磁盘访问,处理速度最高可达每秒110个token。
Qwen3.8-Flash-Next 将 4xR9700 变成一个本地AI强机!使用优化的vLLM,单请求120 t/s 生成速度和12k t/s 预填充
文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。
v100s上Qwen3.6 27B NVFP4达366 t/s
介绍了v100-skinny,一个自定义内核库,支持在V100(sm70)GPU上进行快速NVFP4推理,在最佳情况下的抽取中为Qwen3.6 27B实现366 t/s,而结构化生成和代码生成的速度较低。
面向V100用户:SGLang运行Qwen+Dflash和Laguna
修改SGLang以在V100 GPU上支持Qwen和Laguna模型,使用自定义的FlashAttention和Marlin内核,在4xV100硬件上获得了不错的吞吐量。
Qwen3.8-Flash-Next NVFP4 在双DGX Spark上的配置:解码速度50t/s,预填充速度2,900t/s
用户分享了在双DGX Spark硬件上部署Qwen3.8-Flash-Next模型的优化配置,通过技术补丁和设置细节,实现了高达50t/s的解码速度和2,900t/s的预填充速度。