Qwen 3.8 Flash Next n-gram查找表卸载至SSD并在SGLang中流式传输

Reddit r/LocalLLaMA 模型

摘要

Qwen3.8 Flash-Next的一个新检查点能将n-gram查找表卸载至SSD,在保持SGLang推理速度的同时,减少48 GB的内存使用。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/29 01:49

garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream · Hugging Face

来源:https://huggingface.co/garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream

https://huggingface.co/garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream#qwen38-flash-next-nvfp4—ssd-streamQwen3.8 Flash-Next NVFP4 - SSD Stream

运行 Qwen3.8 Flash-Next,减少 48 GB 内存占用,同时保持速度。

这是 RadixArk/Qwen3.8-Flash-Next-NVFP4 (https://huggingface.co/RadixArk/Qwen3.8-Flash-Next-NVFP4) 的一个准备版本,专为 sglang-ssd-stream (https://github.com/garnermccloud/sglang-ssd-stream) 打造。RadixArk 从 Qwen3.8 Flash-Next 生成了 NVFP4 检查点;此布局将其 48 GB 的查找表从本地 SSD 加载,而非占用系统 RAM。所需数据在 GPU 工作时即可被获取。

https://huggingface.co/garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream#what-this-model-is模型简介

源检查点使用 ModelOpt NVFP4 W4A4 量化路由专家。其注意力、共享专家、嵌入、语言模型头、视觉组件和 MTP 权重仍为 BF16;预测查找表为 FP8。

此准备好的检查点未对模型进行重新训练、微调或重新量化。它进行了一项面向服务的布局调整:

  1. 从常规模型加载中移除 128 个 FP8 查找表分片。
  2. 将其行存储在一个只读的 51,200,245,760 字节 SSD 伴随文件中。
  3. ssd-stream.json 记录其精确形状、源版本和 SHA-256 哈希。
  4. 剩余的模型和原生 MTP 权重均保留自源模型。

伴随文件 SHA-256:b070f9644adf93794d8a1030584ab705809387e64396a9327a68fa3a3a6666b3

https://huggingface.co/garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream#performance性能表现

https://huggingface.co/garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream#rtx-pro-6000-blackwellRTX PRO 6000 Blackwell

在单张 RTX PRO 6000 Blackwell 上进行的对比测试,使用了原生 MTP、CUDA 图以及 1,024 token 的补全长度:

RTX PRO 6000 结果 数值 GPU 显存 96 GB 常规查找表所需内存 47.68 GiB SSD Stream 工作内存 约 64 MiB 释放的内存 约 47.6 GiB 常规内存加载速度 148.5-156.2 tok/s SSD Stream 速度 164.7 tok/s

测量结果凸显了 SSD Stream 的意义:将表移出内存并未使其成为解码瓶颈。以大量未见过的、随机查找行为主的密集内容请求测得速度为 126-137 tok/s。

RTX 验证套件还通过了结构化工具调用、无关图像、120,043 token 的检索请求、原生 MTP、CUDA 图重放、重启重用以及持续交替工作负载等测试,过程中未发生交换、内存溢出、重启或主机内存增长。

https://huggingface.co/garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream#dgx-sparkDGX Spark

DGX Spark 结果 数值 统一内存 128 GB 常规查找表所需内存 47.68 GiB SSD Stream 工作内存 约 64 MiB 释放的统一内存 约 47.6 GiB 常规内存加载速度 待硬件运行测试 SSD Stream 速度 待硬件运行测试

原生读取器支持 Linux aarch64。待 Spark 基准测试填补这些速度数据后,相同的命令行工具将自动检测 DGX Spark 并选择其经过测试的内存和上下文配置。

https://huggingface.co/garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream#run-it运行方法

使用带有 Blackwell GPU 和本地 SSD 的 Linux 系统:

curl -LsSf https://raw.githubusercontent.com/garnermccloud/sglang-ssd-stream/main/install.sh | sh
~/.local/bin/sglang-ssd-stream serve

首次启动将下载并验证此快照,然后在 http://127.0.0.1:30000/v1 启动 SGLang 的 OpenAI 兼容 API。

curl -s http://127.0.0.1:30000/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "Qwen3.8-Flash-Next-NVFP4-SSD-Stream",
    "messages": [{"role": "user", "content": "回复:SSD Stream 正常工作"}],
    "max_tokens": 32
  }'

已验证的自动配置适用于单张 RTX PRO 6000 Blackwell。

https://huggingface.co/garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream#model-capabilities模型能力

  • 支持文本、图像和视频输入,文本输出
  • 推理与结构化工具调用
  • 原生 MTP 推测解码
  • 源架构支持最高 262K 上下文长度
  • 通过 SGLang 提供 OpenAI 兼容的 chat-completions API

https://huggingface.co/garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream#why-hugging-face-shows-68b-parameters-and-8-bit-precision为何 Hugging Face 显示 68B 参数与 8 位精度

这些自动标签描述的是可见的存储张量,并非此模型的逻辑架构或其主要权重精度。

  • 68B 这个数字统计了 Safetensors 文件中大约 60.4B 个打包的 uint8 存储元素加上 8.0B 个 BF16 元素。每个打包字节可以容纳两个 NVFP4 值。
  • 51.2B 个 FP8 查找表元素存储在 SSD 伴随文件中,因此 Hugging Face 的 Safetensors 扫描器不会将其计入。
  • 8-bit 标签来源于这些存储数据类型。路由专家权重为 NVFP4 W4A4;部分模型组件仍为 BF16;流式传输的表为 FP8。

源模型描述其架构总共包含约 180B 个逻辑参数。因此,68B 的头部数字并非可直接比较的参数数量。

https://huggingface.co/garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream#technical-details技术细节

模型每生成一个 token 执行 16 次确定性表查找。每行 FP8 数据为 160 字节。SSD Stream 在模型处理到使用这些数据的区块之前就启动读取,允许 SSD I/O 与 GPU 计算重叠。

该扩展的功能:

  1. 异步将行 ID 复制到固定的主机内存中;
  2. 对这些行所需的精确 4 KiB 文件系统页面进行去重;
  3. 通过 Rust io_uring 引擎提交并发读取;
  4. 按请求的顺序恢复行数据;
  5. 在独立的 CUDA 流上转换暂存的 FP8 数据;以及
  6. 仅在读取时间超过重叠的 GPU 工作时间时进行同步。

它预留了一个 32 MiB 的注册页池和两个 16 MiB 的固定暂存缓冲区。它不预留多吉字节的私有缓存。原生 MTP、多模态输入、结构化工具和 CUDA 图重放功能保持启用。

sglang-ssd-stream 是 SGLang 的一个独立扩展。它不是 SGLang 的官方组件。

https://huggingface.co/garnermccloud/Qwen3.8-Flash-Next-NVFP4-SSD-Stream#license-and-attribution许可与归属

模型权重保留源模型的许可和条款。参见:

  • Qwen/Qwen3.8-Flash-Next (https://huggingface.co/Qwen/Qwen3.8-Flash-Next)
  • RadixArk/Qwen3.8-Flash-Next-NVFP4 (https://huggingface.co/RadixArk/Qwen3.8-Flash-Next-NVFP4)
  • sglang-ssd-stream (https://github.com/garnermccloud/sglang-ssd-stream), Apache-2.0 许可证

相似文章

您可以将Qwen3.8-Flash-Next模型的大部分KV缓存卸载到RAM中,而不会明显影响解码速度。 在使用8bit量化的Qwen3.8-Flash-Next模型时,KV缓存大小约为每token 12.5MB。通过将大部分KV缓存从显存移至RAM,并只在显存中保留少量热数据,可以显著扩大显存能够支持的上下文长度。这种混合存储方式仅会增加约1.2ms的延迟,对实际推理速度影响微乎其微,为处理超长上下文提供了一种高效且低成本的解决方案。

Reddit r/LocalLLaMA

演示了将Qwen3.8-Flash-Next模型的KV缓存卸载至系统内存的技术,通过利用该模型高效架构,可在最大程度减少解码速度下降的情况下支持长上下文推理。

Qwen/Qwen3.8-Flash-Next

Hugging Face Models Trending

发布 Qwen3.8-Flash-Next,一款开放权重的 AI 模型,引入混合注意力(Hybrid Attention)与 QSA 以及门控残差(Gated Residual)等架构创新,提升效率和可扩展性,预览未来的 Qwen4 架构。

Qwen3.8-Flash-Next 针对 Mac 优化版

Reddit r/LocalLLaMA

本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。