ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF
摘要
本仓库提供使用基于梯度的 GSQ 和 RCO 方法对 Qwen3.8-Flash-Next 模型进行的 GGUF 量化,以优化低比特表示,从而实现在标准工具中的高效部署。
查看缓存全文
缓存时间: 2026/09/19 14:48
ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF · Hugging Face
来源: https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF
任务平均分 vs 位宽 (https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/resolve/main/assets/plots/Qwen3.8-Flash-Next-task_avg_vs_avg_bit_width.png)
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#overview
概述
本仓库提供了 Qwen3.8-Flash-Next 模型在三种不同尺寸下的 GGUF 格式量化版本,并包含用于多模态任务的视觉投影器(mmproj)。与对所有权重张量应用单一量化类型的均匀量化不同,本仓库中的每个模型为每个张量分配了独立的量化类型。该分配通过基于梯度的搜索算法获得,根据每个张量的敏感度分配精度,同时满足总文件大小预算。生成的文件是标准的 GGUF 格式,可未经修改地在 llama.cpp、Ollama 和 LM Studio 中运行。
Flash-Next 是一个稀疏的混合专家模型:每层包含 512 个路由专家,共 48 层,每个 token 有 10 个专家被激活。路由专家矩阵主导了参数数量,因此也主导了大小预算:95% 的可搜索权重位于专家中。因此,搜索算法主要在专家部分分配自由度,按每层(而非每个专家,GGUF 无法表达每个专家的分配)分配量化类型。
方法概要。 GSQ 在给定量化类型下为每个张量提供准确的低比特标量量化;RCO 在大小预算下为每个张量分配量化类型。两者结合,在请求的大小下生成非均匀的 GGUF 文件。
| 方法 | 描述 |
|---|---|
| GSQ(Gumbel-Softmax 量化,论文,代码) | 后训练标量量化,通过 Gumbel-Softmax 松弛联合学习每个坐标的网格分配和每组的缩放因子。GSQ 在 2 到 3 比特下缩小了标量量化与向量量化之间的大部分差距,同时保持可部署在 GGUF 等标准标量格式中。 |
| RCO(黎曼流形约束优化,论文,代码) | 在总大小预算下,为 N 个张量中的每一个分配 K 种量化类型之一。预算约束被重新表述为 logits 空间中的光滑黎曼流形,允许直接在任务损失上进行基于梯度的优化,同时精确强制预算约束,无需针对约束进行超参数调优。 |
两种方法均由奥地利科学技术研究所(IST Austria)的深度算法与系统实验室(DASLab) (https://github.com/IST-DASLab) 开发。
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#available-files
可用文件
文件遵循 -GSQ-RCO-*.gguf 的命名约定,后缀指明量化类别;表格列出了每个文件在 Transformer 权重上的平均位宽。mmproj 文件以 BF16 格式携带视觉编码器和投影器;一份副本适用于所有量化版本。每个量化模型以两个分片形式发布。第二个分片在所有三种变体中是相同的:它以 IQ4_NL 格式保存每层的 n-gram 嵌入表(per_layer_token_embd,51.2B 参数)。该表是查找表,而非矩阵乘法权重,因此在所有构建中均保持固定的 4.5 bpw,并且不参与搜索。它在评估的模型中是量化的,而不仅仅是发布的模型中。
| 目录 | bpw | 分片 1(权重) | 分片 2(n-gram) | 总大小 | 备注 |
|---|---|---|---|---|---|
Q2_0/ | 2.40 | 37.6 GB | 28.8 GB | 66.4 GB | 速度最快;避免使用查找表格式 |
IQ2_XS/ | 2.50 | 39.2 GB | 28.8 GB | 68.0 GB | 相同质量下文件最小 |
IQ3_XXS/ | 3.00 | 47.0 GB | 28.8 GB | 75.8 GB | 推荐;在 AIME25 上与基础模型匹配 |
mmproj-Qwen3.8-Flash-Next-BF16.gguf | 16 | 0.91 GB | n/a | 0.91 GB | 视觉编码器 + 投影器,用于多模态任务 |
Q2_0 专为速度构建。它避免使用依赖大型查找表的量化格式:这些格式在给定位宽下能打包更多精度,但解码它们会消耗实际时间,在此模型上该成本主导了推理时间。Q2_0 相比 IQ2_XS 在文件略小的同时,提供 3.4 倍的 prompt 吞吐量 和 1.9 倍的端到端延迟降低,且其解码速度在不同工作负载下保持稳定,不随内容变化。代价是质量略有下降:任务平均分为 89.07,而 IQ2_XS 为 89.16,比 IQ3_XXS 低 3.5 分。当吞吐量最重要时选择它,并参阅 性能 获取测量数据。
IQ3_XXS 模型是最佳性能点:它在 AIME25 上与基础模型完全匹配(100.00),在 GPQA-Diamond 和 LiveCodeBench v6 上仅落后 0.51 和 1.14 分,文件大小约为 BF16 的五分之一。
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#memory-requirements
内存需求
只有第一个分片包含 Transformer 权重,需要常驻内存。第二个分片是 n-gram 查找表:它是稀疏读取的,每个 token 读取一行,因此可以保持在磁盘上的内存映射模式,无需占用显存。使用 -lm mmap --lazy-mode on 运行以实现此行为,将第一个分片放入显存,并将第二个分片保存在 SSD 上,以使分页成本保持较低。
| 模型 | 必须常驻(分片 1) | 可保留在磁盘上(分片 2) | 总下载大小 |
|---|---|---|---|
Q2_0 | 37.6 GB | 28.8 GB | 66.4 GB |
IQ2_XS | 39.2 GB | 28.8 GB | 68.0 GB |
IQ3_XXS | 47.0 GB | 28.8 GB | 75.8 GB |
如果需要使用,请额外为 KV 缓存和视觉投影器(0.91 GB)预留空间。将 n-gram 表保留在 RAM 中而非磁盘上,可以完全消除分页成本,在内存允许的情况下值得这样做。
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#performance
性能
使用 llama.cpp 在 55 个 prompt 上进行测量,涵盖十一个类别(编程、人文、数学、问答、RAG、推理、STEM、写作、多语言、摘要、角色扮演)。
| 模型 | Prompt t/s | Decode t/s | 平均延迟 |
|---|---|---|---|
Q2_0 | 367.49 | 93.79 | 6.70 s |
IQ2_XS | 108.19 | 70.30 | 12.68 s |
按类别的预填充吞吐量 (https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/resolve/main/assets/plots/Qwen3.8-Flash-Next-prefill_throughput.png)
差距源于量化格式而非大小:两个文件仅相差 1.6 GB,且 Q2_0 是较小的那个。Q2_0 的解码速度在不同类别上也稳定得多,在 92.5 到 94.5 t/s 之间(2.0 t/s 的差异),而 IQ2_XS 在 49.4 到 94.5 t/s 之间波动(45.1 t/s 的差异),因为查找成本随请求触及的每一层的比例而变化。
预填充优势是不均匀的,在 prompt 较长时最大:在 RAG 上为 9.6 倍,在写作和编程上分别为 6.8 倍和 6.2 倍。在 prompt 短、推理密集的类别上,两者持平或 Q2_0 略逊(在 STEM、数学和推理上为 0.8 倍至 0.9 倍),此时预填充过于短暂,格式的解码成本影响不大。
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#results
结果
所有模型均针对 BF16 基础模型进行评估。我们报告五个零样本任务(arc_easy、arc_challenge、hellaswag、winogrande、piqa)的平均分、恢复率(相对于 BF16 的零样本平均百分比),以及三个推理和生成基准测试:AIME25、GPQA-Diamond 和 LiveCodeBench v6。任务平均分是这三项的平均值。大小是完整的下载量,包括 n-gram 分片;位宽列是 Transformer 权重的平均值,这是搜索控制的指标。
推理努力程度。 这些量化模型主要针对 xhigh 推理努力程度 进行优化,我们建议在该模式下使用它们以获得最佳质量。因此,报告的推理结果应在此设置下解读。在较低的推理努力程度下,量化引起的性能下降可能大于在 xhigh 下观察到的,因此相对于 BF16 基础模型的质量差距可能会增大。
| 变体 | bpw | GB | ZS avg↑ | 恢复率 | AIME25↑ | GPQA-D↑ | LCB v6↑ | Task avg↑ |
|---|---|---|---|---|---|---|---|---|
| BF16 | 16.00 | 354 | 76.94 | 100.0% | 100.00 | 91.92 | 87.43 | 93.12 |
| GSQ-RCO Q2_0 | 2.40 | 66.4 | 78.00 | 101.4% | 96.67 | 89.39 | 81.14 | 89.07 |
| GSQ-RCO IQ2_XS | 2.50 | 68.0 | 77.16 | 100.3% | 96.67 | 87.37 | 83.43 | 89.16 |
| GSQ-RCO IQ3_XXS | 3.00 | 75.8 | 77.23 | 100.4% | 100.00 | 91.41 | 86.29 | 92.57 |
所有三个模型在零样本平均分上都超过了 BF16 基础模型(100.3% 到 101.4%),这在这些任务上进行谨慎的低比特量化是常见的:差异大约在一个标准误差范围内,应被视为持平而非提升。推理和生成基准测试更清晰地分开了模型。在 3.00 bpw 下,IQ3_XXS 达到了基础模型任务平均分的 99.4%(92.57 对 93.12),同时体积缩小了 4.7 倍(75.8 GB 对 354 GB)。它在 AIME25 上与基础模型完全匹配(100.00),在 GPQA-Diamond 和 LiveCodeBench v6 上分别仅落后 0.51 和 1.14。在 2.50 bpw 下,IQ2_XS 在 68.0 GB 的大小下保留了任务平均分的 95.7%,而最小的构建 Q2_0 在 66.4 GB 下在 AIME25 上得分为 96.67,缩小了 5.3 倍。两个低于 2.5 bpw 的构建尽管分配策略不同,但任务平均分仅相差 0.1 分:Q2_0 在 GPQA-Diamond 上更强(89.39 对 87.37),而 IQ2_XS 在 LiveCodeBench v6 上更强(83.43 对 81.14)。
AIME25 vs 位宽 (https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/resolve/main/assets/plots/Qwen3.8-Flash-Next-aime25_vs_avg_bit_width.png)
GPQA-Diamond vs 位宽 (https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/resolve/main/assets/plots/Qwen3.8-Flash-Next-gpqa_diamond_vs_avg_bit_width.png)
LiveCodeBench v6 vs 位宽 (https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/resolve/main/assets/plots/Qwen3.8-Flash-Next-lcb_vs_avg_bit_width.png)
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#usage
使用方法
两个分片都必须下载;llama.cpp 在给定第一个分片时会自动加载拆分的文件。
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#llamacpp
llama.cpp
# 下载(需要:pip install -U "huggingface_hub[cli]")
hf download --include "IQ3_XXS/*" --local-dir .
llama-cli -m IQ3_XXS/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.gguf \
-lm mmap --lazy-mode on \
-p "Explain mixed-precision quantization." -ngl 99
-lm mmap --lazy-mode on 将 n-gram 表保留在磁盘上的内存映射模式,而不是加载到内存中,这从常驻内存占用中移除了 28.8 GB。参见 内存需求。
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#vision-multimodal
视觉(多模态)
hf download mmproj-Qwen3.8-Flash-Next-BF16.gguf --local-dir .
llama-mtmd-cli -m IQ3_XXS/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.gguf \
--mmproj mmproj-Qwen3.8-Flash-Next-BF16.gguf \
-lm mmap --lazy-mode on \
--image photo.jpg -p "Describe this image."
投影器直接从基础检查点转换而来,所有三种量化版本共享。
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#ollama
Ollama
ollama run hf.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF
# 选择匹配您内存预算的目录
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#lm-studio
LM Studio
搜索仓库名称,然后从文件列表中选择一个 GSQ-RCO-* 构建版本。
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#quantization-procedure
量化流程
- 按张量数据库。 每个权重张量都使用 GSQ 在所有候选的 GGUF 量化类型下进行量化,生成一个可搜索的量化张量变体数据库。
- RCO 搜索。 预算约束的黎曼流形搜索为每个张量分配一种量化类型,使得整个文件的平均位宽达到目标。
- 组装。 将选定的按张量变体拼接成一个标准的 GGUF 文件。对于此模型,搜索涵盖 352 个张量:304 个稠密张量(注意力、SSM 投影、共享专家、嵌入、输出头)和 48 个融合的路由专家矩阵,每层一个。两类张量使用独立的量化阶梯,因为在任何给定预算下,路由专家的位宽远低于稠密路径。
ffn_down_exps被排除在搜索之外,并固定为 Q2_0。其 640 行不能被 256 整除,这排除了所有 block-256 的 K 和 I 量化格式;只有 block-32 和 block-64 类型可以表示它,因此可搜索的空间很小。
参考实现:GSQ 在 IST-DASLab/GSQ,RCO 在 IST-DASLab/RCO。
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#reproducibility-artifacts
可复现性产物
每个发布的 GGUF 都包含审计其构建方式所需的文件:
| 文件 | 内容 |
|---|---|
tensor-allocation/.rco-allocation.txt | 该文件中每个张量被分配的量化类型,以及量化类型直方图和目标位宽。这是 RCO 搜索结果,因此无需打开模型即可检查分配情况。 |
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#citation
引用
如果您使用这些模型或方法,请同时引用两篇论文:
@article{gsq2026,
title = {GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling},
author = {Dadgarnia, Alireza and Tabesh, Soroush and Nikdan, Mahdi and Helcig, Michael and Kurtic, Eldar and Kleinegger, Maximilian and Alistarh, Dan},
journal = {arXiv preprint arXiv:2604.18556},
year = {2026}
}
@article{rco2026,
title = {Model Compression with Exact Budget Constraints via Riemannian Manifolds},
author = {Helcig, Michael and Alistarh, Dan},
journal = {arXiv preprint arXiv:2605.00649},
year = {2026}
}
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#acknowledgements
致谢
我们感谢 Verda 和奥地利科学技术研究所的科学计算部门为制作这些模型提供了计算资源。
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF#license
许可证
这些量化权重继承了基础模型(Qwen3.8-Flash-Next)的许可证。GSQ-RCO 工具链由深度算法与系统实验室根据其仓库许可证发布。
相似文章
ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
该仓库提供了使用GSQ和RCO方法对Qwen3.8-27B AI模型进行GGUF量化的版本,以便在标准工具中高效部署。
[发布] Qwen3.8-27B的SOTA GGUF量化模型:GSQ-RCO在2.5至3.0 bpw
我们发布了使用GSQ和RCO方法的Qwen3.8-27B最先进量化GGUF模型,这些模型在低比特率下实现高精度,并超越现有量化技术。
orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF
本文发布未经审查的 Qwen3.8-Flash-Next 模型的 GGUF 量化版本,这是 Qwen4 架构的混合专家模型预览版,专为支持视觉功能的 llama.cpp 设计,需要自定义构建以确保兼容性。
empero-ai/Qwen3.8-27B-Ridge-GGUF
本文介绍了Qwen3.8-27B AI模型的量化GGUF版本发布,该版本针对有限显存硬件上的高效本地推理进行了优化。
JonathanColetti/Qwen3.8-27B-无审查-GGUF
一个量化的GGUF版本,基于Qwen3.8-27B模型,具有减少的拒绝行为,保留了多token预测,并提供多种量化选项以供llama.cpp使用。