Qwen3.8 Flash Next ISTA-DASLab GGUF 在'Strata'引擎上实现50t/s文本生成和1500t/s提示处理,配备12GB显存和64GB内存的笔记本电脑
摘要
本文重点介绍了Strata推理引擎,它在配备12GB显存和64GB内存的笔记本电脑上运行Qwen3.8模型时,性能显著超越llama.cpp,文本生成速度最高可达50 tokens/秒,提示处理速度可达1500 tokens/秒。
我认为大多数人低估了这款推理引擎。我尝试了多个llama.cpp的分支,但没有一个能接近Strata的推理速度。初始版本在KV缓存和CPU节流方面有一些bug,开发者已经修复了。推理引擎(目前仅支持Nvidia;AMD支持为实验性):https://github.com/Niko1221/Strata 以下是一些带截图的指标。我的笔记本电脑配备5070ti 12GB显存、64GB DDR5内存、Intel 275HX CPU和Gen4 SSD。水族馆测试(通过本地API连接的unsloth studio)我使用的模型是 https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main/IQ3_XXS,该模型在尺寸上具有良好的质量。以上,模型生成了水族馆测试。在43k上下文深度时,运行速度为51 t/s。原版llama.cpp使用相同量化仅达到23t/s。32k上下文读取速度为1500t/s(通过本地API的unsloth studio)该量化使用原版llama.cpp仅能达到100t/s的提示处理速度。Strata读取32k上下文文本的速度为1500t/s。这远超我的预期。该量化在8位下可加载高达200k上下文。然而,我只使用了131k上下文。内存使用情况 如您所见,它使用了11GB显存和56GB内存(包括系统/操作系统程序)。这款引擎专为单一模型构建,仅特定gguf(ISTA-DASLab)可与之兼容。您可以使用ISTA-DASLab的IQ3_S,他们声称该模型在编码基准测试中恢复了完整模型的性能。我测试了IQ3_XXS一段时间,可以说它是一款出色的模型。我从未想过12GB显存足以在笔记本电脑上本地运行6个月前的前沿模型。真是一个好时代!
相似文章
Qwen3.8-Flash-Next 将 4xR9700 变成一个本地AI强机!使用优化的vLLM,单请求120 t/s 生成速度和12k t/s 预填充
文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。
Qwen 3.6-35B-A3B 在 Intel Arc B70 Pro 上实现 977 tok/s 提示处理与 26.2万上下文窗口
本文介绍如何使用 llama.cpp 的 SYCL 后端,在 Intel Arc Pro B70 GPU 上使整个模型和 KV 缓存位于显存中,从而实现 Qwen 3.6-35B-A3B 模型每秒超过 60 个 token 的处理速度。
Qwen3.8-Flash-Next 在单张96 GB显卡上支持170K上下文窗口,速度约110 tokens/秒。
本文介绍了一种使用量化n-gram运行Qwen3.8-Flash-Next模型的方法,可在单张96GB显卡上实现超过17万token的上下文长度。通过INT4量化技术配合内存映射磁盘访问,处理速度最高可达每秒110个token。
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
@Oluwaphilemon1: 在12GB RTX 5070上运行的Qwen3.8-Flash-Next速度只有15 tok/s,显然这不够好。所以与其买更大的G…
一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。