@Oluwaphilemon1: 在12GB RTX 5070上运行的Qwen3.8-Flash-Next速度只有15 tok/s,显然这不够好。所以与其买更大的G…
摘要
一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。
查看缓存全文
缓存时间: 2026/09/26 19:04
在12GB显存的RTX 5070上运行Qwen3.8-Flash-Next仅能获得约15 token/秒的速度,这显然无法接受。
于是他没有选择购买更强大的GPU,而是自行构建了一个推理引擎。
这便是Strata的由来。
在同一台机器上:
- llama.cpp:约15 token/秒
- Strata:最高可达65.1 token/秒
而硬件配置并非庞大的AI工作站,仅为:
- RTX 5070 12GB
- 64GB DDR5-5600内存
- Ryzen 5 7600处理器
- Windows系统
有趣的是,Strata并非试图成为通用推理引擎。它专为Qwen3.8-Flash-Next及类似配置而设计——在此类配置中,模型需在相对较小的GPU与系统内存协同工作。
在128K上下文长度下,实测数据如下: Q2_0量化
- 解码速度:65.1 token/秒
- 提示处理速度:543 token/秒
IQ2_XS量化
- 解码速度:52.0 token/秒
- 提示处理速度:472 token/秒
IQ3_XXS量化
- 解码速度:44.8 token/秒
- 提示处理速度:414 token/秒
这相比最初约15 token/秒的结果实现了巨大飞跃。
这也正是我认为本地AI推理如此迷人的原因。
人们常将模型体验完全归结于模型本身,实则不然。 底层技术栈同样关键:
- 模型架构
- 量化方案
- KV缓存机制
- GPU显存管理
- 系统内存调用
- CPU/GPU数据传输
- CUDA核心优化
- 推测解码技术
- 最终将这一切整合的推理引擎
在某个运行环境中表现迟缓的模型,经过针对性优化后,可能焕发出惊人的可用性。
本次案例中,Strata正是围绕Qwen3.8-Flash-Next、CUDA、系统内存卸载及RCO-GSQ量化方案而设计。
更妙的是—— 它完全开源。
这正是我所推崇的本地AI项目典范: 开发者遭遇性能瓶颈后,认定运行时环境才是症结,于是针对特定硬件构建优化方案,最终将成果回馈社区。
有时候你并不需要更强的显卡, 而是一款更出色的引擎。
FHILY👑 (@Oluwaphilemon1): Qwen3.8 Flash在双路RTX 3090配置下开始展现惊人潜力。
经过测试不同量化等级,3.5bpw在模型质量与推理速度间取得了绝佳平衡。
配置清单:
- Qwen3.8 Flash模型
- 2× RTX 3090显卡
- 3.5bpw量化
- ExLlamaV3后端
相似文章
@Oluwaphilemon1: Qwen3.8-27B at 56 tok/s on a 9-year-old GPU. Let that sink in. The GPU? NVIDIA V100 32GB. A card that launched at aroun…
在NVIDIA V100 GPU上实现Qwen3.8-27B模型每秒56个令牌的推理速度,展示了使用推测解码技术在旧硬件上进行经济高效的本地AI部署。
Qwen3.8-Flash-Next 将 4xR9700 变成一个本地AI强机!使用优化的vLLM,单请求120 t/s 生成速度和12k t/s 预填充
文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。
双RTX 3090 + EPYC主机运行qwen3.8-flash-next,速度约38令牌/秒
用户描述了一个硬件配置,包括双RTX 3090显卡和AMD EPYC CPU,用于运行Qwen3-Flash-Next模型(使用llama.cpp),单流推理速度达到38令牌/秒。用户寻求建议,是否应该添加第三块GPU或升级CPU以提高性能,特别是对于运行多个并行代理。
Qwen3.8-Flash-Next 在单张96 GB显卡上支持170K上下文窗口,速度约110 tokens/秒。
本文介绍了一种使用量化n-gram运行Qwen3.8-Flash-Next模型的方法,可在单张96GB显卡上实现超过17万token的上下文长度。通过INT4量化技术配合内存映射磁盘访问,处理速度最高可达每秒110个token。
Qwen3.8-Flash-Next (UD-IQ4_XS) 在 2x RTX 3060 + 7800X3D 上的基准测试:从初始 36 tps 预填充到 400 tps 及其他基准测试(-sm tensor 陷阱)+ VRAM/RAM 使用情况
本文对 llama.cpp 和 ik_llama.cpp 在双 RTX 3060 硬件上运行 Qwen3.8-Flash-Next 模型进行基准测试,展示了优化 tensor splitting 和 ubatch 设置可以将预填充速度从 36 t/s 大幅提升至 400 t/s,并对比了 RAM 使用情况。