@Oluwaphilemon1: 在12GB RTX 5070上运行的Qwen3.8-Flash-Next速度只有15 tok/s,显然这不够好。所以与其买更大的G…

X AI KOLs Timeline 工具

摘要

一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。

在12GB RTX 5070上运行的Qwen3.8-Flash-Next速度仅为15 tok/s,显然这并不理想。 因此,他没有购买更大的GPU,而是构建了一个推理引擎。 这就是Strata的由来。 在同一台机器上: llama.cpp: 约15 tok/s Strata: 最高65.1 tok/s 而且硬件并非某种巨型AI工作站。 它是: RTX 5070 12GB 64GB DDR5-5600 Ryzen 5 7600 Windows 有趣的是,Strata并非试图成为一个通用的推理引擎。 它是专门为Qwen3.8-Flash-Next构建的,针对的是模型需要在相对较小的GPU与系统内存配合下工作的那种设置。 在128K上下文长度下,报告的数据如下: Q2_0 65.1 tok/s 解码 543 tok/s 提示处理 IQ2_XS 52.0 tok/s 解码 472 tok/s 提示处理 IQ3_XXS 44.8 tok/s 解码 414 tok/s 提示处理 这与原始的约15 tok/s结果相比,差异相当显著。 而这正是我为什么觉得本地AI推理如此有趣。 人们经常比较模型,仿佛模型本身决定了体验。 并非如此。 底层的技术栈很重要。 模型架构。 量化。 KV缓存。 GPU内存。 系统内存。 CPU/GPU传输。 CUDA内核。 推测解码。 最终,是推理引擎将所有这些整合在一起。 一个在某个运行时中感觉极其缓慢的模型,在有人花费时间优化实际工作负载后,可能变得出奇地可用。 在这个案例中,Strata是围绕Qwen3.8-Flash-Next、CUDA、系统内存卸载和RCO-GSQ量化构建设计的。 最棒的是什么? 它是开源的。 这就是我喜欢看到的本地AI项目。 某人遇到了性能瓶颈,决定运行时是问题所在,为自己的硬件构建了更好的解决方案,然后将结果回馈给所有人。 你不一定总需要更大的GPU。 有时你需要的是更好的引擎。
查看原文
查看缓存全文

缓存时间: 2026/09/26 19:04

在12GB显存的RTX 5070上运行Qwen3.8-Flash-Next仅能获得约15 token/秒的速度,这显然无法接受。

于是他没有选择购买更强大的GPU,而是自行构建了一个推理引擎。

这便是Strata的由来。

在同一台机器上:

  • llama.cpp:约15 token/秒
  • Strata:最高可达65.1 token/秒

而硬件配置并非庞大的AI工作站,仅为:

  • RTX 5070 12GB
  • 64GB DDR5-5600内存
  • Ryzen 5 7600处理器
  • Windows系统

有趣的是,Strata并非试图成为通用推理引擎。它专为Qwen3.8-Flash-Next及类似配置而设计——在此类配置中,模型需在相对较小的GPU与系统内存协同工作。

在128K上下文长度下,实测数据如下: Q2_0量化

  • 解码速度:65.1 token/秒
  • 提示处理速度:543 token/秒

IQ2_XS量化

  • 解码速度:52.0 token/秒
  • 提示处理速度:472 token/秒

IQ3_XXS量化

  • 解码速度:44.8 token/秒
  • 提示处理速度:414 token/秒

这相比最初约15 token/秒的结果实现了巨大飞跃。

这也正是我认为本地AI推理如此迷人的原因。

人们常将模型体验完全归结于模型本身,实则不然。 底层技术栈同样关键:

  • 模型架构
  • 量化方案
  • KV缓存机制
  • GPU显存管理
  • 系统内存调用
  • CPU/GPU数据传输
  • CUDA核心优化
  • 推测解码技术
  • 最终将这一切整合的推理引擎

在某个运行环境中表现迟缓的模型,经过针对性优化后,可能焕发出惊人的可用性。

本次案例中,Strata正是围绕Qwen3.8-Flash-Next、CUDA、系统内存卸载及RCO-GSQ量化方案而设计。

更妙的是—— 它完全开源。

这正是我所推崇的本地AI项目典范: 开发者遭遇性能瓶颈后,认定运行时环境才是症结,于是针对特定硬件构建优化方案,最终将成果回馈社区。

有时候你并不需要更强的显卡, 而是一款更出色的引擎。

FHILY👑 (@Oluwaphilemon1): Qwen3.8 Flash在双路RTX 3090配置下开始展现惊人潜力。

经过测试不同量化等级,3.5bpw在模型质量与推理速度间取得了绝佳平衡。

配置清单:

  • Qwen3.8 Flash模型
  • 2× RTX 3090显卡
  • 3.5bpw量化
  • ExLlamaV3后端

相似文章

双RTX 3090 + EPYC主机运行qwen3.8-flash-next,速度约38令牌/秒

Reddit r/LocalLLaMA

用户描述了一个硬件配置,包括双RTX 3090显卡和AMD EPYC CPU,用于运行Qwen3-Flash-Next模型(使用llama.cpp),单流推理速度达到38令牌/秒。用户寻求建议,是否应该添加第三块GPU或升级CPU以提高性能,特别是对于运行多个并行代理。