@coldniko:在 8GB+ AMD 显卡 RX 7900 XTX 上运行 Qwen3.8-Flash-next,模型可持续输出 52-60 tokens/s + 1250 …
摘要
Strata 是一款开源工具,可通过量化在消费级游戏 PC 上运行拥有 1250 亿参数的 Qwen3.8-Flash-Next 模型,在 AMD RX 7900 XTX 上实现 52-60 tokens/s,在 RTX 5070 上实现 60-95 tokens/s,并通过 k8v4 等 KV Cache 优化额外提速 10%。
查看缓存全文
缓存时间: 2026/09/30 16:11
Strata
在普通游戏 PC 上运行 1250 亿参数的 AI 模型 一块显卡(NVIDIA,12–24 GB 显存)+ 64 GB 内存 · Windows 或 Linux · 一键安装
在 RTX 5070 上使用 Strata(IQ3_S,128K 上下文)运行一段单次提示生成的体素宝塔园林 · 完整视频(49 秒)
Strata 应用的 Monitor 界面(左),右侧是编码智能体根据视频中的内容编写这座宝塔园林
相似文章
@Oluwaphilemon1: 在12GB RTX 5070上运行的Qwen3.8-Flash-Next速度只有15 tok/s,显然这不够好。所以与其买更大的G…
一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。
Qwen3.8-Flash-Next 在单张96 GB显卡上支持170K上下文窗口,速度约110 tokens/秒。
本文介绍了一种使用量化n-gram运行Qwen3.8-Flash-Next模型的方法,可在单张96GB显卡上实现超过17万token的上下文长度。通过INT4量化技术配合内存映射磁盘访问,处理速度最高可达每秒110个token。
Qwen3.8-Flash-Next 将 4xR9700 变成一个本地AI强机!使用优化的vLLM,单请求120 t/s 生成速度和12k t/s 预填充
文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。
Qwen3.8 Flash Next ISTA-DASLab GGUF 在'Strata'引擎上实现50t/s文本生成和1500t/s提示处理,配备12GB显存和64GB内存的笔记本电脑
本文重点介绍了Strata推理引擎,它在配备12GB显存和64GB内存的笔记本电脑上运行Qwen3.8模型时,性能显著超越llama.cpp,文本生成速度最高可达50 tokens/秒,提示处理速度可达1500 tokens/秒。
价值100美元的GPU以7.39 t/s运行Qwen 3.8 27b模型
一位用户演示在两张RX 580 GPU上运行量化为Q3_K_M的Qwen 27b AI模型,使用价值低于100美元的旧DDR3硬件,达到7.39 tokens/秒的性能。