@coldniko:在 8GB+ AMD 显卡 RX 7900 XTX 上运行 Qwen3.8-Flash-next,模型可持续输出 52-60 tokens/s + 1250 …

X AI KOLs Timeline 工具

摘要

Strata 是一款开源工具,可通过量化在消费级游戏 PC 上运行拥有 1250 亿参数的 Qwen3.8-Flash-Next 模型,在 AMD RX 7900 XTX 上实现 52-60 tokens/s,在 RTX 5070 上实现 60-95 tokens/s,并通过 k8v4 等 KV Cache 优化额外提速 10%。

在 8GB+ AMD 显卡上运行 Qwen3.8-Flash-next 🔴 RX 7900 XTX 可持续输出该模型的 52-60 output tokens per second,prompt 处理速度达到 1250 tokens per second。 + 启用 KV Cache - k8v4,可在不损失质量的前提下将性能提升 + 10% https://t.co/83diJSdDja
查看原文
查看缓存全文

缓存时间: 2026/09/30 16:11

Strata

在普通游戏 PC 上运行 1250 亿参数的 AI 模型 一块显卡(NVIDIA,12–24 GB 显存)+ 64 GB 内存 · Windows 或 Linux · 一键安装

在 RTX 5070 上使用 Strata(IQ3_S,128K 上下文)运行一段单次提示生成的体素宝塔园林 · 完整视频(49 秒)

Strata 应用的 Monitor 界面(左),右侧是编码智能体根据视频中的内容编写这座宝塔园林

相似文章