@lxfater: 64GB RAM, the 100-billion-parameter large model has already been deployed We already have the hammer, so where's the na…
摘要
12GB 显存 + 64GB 内存即可运行千亿参数大模型:开源项目 Strata 跑 Qwen3.8-Flash-Next 的量化版,在 RTX 5070 上 Q2_0 版约 94 token/s、IQ3_S 版约 53 token/s,作者感叹锤子已备好,就看钉子(应用场景)在哪。
查看缓存全文
缓存时间: 2026/10/05 01:20
64GB RAM, the 100-billion-parameter large model has already been deployed We already have the hammer, so where’s the nail?
铁锤人 (@lxfater): 12GB 显存 + 64GB 内存,也能跑千亿模型了!!
这个开源项目叫 Strata,跑的是 Qwen3.8-Flash-Next 的量化版
作者的测试配置是 RTX 5070(12GB 显存)+ Ryzen 5 7600 + 64GB 内存,短聊天生成速度: Q2_0 版约 94 token/s IQ3_S 版约 53 token/s
但 94 token/s 对应的是压缩更狠的
相似文章
@Gorden_Sun: Strata:仅用 12GB 显存运行千亿参数模型 在一台拥有 12GB 显存的普通电脑上,本地运行……
Strata 项目实现在 12GB VRAM + 64GB RAM 的普通电脑上本地运行 125B 参数的 Qwen3.8-Flash-Next 模型,通过让常用专家模型常驻 GPU、全模型放入系统内存,并在 GPU、内存与 SSD 之间协同推理和投机采样来突破显存限制。
在消费级硬件(RTX 4090)上以 100 tokens/s 运行 Qwen 3.8 Flash Next(125B)
Strata 是一个免费开源的推理引擎,可在 RTX 4090 等消费级显卡(12GB+ 显存)上本地运行 Qwen3.8-Flash-Next(125B)模型,写入速度约 100 tokens/s,且支持 Windows/Linux 和 NVIDIA/AMD 显卡。
@MinLiBuilds: Qwen3.8-Flash-Next 的 GGUF,111GB 模型在双 4090 96G 竟然跑通了。 这模型是真的邪门。 我这台机器是: 2× RTX 4090 48G = 96GB 显存 62GB 内存 跑的是 Unsloth 的 …
成功在双RTX 4090 96GB显存上运行了111GB的Qwen3.8-Flash-Next GGUF模型,通过PLE和稀疏注意力优化实现了66 tokens/s的生成速度,并详细说明了量化和运行配置。
@Xudong07452910: Hacker News 上有一篇评论区火了的文章:Qwen 3.6 27B 是本地开发的理想选择。 核心发现是:密集参数模型、原生支持 256k 上下文,在 MacBook Max M5 上跑 Q8_0 量化版能达到 30 tokens/…
Qwen 3.6 27B is a dense 27B model that achieves impressive performance on local hardware with 256k context, running at 30 tokens/s on MacBook Max M5 and 50 tokens/s on RTX 5090, and is considered by some as the first local model with true general intelligence.
@coldniko:在 8GB+ AMD 显卡 RX 7900 XTX 上运行 Qwen3.8-Flash-next,模型可持续输出 52-60 tokens/s + 1250 …
Strata 是一款开源工具,可通过量化在消费级游戏 PC 上运行拥有 1250 亿参数的 Qwen3.8-Flash-Next 模型,在 AMD RX 7900 XTX 上实现 52-60 tokens/s,在 RTX 5070 上实现 60-95 tokens/s,并通过 k8v4 等 KV Cache 优化额外提速 10%。