ssd-streaming

标签

Cards List
#ssd-streaming

Qwen 3.8 Flash Next n-gram查找表卸载至SSD并在SGLang中流式传输

Reddit r/LocalLLaMA · 2026-08-29 缓存

Qwen3.8 Flash-Next的一个新检查点能将n-gram查找表卸载至SSD,在保持SGLang推理速度的同时,减少48 GB的内存使用。

0 人收藏 0 人点赞
#ssd-streaming

DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行

Reddit r/LocalLLaMA · 2026-08-02

一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。

0 人收藏 0 人点赞
#ssd-streaming

我通过从SSD流式传输MoE专家权重,在36 GB MacBook上运行35B–480B编码模型——自包含应用,并且我也公开了那些*失败*的基准测试

Reddit r/LocalLLaMA · 2026-07-25

Slipstream 通过从SSD而非RAM流式传输MoE专家权重,使得在36 GB MacBook上运行大型编码模型(35B–480B)成为可能。基准测试显示,35B模型约13–19 tok/s,118B模型约2.8 tok/s,并诚实报告了失败的方法。

0 人收藏 0 人点赞
#ssd-streaming

@antirez: GLM 5.2,Q2_K路由专家(有效约2.6位)在M5 Max 128GB计算机上通过SSD流式运行。

X AI KOLs Following · 2026-06-28 缓存

GLM 5.2模型使用Q2_K量化路由专家(有效2.6位)在M5 Max 128GB计算机上通过SSD流式运行。

0 人收藏 0 人点赞
#ssd-streaming

你可以在 Mac (M3 Max, 96GB) 上运行 Deepseek 4 flash

Reddit r/LocalLLaMA · 2026-06-14

介绍如何在配备 96GB 内存的 Mac M3 Max 上,使用 Antirez 的 ds4 引擎和 SSD 流式传输运行 DeepSeek 4 flash,实现约每秒 12 token 的推理速度。

0 人收藏 0 人点赞
#ssd-streaming

@antirez: DeepSeek v4 PRO 通过SSD流式传输在我的128GB MacBook m5 max上运行。1.6万亿参数。

X AI KOLs Timeline · 2026-06-04 缓存

DeepSeek v4 PRO,一个拥有1.6万亿参数的模型,通过SSD流式传输在128GB MacBook m5 max上运行,展示了本地运行大规模模型的能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈