@savipww: 一个744B参数的模型刚刚在一台25GB内存的笔记本电脑上启动了,我把仓库读了两遍才相信……
摘要
一个744B参数的混合专家模型在25GB内存的笔记本电脑上启动,通过将专家权重存储在SSD上,每个词元仅加载活跃的约400亿参数,使得尽管模型庞大,仍能进行本地推理。
查看缓存全文
缓存时间: 2026/07/21 06:38
一个744B参数模型刚刚在仅有25GB内存的笔记本上启动,我反复读了两遍仓库说明才敢相信。
如果你也想自己跑一跑,仓库链接就在第一条回复里。
整个诀窍在于:这种规模的模型,对每个词只会激活大约400亿个参数。
所以引擎把核心的密集层放在你的内存里,而把成千上万个专家留在SSD上,每次只拉取当前词真正需要的那几个专家。
这样一来,370GB的权重就能塞进一台仅有25GB内存的机器里。
纯C语言实现,零依赖,int4量化权重,注意力状态被压缩到原来的1/57,因此状态永远不会爆炸。
快吗?说实话,在裸机25GB配置上慢得像爬,但在真正的GPU设备上能达到每秒几个token。
最打动我的是它的诚实:仪表盘把每个专家都画成活的星团,从不假装磁盘没有在干重活。
这是今年一整年里,我最想坐下来好好跑一跑本地模型的一次。
savip (@savipww): 我发现了一个开源工具,能把任何品牌变成一个像电影一样滚动的网站。
滚动时,镜头会从3D场景外部直飞进去,然后无缝切换到下一个场景,毫无剪辑感。
每个场景都根据品牌生成,整个页面感觉就像
相似文章
我如何仅用24GB内存运行193B参数模型
介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。
@GPTWare:呃呃呃这什么鬼???
Colibri在拥有25GB RAM的笔记本电脑上运行744B参数的GLM-5.2 MoE模型,每个token仅激活约40B参数,并从磁盘流式传输专家,全部在一个2400行的C文件中完成,无需GPU。
我在一台6GB RTX 4050笔记本上尝试运行1.56TB MoE模型,结果如下
在配备6GB RTX 4050的笔记本上测试1.56TB混合专家模型,需借助NVMe进行修补式内存流式传输,解码速度达到0.106 tokens/s。
@Tech2Wild: 在家运行完整的GLM-5.2,744B参数,全部256个专家,未剪枝,跨4×NVIDIA DGX Spark (GB10)。200K上下文 · MTP …
一份详细的指南,介绍如何跨4个NVIDIA DGX Spark节点运行未剪枝的GLM-5.2模型(744B参数,256个专家),支持200K上下文,总吞吐量高达60.5 tok/s。包含性能基准测试、致谢和补丁。
@sudoingX:这台笔记本通过 Hermes agent 以 99% GPU 利用率本地跑 31B 模型,持续 15 tok/s,22.8 o…
一台笔记本借助 Hermes agent 本地运行 31B 模型,速度 15 tok/s,显存占用 22.8 GB,功耗 94 W,实现完全自主、私密、无需云端的 AI 推理。