@savipww: 一个744B参数的模型刚刚在一台25GB内存的笔记本电脑上启动了,我把仓库读了两遍才相信……

X AI KOLs Timeline 模型

摘要

一个744B参数的混合专家模型在25GB内存的笔记本电脑上启动,通过将专家权重存储在SSD上,每个词元仅加载活跃的约400亿参数,使得尽管模型庞大,仍能进行本地推理。

一个744B参数的模型刚刚在一台25GB内存的笔记本电脑上启动了,我把仓库读了两遍才相信 如果你想自己运行,仓库在第一条回复里 关键在于,这么大的模型在任何一个单词上只激活约400亿个参数 所以引擎将小型密集核心放在内存中,而将数千个专家留在SSD上,每个词元只拉入实际需要的几个 这就是370GB的权重如何装进只有25GB内存的机器 纯C语言实现,零依赖,int4权重,注意力状态压缩了57倍,因此状态永远不会爆炸 老实说,它快吗?不,在纯25GB的机器上慢得像爬,但在真正的GPU设备上,每秒能处理几个词元 让我触动的是它的诚实:仪表盘将每个专家描绘成一个活生生的星系,从未假装磁盘不是主要功臣 这是我今年最想真正坐下来尝试本地模型的一次
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:38

一个744B参数模型刚刚在仅有25GB内存的笔记本上启动,我反复读了两遍仓库说明才敢相信。

如果你也想自己跑一跑,仓库链接就在第一条回复里。

整个诀窍在于:这种规模的模型,对每个词只会激活大约400亿个参数。

所以引擎把核心的密集层放在你的内存里,而把成千上万个专家留在SSD上,每次只拉取当前词真正需要的那几个专家。

这样一来,370GB的权重就能塞进一台仅有25GB内存的机器里。

纯C语言实现,零依赖,int4量化权重,注意力状态被压缩到原来的1/57,因此状态永远不会爆炸。

快吗?说实话,在裸机25GB配置上慢得像爬,但在真正的GPU设备上能达到每秒几个token。

最打动我的是它的诚实:仪表盘把每个专家都画成活的星团,从不假装磁盘没有在干重活。

这是今年一整年里,我最想坐下来好好跑一跑本地模型的一次。

savip (@savipww): 我发现了一个开源工具,能把任何品牌变成一个像电影一样滚动的网站。

滚动时,镜头会从3D场景外部直飞进去,然后无缝切换到下一个场景,毫无剪辑感。

每个场景都根据品牌生成,整个页面感觉就像

相似文章

我如何仅用24GB内存运行193B参数模型

Reddit r/ArtificialInteligence

介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。

@GPTWare:呃呃呃这什么鬼???

X AI KOLs Timeline

Colibri在拥有25GB RAM的笔记本电脑上运行744B参数的GLM-5.2 MoE模型,每个token仅激活约40B参数,并从磁盘流式传输专家,全部在一个2400行的C文件中完成,无需GPU。