在仅有CPU的情况下本地运行GLM-5.2!(穷人的大型模型方案)

Reddit r/LocalLLaMA 模型

摘要

一位用户仅用CPU在本地运行GLM-5.2,演示如何在简陋的配置上运行大型模型。

暂无内容
查看原文

相似文章

Show HN: 在慢速电脑上运行GLM 5.2

Hacker News Top

Colibrì是一个纯C推理引擎,通过从磁盘流式加载专家,在约25GB RAM的消费级硬件上运行744B参数的GLM-5.2 MoE模型,配合推测解码可实现约2.2-2.8 token/秒的速度。