我设计了一个CPU原生的LLM架构,在10B参数模型上能达到100+ tok/s(但质量存在问题)

Reddit r/LocalLLaMA 模型

摘要

作者设计了一个CPU原生的LLM架构,在10B参数模型上实现了超过100 tok/s,但强调了质量问题;他们分享了一个GitHub仓库,包含代码和适配现有模型的研究。

我一直在研究一种架构,旨在利用CPU内存限制,而不是对抗它。10B参数在Ryzen 5 3600X上运行速度为113-130 tok/s,没有GPU,但权重质量很差。为了验证质量是否在规模化时也能保持,我想要训练一个语言模型。在训练运行期间(在T4上训练206M模型需要8周以上,没有预算),我想到尝试将现有的LLM转换为我的引擎可以运行的格式。结果,适配一个Transformer供体(Qwen2.5-Coder)到SSM/三元/稀疏格式,正如预期的那样,非常痛苦。如果你想查看仓库(以及研究/供体适配分支):https://github.com/WildPino/SiliconLLM
查看原文

相似文章

思路:在CPU上,解码速度取决于每个token的活跃参数,而非总参数。我的目标是尝试在中等配置PC(无GPU)上以100tok/s运行一个10B模型。

Reddit r/LocalLLaMA

提出了CPU解码速度取决于每个token的活跃参数而非总参数的见解,并提出一个使用三元权重和细粒度MoE的10B参数模型,以在中等配置PC上实现高token速率。报告了沙箱测量结果,显示在8.3M模型上速度从176 tok/s提升到848 tok/s,且质量损失极小。