我设计了一个CPU原生的LLM架构,在10B参数模型上能达到100+ tok/s(但质量存在问题)
摘要
作者设计了一个CPU原生的LLM架构,在10B参数模型上实现了超过100 tok/s,但强调了质量问题;他们分享了一个GitHub仓库,包含代码和适配现有模型的研究。
我一直在研究一种架构,旨在利用CPU内存限制,而不是对抗它。10B参数在Ryzen 5 3600X上运行速度为113-130 tok/s,没有GPU,但权重质量很差。为了验证质量是否在规模化时也能保持,我想要训练一个语言模型。在训练运行期间(在T4上训练206M模型需要8周以上,没有预算),我想到尝试将现有的LLM转换为我的引擎可以运行的格式。结果,适配一个Transformer供体(Qwen2.5-Coder)到SSM/三元/稀疏格式,正如预期的那样,非常痛苦。如果你想查看仓库(以及研究/供体适配分支):https://github.com/WildPino/SiliconLLM
相似文章
思路:在CPU上,解码速度取决于每个token的活跃参数,而非总参数。我的目标是尝试在中等配置PC(无GPU)上以100tok/s运行一个10B模型。
提出了CPU解码速度取决于每个token的活跃参数而非总参数的见解,并提出一个使用三元权重和细粒度MoE的10B参数模型,以在中等配置PC上实现高token速率。报告了沙箱测量结果,显示在8.3M模型上速度从176 tok/s提升到848 tok/s,且质量损失极小。
我从头开发了自己的量化大语言模型,使用300亿个token进行训练,部署大小仅为60 MB [R]
一位开发者从头创建了一个250M参数的量化大语言模型,使用300亿个token进行训练,可在CPU上以60 MB部署,并采用了一种新颖的基于磁盘的长上下文系统,支持最多1亿个token。
我从零开始训练了一个75M参数的LLM,使用18B tokens,它击败了几乎两倍大小的模型
从零开始训练了一个名为KeyLM的75M参数LLM,使用18B tokens,在指令跟随得分上与更大模型竞争,同时使用更少的参数和更少的数据。
@ClementDelangue: Kog 在 @huggingface 上开源了用于展示模型每秒 3000+ tokens 速度的 2B 模型。非常……
Kog 开源了 Laneformer 2B 模型,这是一个 23 亿参数、经过指令调优的编码模型,专为高速解码设计。通过从架构阶段优先考虑延迟,实现了每秒超过 3000 个 token 的生成速度。
@jinyuhou0: 在主流基准测试中,我们的30B模型与规模大20-30倍的系统(gpt-5.4-xhigh、DeepSeek-V3.2、Kimi-K2.5)匹敌,而……
一款新的30B模型在主流基准测试中与规模大20-30倍的系统匹敌,同时相比同类30/32B智能体大语言模型,使用的推理令牌减少高达95%。这是通过一个学习型配置器实现的,该配置器决定何时以及如何进行推理。模型和代码已开放。