我从头开发了自己的量化大语言模型,使用300亿个token进行训练,部署大小仅为60 MB [R]

Reddit r/MachineLearning 模型

摘要

一位开发者从头创建了一个250M参数的量化大语言模型,使用300亿个token进行训练,可在CPU上以60 MB部署,并采用了一种新颖的基于磁盘的长上下文系统,支持最多1亿个token。

我从头在fineweb的300亿个token上训练了一个250M参数的模型。它被量化到低于2位,因此整个部署大小为60 MB,运行时需要大约80 MB的RAM。在普通笔记本电脑CPU上运行速度约为400 tok/s,无需GPU。长上下文的工作原理:最近的2048个token保持在fp16中,类似于普通的KV缓存。所有较旧的token被压缩到1位并写入磁盘,每个token约320字节,因此100万个token的历史记录在磁盘上大约占320 MB。从一开始,模型就被训练从该磁盘缓存中检索,最多支持1亿个token。由于预算有限,它没有被训练在这些token上进行推理,只能从中检索和回答。基础模型的语言建模质量,通过从未在训练中见过的英语网络文本(教育网页,2,048个token窗口)测量:交叉熵为每个token 3.15 nats,困惑度为23.3,每字节0.99位。词汇表也不是一个普通的嵌入表。每个token是一个固定的512位代码,所有131k个token共8.4 MB,零个训练参数。我在WordSim-353(人类词相似度评分)上进行了测试:我的表得分斯皮尔曼相关系数为0.619,而随机代码为0.029。测试脚本在仓库中。一些输出(包含设置,以便您知道我没有挑选,所有内容均可从仓库复现):“用两句话解释光合作用。”(贪心算法)光合作用是植物将阳光转化为化学能的过程,然后用于产生氧气和其他化学物质。这个过程被称为光合作用。“写一首关于大海的短诗。”(温度0.25,top-k 30,重复惩罚1.15,种子2)波浪席卷而来,它们像岩石一样相互碰撞。风很强但并不温柔,试图将它们推向目的地而不抬起任何重量,也不远离那些带着僵硬微笑站在她面前的人,这使得大海看起来比以前更加雄伟。“设备Grus-189的序列号是什么?”答案位于磁盘归档中深度5060万个token处(归档模式,k=16)SN-442976这是一个250M的模型,因此在公开事实上会有错误,我并不是声称它能击败任何大型模型。您也可以对其进行微调,完整套件包括演示和前后数据都已包含。微调的主权重也在仓库中:https://github.com/QLNI/SHADOW-250M-Instruct https://huggingface.co/NODEMIND/SHADOW-250M
查看原文

相似文章

通过蒸馏和量化扩展Apertus LLM系列

arXiv cs.LG

本文验证了蒸馏和量化作为经济高效的方法,用于将Apertus LLM系列扩展到新的规模和硬件格式,生成了Apertus-v1.1模型,参数高达4B,在1.7T tokens上训练。

Llama-Mobile:VLM的高效2.7位量化

Hugging Face Daily Papers

本文提出了一种将视觉-语言模型量化到每参数2.7位的框架,通过将Llama 3.2 11B Vision Instruct模型压缩至3.7 GB,实现高效移动部署,同时保持视觉问答任务上的性能。