基于1800年代文本从头训练LLM(160GB数据集)
摘要
作者详细介绍了使用160GB的1800年代英语文本从头训练LLM的过程,训练了一个5亿参数的评估模型,并计划训练一个20亿参数的模型,结果显示在历史问答方面有不错的前景。
大家好,一年前我开始只针对1800年代的伦敦数据预训练语言模型。最近我完成了有史以来最大的数据集,包含400亿个token或160GB的1800-1875年英美英语数据。我很快将在此基础上训练一个20亿参数的模型,但目前我已经在一个50亿token的样本上训练了一个5亿参数的评估模型。我还使用从数据集中直接提取的合成问答对,对评估模型进行了微调,因此你可以询问关于历史人物、地点、事件等问题。目前它对伦敦相关的内容效果更好,而且由于这只是一个评估模型,准确度不是特别高,但更大规模的运行结果令人期待。一些示例输出:https://preview.redd.it/ncw7d62g6gch1.png?width=1020&format=png&auto=webp&s=2fbdb24b8db90c1c36a7ba4a30238da46ed802f6 李子布丁的食谱生成简直疯狂,但愿20亿参数的模型不会告诉你用脚搅拌。https://github.com/haykgrigo3/TimeCapsuleLLM https://huggingface.co/haykgrigorian/TimeCapsuleLLM-English-1800-1875-v3mini-eval1-500M
相似文章
从零构建一个复古风格的LLM
作者记录了从零构建一个340M参数LLM的过程,该模型仅使用1900年以前的文本进行训练,包括自定义数据集、训练脚本,并开源了模型和代码。
我从零开始训练了一个75M参数的LLM,使用18B tokens,它击败了几乎两倍大小的模型
从零开始训练了一个名为KeyLM的75M参数LLM,使用18B tokens,在指令跟随得分上与更大模型竞争,同时使用更少的参数和更少的数据。
迈向超越英语中心化开发的大语言模型
本文证明了大语言模型严重偏向英语,并表明持续预训练在将模型适配到其他语言(尤其是文化理解方面)时,并不比从头训练更具成本优势。
从零开始使用MLX构建大语言模型
一份关于使用Apple的MLX框架从零开始构建大语言模型的指南。
基于历史文本的预训练语言模型
本文介绍了 TypewriterLM,一个参数规模为 7.24B 的语言模型,仅基于 1913 年之前的英文文本进行训练;同时介绍了 TypewriterCorpus(一个包含 540 亿 token 的清洗后历史语料库)以及指令微调数据集,以避免时间泄露和前瞻偏差。此外,还提出了一个基准测试套件 History-Event,用于评估时间定位能力和泄露情况。