我在Fineweb-edu数据集上训练了一个0.5M参数的模型,使用了10亿个token。
摘要
一个个人项目,使用Fineweb-edu数据集中的10亿个token训练了一个0.5M参数的语言模型。
暂无内容
相似文章
我用大约200美元的成本,从零开始在20B tokens上训练了一个1B参数的LLM。
一位开发者从零开始训练了一个1.1B参数的LLM,使用了200亿个token,成本约为200美元。该模型使用fineweb-edu进行预训练,并在OpenHermes上进行了LoRA微调。该项目包含开源代码、模型权重和一个演示网站。
我从零开始训练了一个75M参数的LLM,使用18B tokens,它击败了几乎两倍大小的模型
从零开始训练了一个名为KeyLM的75M参数LLM,使用18B tokens,在指令跟随得分上与更大模型竞争,同时使用更少的参数和更少的数据。
我以独立研究项目的形式,从零开始开发了一个拥有2.7亿参数的语言模型
一个从零开始在英文维基百科上训练、并经过指令微调以用于对话式AI的2.7亿参数语言模型,作为独立研究项目开发。
[新发布] Supra-50M 正式推出!
SupraLabs 发布了 Supra-50M,一个紧凑的 5000 万参数因果语言模型,包含基础版和指令版,基于 fineweb-edu 的 200 亿个 token 训练,在多项关键基准测试中达到了可与 GPT-2 和 SmolLM 等更大模型竞争的水平。
我从零构建了一个扩散语言模型。它能写出语法完美的句子,但毫无意义,而这正是有趣之处。
作者从零构建了Joey,一个1.7亿参数的掩码扩散语言模型,在FineWeb-Edu上训练并在DailyDialog上微调,由于容量限制,模型能生成流畅但不连贯的句子。该项目突出了与自回归LLM的差异,以及从构建和调试系统中获得的经验教训。