我在Fineweb-edu数据集上训练了一个0.5M参数的模型,使用了10亿个token。

Reddit r/LocalLLaMA 模型

摘要

一个个人项目,使用Fineweb-edu数据集中的10亿个token训练了一个0.5M参数的语言模型。

暂无内容
查看原文

相似文章

[新发布] Supra-50M 正式推出!

Reddit r/LocalLLaMA

SupraLabs 发布了 Supra-50M,一个紧凑的 5000 万参数因果语言模型,包含基础版和指令版,基于 fineweb-edu 的 200 亿个 token 训练,在多项关键基准测试中达到了可与 GPT-2 和 SmolLM 等更大模型竞争的水平。