标签
一个个人项目,使用Fineweb-edu数据集中的10亿个token训练了一个0.5M参数的语言模型。
介绍了Glimmer,一个10,000参数的语言模型,在FineWeb-Edu的50万个token上训练,采用标准Llama架构,可在HuggingFace上获取。