构建并发布了BetterGPT-150M——一个紧凑的1.5亿参数补全模型(含在线HF Space演示)

Reddit r/LocalLLaMA 模型

摘要

构建并发布了BetterGPT-150M,一个紧凑的1.5亿参数因果语言模型,资源占用低,性能优于GPT-2 Small。包含用于文本补全的实时Hugging Face Space演示。

大家好,我最近完成了BetterGPT-150M的预训练,这是一个小型轻量级因果语言模型,拥有约1.52亿参数。在150亿个token上训练。数据集与训练:在稳定阶段和退火阶段使用了精心策划的数据集(包括FineWeb-Edu、fine maths、cosmopedia、starcode-python),在最大化token效率的同时确保强大的能力保留。性能:基准评估表明,它在性能上优于GPT-2 Small,同时与使用更大token预算训练的模型持平。由于许多小型/微型模型往往被大规模LLM发布所淹没,我想在这里分享给对轻量级架构、快速CPU推理或小型边缘设备实验感兴趣的人。仓库:https://github.com/harikrish2727/BetterGPT 模型中心:https://huggingface.co/Harikrish2727/BetterGPT-150M 在线演示:https://huggingface.co/spaces/Harikrish2727/BetterGPT-Demo(托管在ZeroGPU上,支持token流式传输)模型说明:任务:文本补全/生成(它是一个标准的基座补全模型,未进行指令微调)。占用资源:RAM/vRAM占用极低,在标准CPU上可瞬间运行。欢迎在Space演示中尝试提示词,或下载权重在本地运行。欢迎提供反馈、基准测试建议或指令微调的想法!这是我非常认真的第一次尝试,希望能得到大家真诚的反馈。
查看原文

相似文章

更好的语言模型及其影响

OpenAI Blog

OpenAI 推出 GPT-2,这是一个拥有 15 亿参数的基于 Transformer 的语言模型,在 40GB 的互联网文本上进行训练,在语言建模基准上达到了最先进的性能,并在阅读理解、翻译、问答和摘要生成等任务上展示了零样本学习能力。出于安全考虑,仅公开发布了较小的模型和技术论文,而非完整的训练模型。

[新发布] Supra-50M 正式推出!

Reddit r/LocalLLaMA

SupraLabs 发布了 Supra-50M,一个紧凑的 5000 万参数因果语言模型,包含基础版和指令版,基于 fineweb-edu 的 200 亿个 token 训练,在多项关键基准测试中达到了可与 GPT-2 和 SmolLM 等更大模型竞争的水平。

面向开发者推出GPT-5.1

OpenAI Blog

OpenAI发布了GPT-5.1,这是GPT-5系列中的一个新模型,它可以基于任务复杂度动态调整思考时间,在保持前沿智能的同时,性能比GPT-5快2-3倍。此次发布包括扩展的提示缓存(24小时保留)、新的编码工具(apply_patch和shell),以及针对延迟敏感应用的“无推理”模式。

MiniGPT: 从第一性原理重建GPT

arXiv cs.CL

本文介绍了MiniGPT,这是一个基于PyTorch从头实现的紧凑型GPT风格自回归语言模型,其构建参考了nanoGPT的研究。该模型在Tiny Shakespeare数据集上使用字符级分词进行评估,在10.77M参数配置下达到了1.4780的验证损失。