Puro-2B:在RTX 5090上以不超过5090美元训练的Qwen2-1.5B

Hugging Face Daily Papers 论文

摘要

本文提出了一种开源预训练配方,该配方在消费级RTX 5090 GPU上训练2B参数的语言模型,成本低于7000美元,性能接近更大的基线模型,并推导出了模型训练的成本缩放定律。

语言模型预训练几乎已成为高昂成本的代名词,使得学术和开源社区难以触及。尽管已经存在一些强有力的开源努力,包括开放权重模型和开源训练配方,但一种成本效益高、硬件可访问且开源的预训练配方一直缺失。即使在小规模上,训练Llama-3.2-3B的成本也超过\1.5M,而复现SmolLM3-3B需要超过700K。在本报告中,我们提出了一种旨在降低这一障碍的开源预训练配方。使用该配方,我们在消费级RTX 5090 GPU上,以FP8精度从零开始训练了多达1.4万亿个令牌的Puro-2B模型集合。该集合中的模型在令牌预算和所选配方变体上有所不同。我们最好的模型的计算成本低于\6.9K,并在我们的评估协议下接近Qwen2.5-1.5B的性能。这种成本效益得益于多种方法的结合,包括硬件选择、低精度训练、超球优化、课程模型平均和数据配方。除了配方本身,我们还提供了两个额外结果。首先,在Puro-2B集合中,我们推导出了一种Puro成本缩放定律,该定律将训练成本与平均模型性能相关联;拟合定律表明,大约4.4K美元,即低于\$5,090,就足以达到Qwen2-1.5B的性能。其次,作为端到端的案例研究,我们考察了预训练数据课程如何影响后训练后的下游性能。此类受控研究得益于能够访问完整的预训练流水线,而不仅仅是模型权重。我们在Apache 2.0许可下发布了Puro-2B的完整训练配方,包括数据、代码和模型权重,地址为https://huggingface.co/collections/thu-pacman/puro-2b。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:11

论文页面 - Puro-2B: Poor Lab的Qwen2-1.5B在RTX 5090上以5090美元以下成本训练完成

来源: https://huggingface.co/papers/2608.27370

摘要

一种低成本高效的开源预训练方案,在消费级GPU上以低于7000美元的成本训练20亿参数模型,其性能接近更大的基线模型,同时推导出了成本缩放规律并研究了数据课程安排。

语言模型预训练几乎已成为高昂成本的代名词,使其对许多学术界和开源社区而言遥不可及。尽管已存在强大的开源努力,包括开源权重模型和开源训练方案,但一种低成本、硬件易得且开源的预训练方案一直空缺。即使在小规模上,训练Llama-3.2-3B的成本也超过150万美元,而复现SmolLM3-3B则需要超过70万美元。在本报告中,我们提出了一种旨在降低此门槛的开源预训练方案。利用此方案,我们在消费级RTX 5090 GPU上,使用FP8精度 (https://huggingface.co/papers?q=FP8%20precision),从头训练了多达1.4万亿个token的Puro-2B模型集合。该模型集合中的模型在token预算和选定的方案变体上有所不同。我们最佳模型的训练计算成本低于6900美元,并且在我们的评估协议下接近Qwen2.5-1.5B的性能。这种成本效率得益于一系列方法的组合,包括硬件选择、低精度训练 (https://huggingface.co/papers?q=low-precision%20training)、超球优化 (https://huggingface.co/papers?q=hyperball%20optimization)、课程模型平均 (https://huggingface.co/papers?q=curriculum%20model%20averaging) 以及数据方案。除了方案本身,我们还提供了两个额外结果。首先,在整个Puro-2B集合中,我们推导出了一个Puro成本缩放规律 (https://huggingface.co/papers?q=Cost%20Scaling%20Law),该规律将训练成本与平均模型性能联系起来;拟合出的规律表明,约4400美元,低于5090美元,就足以达到Qwen2-1.5B的性能。其次,作为端到端的案例研究,我们考察了预训练数据课程安排 (https://huggingface.co/papers?q=pretraining%20data%20curricula) 如何在后训练之后影响下游性能。这类受控研究之所以可行,是因为我们拥有完整的预训练流程,而不仅仅是模型权重。我们在Apache 2.0许可下发布了Puro-2B的完整训练方案,包括数据、代码和模型权重,地址为:https://huggingface.co/collections/thu-pacman/puro-2b\。

查看arXiv页面 (https://arxiv.org/abs/2608.27370) 查看PDF (https://arxiv.org/pdf/2608.27370) 项目页面 (https://huggingface.co/collections/thu-pacman/puro-2b) GitHub58 (https://github.com/thu-pacman/Puro-Megatron) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.27370)

在你的智能体中获取此论文:

hf papers read 2608\.27370

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 1

thu-pacman/Puro-2B-Base 文本生成 • 20亿 • 更新于约5小时前 • 849 • 8 (https://huggingface.co/thu-pacman/Puro-2B-Base)

引用此论文的数据集 1

thu-pacman/Puro-2B 查看器 • 更新于4天前 • 596M • 1.31k • 3 (https://huggingface.co/datasets/thu-pacman/Puro-2B)

引用此论文的空间 0

没有链接到此论文的空间

在Space README.md中引用arxiv.org/abs/2608.27370以从本页链接到它。

包含此论文的收藏 3

相似文章

4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s

Reddit r/LocalLLaMA

一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。

RTX Pro 4500 Blackwell - Qwen 3.6 27B?

Reddit r/LocalLLaMA

一位开发者分享了在搭载 NVIDIA RTX Pro 4500 Blackwell 显卡的服务器上,使用 llama.cpp 运行 Qwen3.6-27B 模型的本地推理基准测试数据及 systemd 配置。该帖文征集了提升吞吐量的优化建议,并探讨了更大模型的潜在应用场景。