Puro-2B:在RTX 5090上以不超过5090美元训练的Qwen2-1.5B
摘要
本文提出了一种开源预训练配方,该配方在消费级RTX 5090 GPU上训练2B参数的语言模型,成本低于7000美元,性能接近更大的基线模型,并推导出了模型训练的成本缩放定律。
查看缓存全文
缓存时间: 2026/09/01 12:11
论文页面 - Puro-2B: Poor Lab的Qwen2-1.5B在RTX 5090上以5090美元以下成本训练完成
来源: https://huggingface.co/papers/2608.27370
摘要
一种低成本高效的开源预训练方案,在消费级GPU上以低于7000美元的成本训练20亿参数模型,其性能接近更大的基线模型,同时推导出了成本缩放规律并研究了数据课程安排。
语言模型预训练几乎已成为高昂成本的代名词,使其对许多学术界和开源社区而言遥不可及。尽管已存在强大的开源努力,包括开源权重模型和开源训练方案,但一种低成本、硬件易得且开源的预训练方案一直空缺。即使在小规模上,训练Llama-3.2-3B的成本也超过150万美元,而复现SmolLM3-3B则需要超过70万美元。在本报告中,我们提出了一种旨在降低此门槛的开源预训练方案。利用此方案,我们在消费级RTX 5090 GPU上,使用FP8精度 (https://huggingface.co/papers?q=FP8%20precision),从头训练了多达1.4万亿个token的Puro-2B模型集合。该模型集合中的模型在token预算和选定的方案变体上有所不同。我们最佳模型的训练计算成本低于6900美元,并且在我们的评估协议下接近Qwen2.5-1.5B的性能。这种成本效率得益于一系列方法的组合,包括硬件选择、低精度训练 (https://huggingface.co/papers?q=low-precision%20training)、超球优化 (https://huggingface.co/papers?q=hyperball%20optimization)、课程模型平均 (https://huggingface.co/papers?q=curriculum%20model%20averaging) 以及数据方案。除了方案本身,我们还提供了两个额外结果。首先,在整个Puro-2B集合中,我们推导出了一个Puro成本缩放规律 (https://huggingface.co/papers?q=Cost%20Scaling%20Law),该规律将训练成本与平均模型性能联系起来;拟合出的规律表明,约4400美元,低于5090美元,就足以达到Qwen2-1.5B的性能。其次,作为端到端的案例研究,我们考察了预训练数据课程安排 (https://huggingface.co/papers?q=pretraining%20data%20curricula) 如何在后训练之后影响下游性能。这类受控研究之所以可行,是因为我们拥有完整的预训练流程,而不仅仅是模型权重。我们在Apache 2.0许可下发布了Puro-2B的完整训练方案,包括数据、代码和模型权重,地址为:https://huggingface.co/collections/thu-pacman/puro-2b\。
查看arXiv页面 (https://arxiv.org/abs/2608.27370) 查看PDF (https://arxiv.org/pdf/2608.27370) 项目页面 (https://huggingface.co/collections/thu-pacman/puro-2b) GitHub58 (https://github.com/thu-pacman/Puro-Megatron) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.27370)
在你的智能体中获取此论文:
hf papers read 2608\.27370
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 1
thu-pacman/Puro-2B-Base 文本生成 • 20亿 • 更新于约5小时前 • 849 • 8 (https://huggingface.co/thu-pacman/Puro-2B-Base)
引用此论文的数据集 1
thu-pacman/Puro-2B 查看器 • 更新于4天前 • 596M • 1.31k • 3 (https://huggingface.co/datasets/thu-pacman/Puro-2B)
引用此论文的空间 0
没有链接到此论文的空间
在Space README.md中引用arxiv.org/abs/2608.27370以从本页链接到它。
包含此论文的收藏 3
相似文章
1800美元(GPU成本,使用P2P运行Qwen/Qwen3.6-27b-FP8,262K上下文,BF16 KV缓存,55 tok/s)
一位用户分享了使用4块RTX 5060 Ti 16GB显卡(支持P2P)运行Qwen3.6-27B-FP8的配置,在262K上下文下实现55 tok/s的速度,强调单用户推理成本仅约1800美元。
4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s
一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。
RTX Pro 4500 Blackwell - Qwen 3.6 27B?
一位开发者分享了在搭载 NVIDIA RTX Pro 4500 Blackwell 显卡的服务器上,使用 llama.cpp 运行 Qwen3.6-27B 模型的本地推理基准测试数据及 systemd 配置。该帖文征集了提升吞吐量的优化建议,并探讨了更大模型的潜在应用场景。
价值100美元的GPU以7.39 t/s运行Qwen 3.8 27b模型
一位用户演示在两张RX 580 GPU上运行量化为Q3_K_M的Qwen 27b AI模型,使用价值低于100美元的旧DDR3硬件,达到7.39 tokens/秒的性能。
@rasbt: 疯狂模型!它实际上使用了旧的Qwen2.5-Coder-3B栈,并通过后训练取得了非常出色的性能……
一个使用Qwen2.5-Coder-3B栈的3B参数模型,在编程基准测试中取得了与Claude Opus 4.5相媲美的分数,采用了详细的后训练技术,包括合成数据、过滤、两阶段SFT,以及一种新颖的RL方法(MGPO)。