我预训练了一个700M参数的模型,在180亿个token上优化了Python和Wikitext | TheOneWhoWill/Shibai-700M-Base · Hugging Face
摘要
Shibai-700M-Base是一个基于LLaMA的700M参数模型,在180亿个token的英文、数学和Python代码上进行了预训练。尽管与更大模型相比训练不足,但仍能生成连贯的文本,并且因其在单个RTX 5070 Ti GPU上的高效训练而备受瞩目。
查看缓存全文
缓存时间: 2026/07/29 20:11
TheOneWhoWill/Shibai-700M-Base · Hugging Face
来源:https://huggingface.co/TheOneWhoWill/Shibai-700M-Base
https://huggingface.co/TheOneWhoWill/Shibai-700M-Base#shibai-700m-baseShibai 700M Base
这是一个拥有 7 亿参数的 LLaMA 基础模型,在超过 180 亿 Token 的英文文本、数学和 Python 代码上进行了预训练,原生上下文长度为 2k。训练分为两个阶段:首先构建一个能够理解并生成文本的扎实基础模型,然后通过持续预训练阶段提升其推理和编码能力。使用 RoPE 缩放(RoPE scaling)使得模型可以在无需额外训练的情况下,以相同质量外推至更长的上下文(最高 8k Token)。虽然与 Qwen 3 0.6B 或 Qwen 3.5 0.8B 等模型相比,该模型可能被认为训练不足,但它仍能在广泛的主题上生成连贯且上下文相关的文本。值得注意的是,该模型仅在一张 RTX 5070 Ti GPU 上训练了 400 小时,这在资源效率方面是一项显著的成就。
https://huggingface.co/TheOneWhoWill/Shibai-700M-Base#model-specs-overview模型规格概览
- 参数量:678.4M
- 隐藏层大小:1280
- 层数:28
- 注意力头数:16(KV:4)
- 中间层大小:4480
- 序列长度:2048
- RoPE Theta:10,000
- 词表大小:32,000
https://huggingface.co/TheOneWhoWill/Shibai-700M-Base#getting-started快速上手
要使用此模型,你可以通过 Hugging Face Transformers 库加载它。加载模型可使用以下代码片段:
from transformers import AutoModelForCausalLM, AutoTokenizer
MODEL_ID = "TheOneWhoWill/Shibai-700M-Base"
processor = AutoTokenizer.from_pretrained(MODEL_ID)
model = AutoModelForCausalLM.from_pretrained(MODEL_ID, device_map="auto")
将模型加载到内存后,可使用以下代码片段开始生成输出:
prompt = "Once upon a time"
inputs = processor(prompt, return_tensors="pt").to(model.device)
outputs = model.generate(
**inputs,
max_new_tokens=256,
do_sample=True,
temperature=0.3,
top_p=0.95,
top_k=50,
repetition_penalty=1.15,
no_repeat_ngram_size=3,
)
generated_text = processor.decode(outputs[0], skip_special_tokens=True)
print(generated_text)
请注意,此模型是在 2k 上下文长度下预训练的,因此不能期望它生成停止标记。该模型适用于简单的下一个 Token 预测任务,但未针对指令遵循或对话任务进行微调。对于这些任务,我计划在不久的将来发布此模型的微调版本。
相似文章
Puro-2B:在RTX 5090上以不超过5090美元训练的Qwen2-1.5B
本文提出了一种开源预训练配方,该配方在消费级RTX 5090 GPU上训练2B参数的语言模型,成本低于7000美元,性能接近更大的基线模型,并推导出了模型训练的成本缩放定律。
4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s
一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。
@vintcessun: 预训练原来可以这么省?1B模型、~$1000就能从零训出可用的基础模型,计算和数据量直接砍掉数百倍。核心不靠堆算力,而是层次递归架构加上潜在空间推理,配合PrefixLM packing和FA3把效率拉满。有点离谱,但论文和代码都开源了。
HRM-Text发布了一个1B参数的基础模型,声称仅需约$1000即可从零完成预训练,计算量和数据量减少数百倍,采用层级递归架构、潜在空间推理和PrefixLM packing等高效技术,论文与代码均已开源。
我从零开始训练了一个75M参数的LLM,使用18B tokens,它击败了几乎两倍大小的模型
从零开始训练了一个名为KeyLM的75M参数LLM,使用18B tokens,在指令跟随得分上与更大模型竞争,同时使用更少的参数和更少的数据。
@LottoLabs: 给显卡不够用的兄弟们的一个超酷模型,在一个海量token上训练的8b a1b模型,速度飞快…
LottoLabs 宣布了 LiquidAI 的 LFM2.5-8B-A1B-GGUF 模型,这是一个8B参数的模型,在大量token上训练,并针对有限GPU硬件上的快速推理进行了优化,支持 llama.cpp、Ollama、vLLM 等。