@cjzafir: 我付了13.99加元给Google,用A100 80GB GPU训练一个9B参数的LLM模型。耗时:> 10分钟打开笔记本 > 7小时训练 …
摘要
一位用户分享了使用Google Colab以13.99加元在A100 GPU上训练9B参数LLM的工作流程,指出整个过程可以过夜运行,并感叹训练小语言模型已不再困难。
查看缓存全文
缓存时间: 2026/05/22 19:58
我付给谷歌13.99加元,在A100 80GB GPU上训练一个9B参数的LLM模型。
所需时间:
10分钟 运行笔记本步骤 7小时 训练模型 1.5小时 评估测试 1.25小时 验证测试 30分钟 GGUF/MLX转换
夜里,我在新笔记本上运行codex(配合计算机操作的chrome扩展)。
早上,我得到一个新的定制训练模型。
训练SLM现在不再困难了。醒醒吧。
相似文章
@h100envy:谷歌工程师详解如何在手机上用21分钟将小型LLM从46%准确率微调至90% - 比…
一位谷歌工程师分享了在手机上用21分钟将Gemma 270M模型从46%准确率微调至90%的方法,使用合成数据、LoRA、int4量化,离线可达每秒2000 tokens。
@akshay_pachaar:谷歌刚刚发布了一款新LLM!你只需8GB内存就能在本地运行。让我们用自己的数据来微调它(完全本地运行…
谷歌发布了一款新LLM,只需8GB内存即可在本地运行。推文展示了如何在本地利用个人数据对其进行微调。
@LottoLabs: 给显卡不够用的兄弟们的一个超酷模型,在一个海量token上训练的8b a1b模型,速度飞快…
LottoLabs 宣布了 LiquidAI 的 LFM2.5-8B-A1B-GGUF 模型,这是一个8B参数的模型,在大量token上训练,并针对有限GPU硬件上的快速推理进行了优化,支持 llama.cpp、Ollama、vLLM 等。
@analogalok:我的8GB显存游戏本肯定会恨我这么做,但我还是做了。跑了一个31B稠密模型(Gemma 4…
用户在8GB显存的游戏本上,使用llama.cpp配合MTP推测解码,以约3 tokens/s的速度运行了Gemma 4 31B稠密模型,展示了在消费级硬件上运行31B稠密模型的可行性,并提出了智能体工作流程:快速MoE模型将困难任务路由给这个较慢的稠密模型。
@LiorOnAI:现在你可以将任何LLM转换成更快的版本,而无需从头重新训练。NVIDIA刚刚在他们30B的模型上实现了这一点。她…
NVIDIA提出了一种方法,将任何LLM转换为更快的版本,方法是将模型拆分为两个副本:一个冻结用于上下文,另一个训练用于并行生成多个token,实现了2.4倍加速,且质量保留约99%,仅使用了8%的训练数据。