@h100envy: Daniel Han 创建了 Unsloth,这正是半数开源项目能在单张 GPU 而非集群上微调模型的原因。他还……
摘要
Daniel Han 构建了 Unsloth,该工具通过重写 GPU 内核,使单张 GPU 的微调速度提升 2 到 3 倍,让众多开源用户无需集群即可训练模型。
查看缓存全文
缓存时间: 2026/06/18 04:06
Daniel Han 创建了 Unsloth,正是因为这个项目,开源社区的一半人才能在单张 GPU 上微调模型,而无需动用集群。
他并没有优化数学公式,而是手动重写了内核,找出了其他人代码中的种种错误,使得训练速度提升 2 到 3 倍,且准确率完全不受影响。
每个月都有数百万次微调任务在他的代码上运行。绝大多数在本地训练模型的人,其实都在依赖他的成果,却浑然不知。
人人都在谈论谁拥有的 GPU 最多,而他让你的 GPU 变得足够强大。
相似文章
@_vmlops:在单GPU上微调12B模型已成现实 大多数人以为需要庞大的GPU集群才能微调大型语言模型…
Hugging Face 的 PEFT 库实现了在单张 GPU 上对大型模型进行参数高效微调,在降低计算和存储成本的同时保持性能。
单GPU微调的高效异构协同设计
SlideFormer 提出了一种异构协同设计,用于在单GPU上进行全参数LLM微调,利用GPU/CPU/RAM/NVMe及其层滑动引擎和优化的Triton内核,在单张RTX 4090上实现对123B+模型的微调,吞吐量显著提升。
Show HN:在 4 GB 笔记本 GPU 上微调 8B 模型
Soup 是一个开源命令行工具,通过单条命令简化 LLM 的微调和后训练,支持基于 QLoRA 的训练,通过逐层流式传输仅需 4 GB 显存即可在消费级 GPU 上运行。最新版本新增了 DPO、ORPO、SimPO 和 KTO 等偏好损失,且不会使内存需求翻倍。
@AI_jacksaku: GitHub本周黑马:Unsloth AI模型训练速度提升2-5倍, 显存占用减少80%。 这意味着什么? 以前微调一个大模型, 需要A100集群+几万美金。 现在一张4090, 几小时就能搞定。 Unsloth做了什么? 优化了注意力机…
Unsloth开源工具将大模型微调速度提升2-5倍、显存降低80%,使单张RTX 4090几小时完成原本需A100集群的任务。
@CaptainInsightX: OpenAI花费数十亿美元建设训练基础设施。一对澳大利亚兄弟仅用50万美元就让AI训练速度提升30倍~ M…
丹尼尔·韩和迈克尔·韩兄弟开发了Unsloth,这是一款开源工具,可将LLM微调速度提升2-30倍,内存减少70-90%,仅筹集了50万美元,却与价值数十亿美元的基础设施竞争。