@h100envy: Daniel Han 创建了 Unsloth,这正是半数开源项目能在单张 GPU 而非集群上微调模型的原因。他还……

X AI KOLs Timeline 工具

摘要

Daniel Han 构建了 Unsloth,该工具通过重写 GPU 内核,使单张 GPU 的微调速度提升 2 到 3 倍,让众多开源用户无需集群即可训练模型。

Daniel Han 编写了 Unsloth,这正是半数开源项目能在单张 GPU 而非集群上微调模型的原因。 他没有优化数学运算,而是手动重写了内核,发现并修复了他人代码中的错误,将训练速度提升了 2 到 3 倍,且准确率零损失。 每月有数百万次微调任务通过他的代码运行。大多数在本地训练模型的人正站在这项成果之上而不自知。 每个人都在谈论谁拥有最多的 GPU。而他让你的 GPU 变得足够用。
查看原文
查看缓存全文

缓存时间: 2026/06/18 04:06

Daniel Han 创建了 Unsloth,正是因为这个项目,开源社区的一半人才能在单张 GPU 上微调模型,而无需动用集群。

他并没有优化数学公式,而是手动重写了内核,找出了其他人代码中的种种错误,使得训练速度提升 2 到 3 倍,且准确率完全不受影响。

每个月都有数百万次微调任务在他的代码上运行。绝大多数在本地训练模型的人,其实都在依赖他的成果,却浑然不知。

人人都在谈论谁拥有的 GPU 最多,而他让你的 GPU 变得足够强大。

相似文章

单GPU微调的高效异构协同设计

Papers with Code Trending

SlideFormer 提出了一种异构协同设计,用于在单GPU上进行全参数LLM微调,利用GPU/CPU/RAM/NVMe及其层滑动引擎和优化的Triton内核,在单张RTX 4090上实现对123B+模型的微调,吞吐量显著提升。

Show HN:在 4 GB 笔记本 GPU 上微调 8B 模型

Hacker News Top

Soup 是一个开源命令行工具,通过单条命令简化 LLM 的微调和后训练,支持基于 QLoRA 的训练,通过逐层流式传输仅需 4 GB 显存即可在消费级 GPU 上运行。最新版本新增了 DPO、ORPO、SimPO 和 KTO 等偏好损失,且不会使内存需求翻倍。