联合所有GPU来训练一个社区模型
摘要
关于从社区汇集GPU以训练大规模AI模型的讨论,质疑其可行性以及现有项目,尽管存在已知瓶颈如延迟和权重中毒。
这个子社区拥有惊人的集体显存量。为什么我们不汇集GPU来训练一个庞大的社区模型?目前是否有活跃的分布式志愿计算项目实际在做这件事?我知道瓶颈(延迟、权重中毒、节点断开),有没有人成功完成过社区训练?还是说延迟瓶颈太严重了?
相似文章
进来参与:社区模型构建讨论帖
一个帖子提出了一种通过众包计算创建社区AI模型的方法,利用Branch-Train-Stitch技术将独立训练的子模型组装成混合专家(MoE)模型,并讨论了硬件要求、参与者参与方式和技术挑战。
AI训练能否像比特币挖矿那样去中心化?[D]
本文探讨了AI训练能否像比特币挖矿那样去中心化,参与者贡献GPU资源训练开源模型以换取代币,并引发了关于验证、虚假梯度和效率等问题的讨论。
使用云托管GPU运行AI
关于使用云托管GPU运行AI模型的文章,涵盖部署选项和注意事项。
@guohao_li:是的,确实是时候认真考虑购买更多GPU并开始构建我们自己的本地AI堆栈了。我很好奇…
一位研究人员表示,是时候购买更多GPU并构建本地AI堆栈了,并提到Qwen 3.5 27B和GLM 5.2等模型消除了永久底层阶级的威胁。
@andrewchen:体验本地AI模型的主要缺点在于你会买一块GPU,然后另一块,接着又一块……
Andrew Chen分享了他为本地AI实验购买多块GPU的经历,在5090 eGPU上以100 tok/s运行Qwen3.6 27B密集模型,并将其与Sonnet 4.6进行比较。