如果我真的很想从零开始训练一个AI会怎样?

Reddit r/artificial 新闻

摘要

对从零开始训练AI模型的挑战与魅力的个人反思,强调了数据、硬件和扩展方面的困难,同时指出令人惊讶的是,在普通硬件上也能训练出相当不错的小模型。

最近我对这个想法走火入魔了😭 不是“构建一个AI应用”,也不是“接入GPT API”。我是说真正地训练一个模型。比如凌晨3点下载数据集,看着GPU烧掉,连续6小时修复随机出现的CUDA错误,训练好几天才发现数据集是垃圾💀 网上所有人都说这几乎不可能,除非你有数十亿美元和一个城市那么大的数据中心。但同时……也有人从卧室里用租来的GPU训练出了令人惊讶的好用的小模型。所以我陷入了一种奇怪的心态:一方面觉得这极度不现实,另一方面又觉得我们正处于非常早期的阶段,没人完全知道到底什么才是可能的。最疯狂的是意识到模型本身只是成功的一半。真正的噩梦似乎是:收集干净数据、保持输出一致性、推理成本、扩展、以及避免AI在糟糕训练后彻底变傻😭 这里有没有人也在认真搞这些事,而不是仅仅封装API?
查看原文

相似文章

我认为AI训练比人们想象的要容易得多

Reddit r/artificial

作者认为,由于廉价的GPU租赁和AI驱动的工具,AI训练如今已经广泛可及,但许多人盲目使用未经验证的低质量数据,导致结果不佳和资源浪费。

@qinzytech: https://x.com/qinzytech/status/2066585405479371092

X AI KOLs Timeline

对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。