DistribAI v2
摘要
DistribAI v2 是一个平台,用于在多个消费级设备上进行AI模型的分布式训练,提供改进的托管选项和强大的边界情况处理。
DistribAI 是一个用于分布式训练的平台!您可以轻松地在少量或大量消费级设备上训练大型或小型模型!DistribAI 是我开发了一段时间的平台,V2 版本今天发布。DistribAI 使用 C++ 和 Libtorch 以实现高速,并支持分布式运行 PyTorch 训练器!边界情况(如崩溃、恶意用户、不稳定连接等)已为您处理。在免费的 Colab、Kaggle 和 Molab GPU,加上本地 4070 SUPER 上,我们获得了约 2 个完全加载的 5090 的免费训练算力和约 5 个完整 5090 的 VRAM,全部整合为一个。托管也变得更容易,支持可共享的加入链接,以及 Cloudflared/ngrok 支持,为您的 DistribAI 设置提供 100% 免费的服务器托管。与您的社区、朋友、免费 GPU 以及更多设备一起训练!试试看!欢迎提出问题(和点星);https://github.com/naxium-oss/DistribAI
相似文章
@tom_doerr: 将AI训练分布到点对点代理网络中 https://github.com/hyperspaceai/agi…
Hyperspace推出了一种点对点代理网络,用于跨消费设备进行分布式AI训练,实现高压缩且无需中央基础设施的协作模型训练。
分布式本地代理基准测试。
这篇文章介绍了一个针对AI代理的分布式基准测试网站,允许社区成员在各种本地模型和硬件配置上测试和共享结果。
@cpaik: 开源设备端多模型推理
一款用于在本地设备上运行多个AI模型推理的开源工具,可提升设备端AI部署效率。
Decoupled DiLoCo:弹性分布式 AI 训练的新前沿
DeepMind 推出 Decoupled DiLoCo,这是一种新型分布式 AI 训练架构,通过隔离硬件故障,实现大型模型在全球分散数据中心之间的弹性、低带宽训练。
Applied Compute Agent Cloud (4分钟阅读)
Applied Compute发布了AC2,一个平台,使AI团队能够使用开放模型和集成研究工具,大规模构建、训练和部署自定义模型。