GPU集群因等待存储而闲置,比我想象的更常见

Reddit r/ArtificialInteligence 新闻

摘要

在一次AI基础设施聚会上,多人反映GPU集群经常闲置,因为存储系统在训练期间无法足够快地提供数据,尤其是在使用旧NAS上的大型非结构化数据集时。与会者提到转向高吞吐量、针对S3优化的平台,如Cloudian HyperStore和VAST Data,以解决这一瓶颈。

在最近的一次AI基础设施聚会上,与几个人聊了聊,反复听到的抱怨不是计算能力,而是存储无法在训练期间足够快地喂给GPU,特别是当大型非结构化数据集存放在旧的NAS或并非为那种吞吐量设计的通用存储上。有几个人提到为此转向专门为高吞吐量S3访问而构建的存储平台,提到了Cloudian的HyperStore和VAST Data。有趣的是,看到“存储”成为GPU社区中的瓶颈话题,感觉这里比以往更新了。有人在自己的训练集群上遇到这个问题吗?好奇哪些方案真正解决了问题,而不是仅仅减轻了痛苦。
查看原文

相似文章

随着 AI 对内存需求的增加,存储技术加速提升

NVIDIA Blog

在未来内存与存储大会(FMS)上,NVIDIA 宣布将其用于 GPU 直连存储的 cuFile API 开源,并展示了 Vera CPU 在压缩和加密流水线中相比 x86 高达 3.21 倍的吞吐量提升,以应对 AI 日益增长的存储需求。