training-throughput

标签

Cards List
#training-throughput

GPU集群因等待存储而闲置,比我想象的更常见

Reddit r/ArtificialInteligence ↗ · 2026-07-13

在一次AI基础设施聚会上,多人反映GPU集群经常闲置,因为存储系统在训练期间无法足够快地提供数据,尤其是在使用旧NAS上的大型非结构化数据集时。与会者提到转向高吞吐量、针对S3优化的平台,如Cloudian HyperStore和VAST Data,以解决这一瓶颈。

0 人收藏 0 人点赞
#training-throughput

AsyncOPD:在策略蒸馏可以有多陈旧?

arXiv cs.LG ↗ · 2026-06-24 缓存

本文提出 AsyncOPD,一种完全异步的在策略蒸馏流程,用于大语言模型,系统研究了陈旧策略数据的影响,并提出了估计器设计,使训练吞吐量提升 1.6-3.8 倍,同时保持相当的准确率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈