标签
本文提出了一种方法,通过利用多播技术和在线FPGA,以及同步调度的优化框架,来增强广域网上的分布式训练,以最大化信息交换并减少性能差距。
vLLM引入了一个原生的分片权重传输引擎,使用Ray Direct Transport (RDT)来在大规模在线强化学习环境中进行高效的权重同步,从而提升像Kimi K2这样的模型的性能。
一位YouTube创作者在休整期后回归,教授从零开始构建分布式训练框架,专注于DeepSeek、MoE和MLA等高级AI主题,并强调培养解决问题的能力和自信心。
本文研究了联邦学习在CNC刀具磨损预测中的应用,表明在分布式制造环境中,联邦模型的性能接近集中式学习,并显著优于本地客户端基线。
介绍了 Data-Centric Parallel (DCP),一种通过在每批次动态调整运行时设置来训练变长序列深度学习模型的方法,在 32 个 H200 GPU 上实现了高达 2.88 倍的加速,仅需集成 10 行代码。
介绍了SNI-GNN,一种SmartNIC辅助的全图GNN训练系统,通过在网络内预测远端嵌入来减少节点间通信,实现了1.3–3.6倍的加速,且精度损失可忽略不计。
Presents DG-FedReuse, a federated learning mechanism that reuses age-decayed cached client updates under a proxy-gradient threshold to reduce uplink communication, achieving significant modeled savings with minimal accuracy loss on image classification benchmarks.
This paper proposes FedSLM, a parameter-centric framework for federated fine-tuning of foundation models with heterogeneous compressed clients, using SVD-based decomposition and a weak-to-strong elicitation step to handle resource asymmetry. Experiments show it outperforms existing federated baselines while reducing client GPU memory by ~50%.
PyTorch 2.13 发布版为 Apple Silicon 带来 FlexAttention,通过融合的 LinearCrossEntropyLoss 实现高达 12 倍加速,并将大词表模型的峰值内存降低 4 倍,同时还更新了分布式训练、编译和端侧推理。
本文介绍了SLAI T-Rex,一种面向昇腾NPU SuperPOD上万亿参数MoE模型的全参数后训练优化框架,实现了34.22%的MFU,并在运筹学任务上比GPT-5.4-Mini高出3.98个百分点。
提出 DiLoCo,一种分布式优化算法,能够在弱连接设备上训练大型语言模型,通信量减少500倍,同时达到与全同步训练相当的性能。
据报道,PyTorch 正在为 Mac 上的分布式模型训练添加一个快速的 Thunderbolt 通信后端。
FeLiX是一个新的联邦学习编排框架,通过处理临时客户端可用性、动态数据异质性和结果延迟,优化实时交互流上的目标准确率时间。它引入了流感知可用性层级、新鲜效用选择和延迟鲁棒聚合,与最先进的基线相比,将挂钟时间减少了最多2.37倍,通信带宽减少了1.30倍。
AMD 和 Meta 贡献者将 PyTorch Monarch 移植到 AMD Instinct GPU 并配合 ROCm,实现了大规模容错分布式训练。该博客详细介绍了工程工作以及在大型集群上的验证情况。
本文提出使用模型合并技术,特别是Iso-C聚合,来改进DiLoCo分布式训练中的聚合步骤,从而产生一种名为IsoLoCo的新方法,该方法在语言模型预训练上优于DiLoCo。
本文描述了将分布式训练运行时 PyTorch Monarch 移植到基于 ROCm 的 AMD GPU 的过程,实现了大规模单控制器容错训练,并解决了大规模 LLM 训练中的可靠性挑战。
Nous Research推出了Psyche,这是一种去中心化基础设施,用于在分布式异构硬件上训练大型语言模型,采用新型优化器DeMo和DisTrO大幅降低通信开销。
本文作者分享了从nnScaler到大规模分布式训练系统的经验与思考,讨论了训练系统的正确性、灵活性、边界扩展以及后训练与强化学习带来的挑战。
一份精心整理的资源列表,用于掌握AI系统的GPU工程,涵盖CUDA、ROCm、优化工具、多GPU编排和分布式训练。
一条推文列出AI基础设施工程师必备技能,涵盖GPU基础、推理优化、分布式训练及生产部署。