标签
本文提出了 FLIP(联邦学习互操作性平台),这是一个开源的多应用平台,使医疗领域的跨洲联邦学习具备可重复性。研究通过在英国和泰国的节点上对合成胸部 X 光数据集进行联邦微调与评估,对其进行了验证。
Nereus 是一个成本感知运行时,它将针对大型语言模型的强化学习后训练任务调整为高效执行计划,将延迟降低27.7%,并将吞吐量提升最多7.27倍,相比现有工具。
DistribAI v2 是一个平台,用于在多个消费级设备上进行AI模型的分布式训练,提供改进的托管选项和强大的边界情况处理。
本文提出了一种用于AnDE分类器的联邦学习框架,通过避免传输语义上有意义的参数来增强隐私,并在离散数据集上证明了其有效性。
本文通过模拟管道并行训练中的阶段跳过来探讨分布式预训练中的容错性,展示了在故障发生时,健康的工作节点能够以最小的验证损失影响继续训练。
Michael Yu 分享了他从斯坦福 CS336 课程中关于从零构建大语言模型的详细实现和学习心得,涵盖了分词器、Transformer、训练系统和对齐技术。
本文提出了块并行和上下文分片块并行(CSBP)方法,以高效训练长上下文扩散语言模型,在SWE-bench Verified等基准测试中显著提高了吞吐量和性能。
本文提出了WFM,一种用于可扩展、原生智能体知识表示和检索的维基基础模型,展示了在复杂智能体推理任务中性能的提升,并实现了10.5倍的训练加速。
本文介绍了PyTorch北美会议的训练专轨,其中包括分布式训练、优化技术和基础模型的实用会议,旨在提升AI系统的效率。
HyperParallel 是一个基于 PyTorch 的分布式加速库,专为 Ascend SuperPoD 优化,展示了比标准 PyTorch FSDP2 与 Muon 更高的训练吞吐量,同时保持损失收敛,如在 #PyTorchCon China 的演示中所展示。
本文提出了一种方法,通过利用多播技术和在线FPGA,以及同步调度的优化框架,来增强广域网上的分布式训练,以最大化信息交换并减少性能差距。
vLLM引入了一个原生的分片权重传输引擎,使用Ray Direct Transport (RDT)来在大规模在线强化学习环境中进行高效的权重同步,从而提升像Kimi K2这样的模型的性能。
一位YouTube创作者在休整期后回归,教授从零开始构建分布式训练框架,专注于DeepSeek、MoE和MLA等高级AI主题,并强调培养解决问题的能力和自信心。
本文研究了联邦学习在CNC刀具磨损预测中的应用,表明在分布式制造环境中,联邦模型的性能接近集中式学习,并显著优于本地客户端基线。
介绍了 Data-Centric Parallel (DCP),一种通过在每批次动态调整运行时设置来训练变长序列深度学习模型的方法,在 32 个 H200 GPU 上实现了高达 2.88 倍的加速,仅需集成 10 行代码。
介绍了SNI-GNN,一种SmartNIC辅助的全图GNN训练系统,通过在网络内预测远端嵌入来减少节点间通信,实现了1.3–3.6倍的加速,且精度损失可忽略不计。
Presents DG-FedReuse, a federated learning mechanism that reuses age-decayed cached client updates under a proxy-gradient threshold to reduce uplink communication, achieving significant modeled savings with minimal accuracy loss on image classification benchmarks.
This paper proposes FedSLM, a parameter-centric framework for federated fine-tuning of foundation models with heterogeneous compressed clients, using SVD-based decomposition and a weak-to-strong elicitation step to handle resource asymmetry. Experiments show it outperforms existing federated baselines while reducing client GPU memory by ~50%.
PyTorch 2.13 发布版为 Apple Silicon 带来 FlexAttention,通过融合的 LinearCrossEntropyLoss 实现高达 12 倍加速,并将大词表模型的峰值内存降低 4 倍,同时还更新了分布式训练、编译和端侧推理。
本文介绍了SLAI T-Rex,一种面向昇腾NPU SuperPOD上万亿参数MoE模型的全参数后训练优化框架,实现了34.22%的MFU,并在运筹学任务上比GPT-5.4-Mini高出3.98个百分点。