@PyTorch: PyTorch 2.12 在编译、导出、分布式训练和加速器支持方面引入重大更新。亮点…
摘要
PyTorch 2.12 版本包括对编译、导出、分布式训练和加速器支持的重大更新,CUDA 上批量化 linalg.eigh 速度提升高达 100 倍,并新增了 torch.accelerator.Graph 等 API。
相似文章
PyTorch 2.12 版本亮点(7分钟阅读)
PyTorch 2.12 引入了显著的性能改进,包括在 CUDA 上实现高达 100 倍加速的批量本征分解、新的设备无关的 torch.accelerator.Graph API,以及在 torch.export 中支持微缩放量化,持续推动该框架向统一生产平台的演进。
@PyTorch:PyTorch 版本包含数千项变更,我们的发布版现场问答让您直接与维护者交流……
重点介绍了带来重大更新的 PyTorch 2.12 版本,并宣布将于 5 月 20 日与维护者举办现场问答活动,讨论编译、分布式系统、量化等内容。
@PyTorch:PyTorch 2.13 来了,包含来自 526 位贡献者的 3,328 次提交,并更新了 FlexAttention、CuTeDSL、nn.LinearCros…
PyTorch 2.13 已发布,主要更新包括:Apple Silicon 上的 FlexAttention(速度提升高达 12 倍)、CuTeDSL 后端、可将显存减少 4 倍的 nn.LinearCrossEntropyLoss、新的 torchcomms 通信后端、FSDP2 通信重叠、Python 3.15 wheel 支持以及更广泛的平台支持。计划于 7 月 22 日进行现场问答。
PyTorch分布式:加速数据并行训练的实践经验
本文详细介绍了PyTorch分布式数据并行模块的设计与优化,重点阐述了梯度分桶(gradient bucketing)和计算-通信重叠等技术,这些技术使系统在使用256个GPU时实现了接近线性的可扩展性。
@PyTorch: vLLM 和 PyTorch 联手修复了一个长期存在的 aarch64 安装痛点——自 PyTorch 2.11.0 起,pip install 到…
PyTorch 2.11.0 现在将支持 CUDA 的 aarch64 wheels 发布到 PyPI,修复了 vLLM 在 NVIDIA Grace Hopper 和 Grace Blackwell 系统上长期存在的安装问题,无需再使用自定义索引 URL,并防止静默替换为 CPU wheel。