@PyTorch: PyTorch 2.12 在编译、导出、分布式训练和加速器支持方面引入重大更新。亮点…

X AI KOLs Following 工具

摘要

PyTorch 2.12 版本包括对编译、导出、分布式训练和加速器支持的重大更新,CUDA 上批量化 linalg.eigh 速度提升高达 100 倍,并新增了 torch.accelerator.Graph 等 API。

PyTorch 2.12 在编译、导出、分布式训练和加速器支持方面引入了重大更新。亮点包括:CUDA 上批量化 linalg.eigh 速度提升高达 100 倍,新的 torch.accelerator.Graph API,torch.export.save 中的 Microscaling 量化支持,以及融合的 Adagrad。此版本自 PyTorch 2.11 以来共有 457 位贡献者提交了 2,926 次提交。有问题吗?请于 5 月 20 日上午 10:00(太平洋时间)加入 @AndreyTalman(@Meta)、@albanDesmaison(@Meta)和 @joespeez(@reflection_ai),由 @Chris_AI_HPC(@Meta)主持的直播问答,讨论该版本并回答社区问题。阅读发布博客并注册网络研讨会:http://pytorch.org/blog/pytorch-2-12-release-blog… #PyTorch #OpenSourceAI #MachineLearning #AIInfrastructure
查看原文

相似文章

PyTorch 2.12 版本亮点(7分钟阅读)

TLDR AI

PyTorch 2.12 引入了显著的性能改进,包括在 CUDA 上实现高达 100 倍加速的批量本征分解、新的设备无关的 torch.accelerator.Graph API,以及在 torch.export 中支持微缩放量化,持续推动该框架向统一生产平台的演进。

@PyTorch:PyTorch 2.13 来了,包含来自 526 位贡献者的 3,328 次提交,并更新了 FlexAttention、CuTeDSL、nn.LinearCros…

X AI KOLs Following

PyTorch 2.13 已发布,主要更新包括:Apple Silicon 上的 FlexAttention(速度提升高达 12 倍)、CuTeDSL 后端、可将显存减少 4 倍的 nn.LinearCrossEntropyLoss、新的 torchcomms 通信后端、FSDP2 通信重叠、Python 3.15 wheel 支持以及更广泛的平台支持。计划于 7 月 22 日进行现场问答。

PyTorch分布式:加速数据并行训练的实践经验

Papers with Code Trending

本文详细介绍了PyTorch分布式数据并行模块的设计与优化,重点阐述了梯度分桶(gradient bucketing)和计算-通信重叠等技术,这些技术使系统在使用256个GPU时实现了接近线性的可扩展性。