从Pascal到Blackwell的线程束发散特性分析
摘要
本文分析了从Pascal到Blackwell的NVIDIA GPU各代架构中的线程束发散行为,发现尽管会合机制不断演变,但线性序列化开销保持稳定。
查看缓存全文
缓存时间: 2026/07/28 10:24
论文页面 - 从Pascal到Blackwell的线程束分化特性刻画
来源:https://huggingface.co/papers/2607.23402
发布于7月26日
·
由 Alpin (https://huggingface.co/alpindale) 于7月28日提交
摘要
自从Volta引入独立线程调度(ITS)以来,NVIDIA GPU被广泛认为以固定方式处理线程束分化。我们使用未采用ITS的Pascal作为基线,对Ampere、Hopper以及数据中心和消费级Blackwell GPU上的这一假设进行了测试。结合周期精确的微基准测试、硬件计数器和编译器生成的SASS静态分析,我们将稳定行为与架构变化区分开来。在所有测试的世代中,分化路径与路径数量k呈线性序列化,遵循T(k) ≈ sk,且不存在超线性重汇聚惩罚。线程束执行效率下降为32/k,该惩罚与占用率无关,而断言消除了序列化开销。Pascal上出现了相同的行为,表明这种程序员可见的成本模型早于ITS。然而,编译器发出的重汇聚机制发生了显著变化。Pascal使用每线程束的SSY/SYNC指令栈,而后续世代使用屏障寄存器指令。超出直接后支配节点的延迟重汇聚从Ampere上的29例下降到Blackwell上的2例。Blackwell还引入了两级收敛屏障分类、统一分支指令以及显式部分掩码线程束同步,这些在Ampere或Hopper上均未出现。受控比特翻转实验表明,新的屏障分类是一种静态编译器分类,在我们的测试中未观察到任何运行时效果。因此,即使NVIDIA的控制流ISA和重汇聚机制不断演进,分化仍保持稳定且可预测的性能开销。
查看arXiv页面 (https://arxiv.org/abs/2607.23402)
查看PDF (https://arxiv.org/pdf/2607.23402)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.23402)
在你的智能体中获取这篇论文:
hf papers read 2607.23402
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 0
没有模型链接本论文
在模型README.md中引用arxiv.org/abs/2607.23402即可从此页面链接。
引用本论文的数据集 0
没有数据集链接本论文
在数据集README.md中引用arxiv.org/abs/2607.23402即可从此页面链接。
引用本论文的Spaces 0
没有Space链接本论文
在Space README.md中引用arxiv.org/abs/2607.23402即可从此页面链接。
包含本论文的收藏 0
没有收藏包含本论文
将本论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
Blackwell 与 PDL 性能提升
Llama.cpp 现已支持适用于 Blackwell GPU 的 Nvidia 程序化依赖启动 (PDL),在 Token 生成时可带来 5-10% 的性能提升。该功能默认未启用,需通过编译标志开启。
@ZhihuFrontier:GPU编程因张量核心速度太快无法喂饱而改变。知乎作者THU-PACMAN实验室分享了一个精辟的剖析…
详细剖析了NVIDIA GPU编程从Volta到Blackwell的演变,重点突出了从同步线程模型到异步数据流的转变以及喂饱张量核心的挑战。文章讨论了TMA、TMEM和tcgen05 MMA等新硬件特性,并展示了FlashAttention-3和FlashMLA等现代内核如何利用这些变化实现更高利用率。
@charles_irl: dflash 高速运转
NVIDIA 宣布推出 DFlash,一种用于推测解码的开源块扩散模型,在 Blackwell GPU 上可实现高达 15 倍的推理吞吐量提升,同时保持交互性。
llama.cpp b9095 发布!支持双 Blackwell PCIe 显卡无需 NCCL 的张量并行
llama.cpp b9095 版本引入了针对双 Blackwell PCIe GPU 的免 NCCL 张量并行功能,使得在不依赖 NCCL 的情况下也能实现高效的多 GPU 推理。
Blackwell LLM 工具包 - 针对 Blackwell GPU 的 NVFP4 配置 + Wheels + TensorRT-LLM 基准测试 - Nemotron 3 Omni 达到 270 tok/s
一个开发者工具包,提供在使用 TensorRT-LLM 通过 Nvidia Blackwell GPU 以 NVFP4 精度运行大型语言模型时的配置、预编译包(wheels)及基准测试数据。