从Pascal到Blackwell的线程束发散特性分析

Hugging Face Daily Papers 论文

摘要

本文分析了从Pascal到Blackwell的NVIDIA GPU各代架构中的线程束发散行为,发现尽管会合机制不断演变,但线性序列化开销保持稳定。

自Volta引入独立线程调度(ITS)以来,人们普遍认为NVIDIA GPU以固定方式处理线程束发散。我们使用前ITS的Pascal作为基线,在Ampere、Hopper以及数据中心和消费级Blackwell GPU上测试了这一假设。通过结合周期精确的微基准测试、硬件计数器和编译器生成的SASS静态分析,我们区分了稳定行为与架构变化。在所有测试的架构代中,发散路径按路径数k线性序列化,遵循T(k) ≈ sk,没有超线性会合惩罚。线程束执行效率下降为32/k,惩罚与占用率无关,谓词执行消除了序列化开销。同样的行为出现在Pascal上,表明这种程序员可见的开销模型早于ITS。然而,编译器发出的会合机制已经发生了显著变化。Pascal使用每线程束的SSY/SYNC指令栈,而后续架构使用屏障寄存器指令。延迟会合(超出直接后支配节点)的案例从Ampere上的29个减少到Blackwell上的2个。Blackwell还引入了两级会合屏障分类、统一分支指令和显式部分掩码线程束同步,这些在Ampere或Hopper上均未出现。受控的位翻转实验表明,新的屏障类别是一种静态编译器分类,在我们的测试中没有观察到运行时效果。因此,即使NVIDIA的控制流ISA和会合机制不断演进,线程束发散仍保持着稳定且可预测的性能开销。
查看原文
查看缓存全文

缓存时间: 2026/07/28 10:24

论文页面 - 从Pascal到Blackwell的线程束分化特性刻画

来源:https://huggingface.co/papers/2607.23402
发布于7月26日

·

Alpin (https://huggingface.co/alpindale) 于7月28日提交

摘要

自从Volta引入独立线程调度(ITS)以来,NVIDIA GPU被广泛认为以固定方式处理线程束分化。我们使用未采用ITS的Pascal作为基线,对Ampere、Hopper以及数据中心和消费级Blackwell GPU上的这一假设进行了测试。结合周期精确的微基准测试、硬件计数器和编译器生成的SASS静态分析,我们将稳定行为与架构变化区分开来。在所有测试的世代中,分化路径与路径数量k呈线性序列化,遵循T(k) ≈ sk,且不存在超线性重汇聚惩罚。线程束执行效率下降为32/k,该惩罚与占用率无关,而断言消除了序列化开销。Pascal上出现了相同的行为,表明这种程序员可见的成本模型早于ITS。然而,编译器发出的重汇聚机制发生了显著变化。Pascal使用每线程束的SSY/SYNC指令栈,而后续世代使用屏障寄存器指令。超出直接后支配节点的延迟重汇聚从Ampere上的29例下降到Blackwell上的2例。Blackwell还引入了两级收敛屏障分类、统一分支指令以及显式部分掩码线程束同步,这些在Ampere或Hopper上均未出现。受控比特翻转实验表明,新的屏障分类是一种静态编译器分类,在我们的测试中未观察到任何运行时效果。因此,即使NVIDIA的控制流ISA和重汇聚机制不断演进,分化仍保持稳定且可预测的性能开销。

查看arXiv页面 (https://arxiv.org/abs/2607.23402)
查看PDF (https://arxiv.org/pdf/2607.23402)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.23402)

在你的智能体中获取这篇论文:

hf papers read 2607.23402

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 0

没有模型链接本论文

在模型README.md中引用arxiv.org/abs/2607.23402即可从此页面链接。

引用本论文的数据集 0

没有数据集链接本论文

在数据集README.md中引用arxiv.org/abs/2607.23402即可从此页面链接。

引用本论文的Spaces 0

没有Space链接本论文

在Space README.md中引用arxiv.org/abs/2607.23402即可从此页面链接。

包含本论文的收藏 0

没有收藏包含本论文

将本论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

Blackwell 与 PDL 性能提升

Reddit r/LocalLLaMA

Llama.cpp 现已支持适用于 Blackwell GPU 的 Nvidia 程序化依赖启动 (PDL),在 Token 生成时可带来 5-10% 的性能提升。该功能默认未启用,需通过编译标志开启。

@charles_irl: dflash 高速运转

X AI KOLs Timeline

NVIDIA 宣布推出 DFlash,一种用于推测解码的开源块扩散模型,在 Blackwell GPU 上可实现高达 15 倍的推理吞吐量提升,同时保持交互性。