图注意力何时应稀疏?学习逐边的 Tsallis 指数
摘要
本文提出了 LTGA,一种图注意力层,学习逐边的 Tsallis 熵指数,以在重尾、softmax 和紧支撑注意力之间插值,提供可解释的稀疏注意力,并在图基准上取得有竞争力的性能。
查看缓存全文
缓存时间: 2026/08/05 07:43
# 图注意力何时应稀疏?学习逐边的 Tsallis 指数 Kleyton da Costa University College London & Holistic AI London, UK kleyton\.vsc@gmail\.com & Bernardo Modenesi University of Utah Salt Lake City, UT, USA bernardo\.modenesi@utah\.edu ###### 摘要 图注意力通过 softmax 对邻居分数进行归一化,这是 Shannon 统计下最大熵的选择。但同质图和异质图需要不同的注意力形态,单一固定归一化无法同时满足两者。我们提出 LTGA(Learnable Tsallis Graph Attention,可学习的 Tsallis 图注意力),这是一种图注意力层,其 Tsallis 熵指数 $q$ 与权重联合学习,在重尾($q<1$)、softmax($q=1$)和紧支撑($q>1$)注意力之间连续插值,并以从全局标量到逐边索引的四种粒度实现;通过有界重参数化,每个模型都从 GAT 基线起步。在八个基准、十个随机种子上,LTGA-Edge 取得了最佳平均排名($2.75$),但 omnibus 检验未拒绝原假设($p=0.199$),且学习 $q$ 并不优于搜索 $q$:基于验证集调节的冻结网格达到 $61.4\%$,调节后的 $\alpha$-entmax 达到 $62.2\%$,容量匹配的 $q\equiv 1$ 对照达到 $62.0\%$,而 LTGA-Edge 为 $61.7\%$。可学习指数带来的好处是一次运行而非网格搜索,以及一个可解释的机制:当 $q$ 偏离 $1$ 时,它会把 $42\%$ 的注意力系数精确剪枝为零,这些边选择性地是错误的边;恢复这些边损失 $7.1$ 个百分点,而以相同比例随机剪枝则多损失 $13.0$ 个百分点。项目页面:https://kleyt0n.github.io/ltga ## 1 引言 图注意力网络(GAT)[Veličković et al., 2018](https://arxiv.org/html/2608.02938#bib.bib17) 通过 softmax 将成对相关分数归一化为每个节点邻域上的概率分布。Softmax 是约束*Shannon*最大熵问题的唯一解 [Jaynes, 1957](https://arxiv.org/html/2608.02938#bib.bib22),因此这一设计隐式假设:注意力权重按广延(Boltzmann–Gibbs)统计量分布最为有效。然而,真实世界图通常会违背支撑广延性的假设。引文网络由少数高度相关的邻居主导,而弱相关的长尾最好完全忽略;异质 Web 图则受益于相反的行为——许多不相似的邻居各自贡献少量证据 [Pei et al., 2020](https://arxiv.org/html/2608.02938#bib.bib24);[Zhu et al., 2020](https://arxiv.org/html/2608.02938#bib.bib56);[Platonov et al., 2023](https://arxiv.org/html/2608.02938#bib.bib54)。在这两种机制下,稠密 softmax 注意力都是次优的,因为它无法表示精确为零,并强制固定的尾部行为。 两个极端已经被探索。*Sparsemax* [Martins and Astudillo, 2016](https://arxiv.org/html/2608.02938#bib.bib19) 用欧氏单纯形投影替换 softmax,以固定稀疏度为代价产生精确零。$\alpha$-*entmax* [Peters et al., 2019](https://arxiv.org/html/2608.02938#bib.bib20);[Correia et al., 2019](https://arxiv.org/html/2608.02938#bib.bib21) 通过可调 $\alpha$ 在 softmax 和 sparsemax 之间插值,并且 [Correia et al. (2019)](https://arxiv.org/html/2608.02938#bib.bib21) 还额外在 Transformer 内部学习逐头 $\alpha$。两者都属于我们所采用的同一*Tsallis*最大熵族 [Tsallis, 1988](https://arxiv.org/html/2608.02938#bib.bib25);[2009](https://arxiv.org/html/2608.02938#bib.bib26),其中熵指数 $q$ 控制从重尾($q<1$)经 Shannon($q=1$)到紧支撑($q>1$)行为的平滑过渡。但两者并不是我们映射的固定点:$\alpha$-entmax 通过单纯形约束固定其阈值,而 $q$-softmax 则通过邻域最大值平移并在之后归一化,因此两者仅在逐邻域对 logits 重新缩放的意义上重合(附录 C)。因此,我们的主张是关于图设置、两侧家族以及 Shannon 极限梯度——而不是关于首次学习稀疏指数。 在这项工作中,我们将熵指数变为网络的一个*可学习标量*。在 GAT 内部用 $q$-softmax 替换 softmax,便得到我们所说的 LTGA:一种在训练过程中归一化连续地在稠密与稀疏机制之间自适应的图注意力层,无需逐任务网格搜索。三个技术贡献使得端到端学习稳定:(i) 一个 $\tanh$ 有界重参数化 $q=1+\delta\,\tanh(\alpha)$,将初始值钉在 Shannon 基线上并防止发散动力学;(ii) 一个带有预热调度的解耦优化器,让网络权重先收敛到强特征区,然后注意力几何才开始变化;(iii) 一个二次 Shannon 先验正则化器,用作奥卡姆剃刀,惩罚不以其任务损失回报的 $q=1$ 偏离。当 $q=1$ 时,该层精确退化为 GATv2,我们通过数值对照参考实现验证了这一等式,而非仅作断言(附录 F)。我们的主要贡献如下: - •我们提出 LTGA,将可学习熵指数引入图邻域注意力。与固定 $\alpha$ 和逐头 $\alpha$ 的 entmax 变体不同,该族是*两侧*的(既有 $q<1$ 重尾,也有 $q>1$ 紧支撑),且该指数可以逐边条件化; - •我们给出了 $q$-softmax 的数值稳定形式,在 $q=1$ 附近采用 Taylor 分支,使值和梯度在 Shannon 极限处均保持连续;我们还贡献了重参数化、解耦优化和 Shannon 先验正则化作为一组训练时稳定器; - •在跨越同质性谱 $h\in[0.05,0.81]$ 的八个节点分类基准上,我们将 LTGA 与 softmax 注意力、按数据集调节的冻结 $q$ 网格、调节后的 $\alpha$-entmax 和 sparsemax 注意力、容量匹配的边门控对照,以及四种针对异质性的架构进行了比较。LTGA-Edge 取得了最佳平均排名;我们报告了 Friedman $p$ 值、逐数据集配对检验(Holm 校正)和 Cohen’s $d$,并明确说明 omnibus 检验未拒绝之处以及 GATv2 仍然领先之处; - •我们表明,当 $q$ 偏离 Shannon 基线时,其行为是*可解释的*:解析分解将 $q>1$ 与数据相关的邻域剪枝(紧支撑)联系起来,将 $q<1$ 与重尾扩散联系起来。我们直接测试了剪枝解释:将剪枝边与速率匹配的随机对照进行比较,并在推理时恢复它们以量化剪枝的收益。我们还探究逐边门控的条件——度、特征相似性和分数差距——而不是将其作为黑箱。 ## 2 背景与相关工作 #### 基于注意力的 GNN。 GAT [Veličković et al., 2018](https://arxiv.org/html/2608.02938#bib.bib17) 用可学习的 softmax 替换固定聚合,作用于每个节点的邻域;GATv2 [Brody et al., 2022](https://arxiv.org/html/2608.02938#bib.bib18) 通过重新定位 LeakyReLU 修复了静态注意力的失败,这是一种与 LTGA 正交的改进,LTGA 继承了这一改进。图 Transformer [Ying et al., 2021](https://arxiv.org/html/2608.02938#bib.bib63);[Rampášek et al., 2022](https://arxiv.org/html/2608.02938#bib.bib64) 将注意力扩展到 1 跳邻域之外,但仍保留 softmax 归一化。我们的贡献与评分函数正交,适用于上述任何一种模型。 #### 稀疏与可学习注意力。 Sparsemax [Martins and Astudillo, 2016](https://arxiv.org/html/2608.02938#bib
相似文章
Graph Machine: 通过边实现更优预训练
本文介绍了Graph Machine,一种通过动态指针将Transformer中的密集注意力层替换为稀疏层的方法,从而在预训练期间提高效率并保持或增强性能。
Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference
This paper introduces Power Law Graph Attention (PLGA) and the PLDR-LLM architecture, an exact generalization of scaled dot-product attention using input-generated bilinear operators. It presents theoretical results including an inference-collapse theorem, empirical stability measurements, and machine-checked proofs in Lean 4.
分层稀疏注意力机制的正确实现:迈向无限上下文建模
提出HiLS注意力机制,一种基于块的稀疏注意力方法,通过语言模型损失端到端学习块选择,性能可与全注意力媲美,同时支持超长上下文外推和更快的推理速度。
通过Gist Tokens的简化稀疏注意力
本文介绍了简化稀疏注意力(SSA),一种在持续预训练中使用Gist令牌的方法,能够在推理时无需架构更改即可实现高效的分块选择,取得了高压缩比,并在LongBench和检索增强生成等长上下文任务上优于基线。
将稀疏注意力作为范围搜索问题:迈向推理高效的 KV 缓存索引
本文介绍了 Louver,这是一种用于 KV 缓存检索的新型索引结构。它将稀疏注意力重新表述为范围搜索问题,保证零假阴性,并且比现有方法更高效。