基于二值主成分的无训练哈希注意力

arXiv cs.LG 论文

摘要

介绍了BinaryPC,一种面向长上下文大语言模型的无训练哈希稀疏注意力方法,利用二值主成分构建哈希码,在保持准确率的同时,解码吞吐量较FlashAttention提升了3.56倍。

arXiv:2608.04405v1 公告类型:新 摘要:长上下文大语言模型(LLMs)正越来越多地部署于实际应用中,但自注意力机制仍然是主要的效率瓶颈——尤其是在解码阶段——因为需要反复处理不断增长的键值(KV)缓存。现有的稀疏注意力通过关注更少的KV对来减少计算量,但往往会导致显著的精度下降、需要额外训练或依赖高成本的哈希。在这项工作中,我们提出了BinaryPC,一种面向长上下文LLM的免训练、数据感知的基于哈希的稀疏注意力方法。BinaryPC通过计算数据的二值主成分来构建紧凑的二值哈希码及相应的哈希函数。与使用数据无关随机投影的局部敏感哈希(LSH)或学习式非线性哈希方法不同,BinaryPC构建的二进制编码显式保留了数据的结构信息,且无需基于梯度的训练。跨多个模型家族和长上下文基准的综合实验表明,BinaryPC在保持与全注意力相当的准确性的同时,在稀疏和基于哈希的基线方法中取得了更优性能。在现代GPU上,BinaryPC相对于FlashAttention内核将端到端解码吞吐量提升了3.56倍。我们的代码可在 https://github.com/yudaohai666/BPC 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:49

# 基于二元主成分的免训练哈希注意力

Source: https://arxiv.org/html/2608.04405  
Zhanpeng ZengKeyu ChenWenhao LiZhifeng ShenLuxi LinRuizhi QiaoXing SunRongrong Ji

###### 摘要

长上下文大语言模型(LLMs)正越来越多地部署在实际应用中,然而自注意力机制仍然是主要的效率瓶颈——尤其是在解码阶段——因为需要反复处理不断增长的键值(KV)缓存。现有的稀疏注意力通过关注较少的 KV 对来减少计算,但通常面临显著的精度下降、需要额外训练或依赖昂贵的哈希。在这项工作中,我们提出了 BinaryPC,一种面向长上下文 LLM 的免训练、数据感知的基于哈希的稀疏注意力机制。BinaryPC 通过计算数据的二元主成分来构建紧凑的二元哈希码和相应的哈希函数。与使用数据无关随机投影的局部敏感哈希(LSH)或学习式非线性哈希方法不同,BinaryPC 构建的二元码显式保留数据的结构信息,而无需基于梯度的训练。跨多个模型家族和长上下文基准的综合实验表明,BinaryPC 相对于全注意力保持了精度,同时在稀疏和基于哈希的基线中取得了优越的性能。在现代 GPU 上,BinaryPC 相比 FlashAttention 内核将端到端解码吞吐量提升了 3.56×。我们的代码可在 https://github.com/yudaohai666/BPC 获取。机器学习,ICML

## 1 引言

参考图注  
图1:在 RULER\(Hsieh et al.,2024 (https://arxiv.org/html/2608.04405#bib.bib18)\)NIAH 多值任务上的性能比较。Oracle TOPK 使用 2% 预算的精确全精度注意力选择 top-k 键。

随着大语言模型(LLMs)的快速发展,处理长距离依赖已成为多文档问答\(Wang et al.,2024 (https://arxiv.org/html/2608.04405#bib.bib30)\)、对话代理和复杂推理任务\(Achiam et al.,2023 (https://arxiv.org/html/2608.04405#bib.bib1); Anthropic,2024 (https://arxiv.org/html/2608.04405#bib.bib3); Yang et al.,2025a (https://arxiv.org/html/2608.04405#bib.bib32)\)等应用的关键。现代 LLM 推理通常分为两个阶段:预填充阶段(prefill stage),输入 token 被并行处理以构建键值(KV)缓存\(Pope et al.,2023 (https://arxiv.org/html/2608.04405#bib.bib25)\);以及解码阶段(decoding stage),token 被自回归地生成。与高度并行的预填充阶段相比,解码阶段涉及对不断增长的 KV 缓存的频繁内存传输,而每个 token 的生成本质上是顺序的。这导致 GPU 利用率低、硬件效率欠佳,严重限制了长序列的吞吐量\(He & Zhai,2024 (https://arxiv.org/html/2608.04405#bib.bib16)\)。为缓解这一问题,先前的研究探索了一系列稀疏注意力机制,以减少解码过程中的计算开销。静态选择策略\(Ge et al.,2024 (https://arxiv.org/html/2608.04405#bib.bib13); Li et al.,2024 (https://arxiv.org/html/2608.04405#bib.bib22); Cai et al.,2025 (https://arxiv.org/html/2608.04405#bib.bib6); Qin et al.,2025 (https://arxiv.org/html/2608.04405#bib.bib26); Lin et al.,2025 (https://arxiv.org/html/2608.04405#bib.bib23)\)通常在预填充后聚合或剪枝 KV 条目,使后续解码能够基于压缩表示进行。另一些方法通过不断丢弃或降低次要 token 的权重来在解码期间维持固定的内存预算\(Zhang et al.,2023 (https://arxiv.org/html/2608.04405#bib.bib36); Oren et al.,2024 (https://arxiv.org/html/2608.04405#bib.bib24); Xiao et al.,2024 (https://arxiv.org/html/2608.04405#bib.bib31); Adnan et al.,2024 (https://arxiv.org/html/2608.04405#bib.bib2)\)。此外,查询感知的选择方法\(Tang et al.,2024 (https://arxiv.org/html/2608.04405#bib.bib29)\)在每个解码步骤利用当前查询派生的启发式规则动态识别显著的 token 子集。然而,这些技术往往会导致性能下降,因为与查询无关的驱逐可能移除相关证据,而启发式的显著性估计可能无法与真实的注意力亲和力对齐。

参考图注\(a\) 参考图注\(b\) 参考图注\(c\)  
图2:不同哈希方法的示意图。\(a\) 带随机投影的局部敏感哈希\(Chen et al.,2025 (https://arxiv.org/html/2608.04405#bib.bib7)\);\(b\) 带训练映射的学习式哈希\(Li et al.,2025 (https://arxiv.org/html/2608.04405#bib.bib21)\);\(c\) BinaryPC 与二元主方向。

近年来,基于哈希的稀疏注意力(如 MagicPIG\(Chen et al.,2025 (https://arxiv.org/html/2608.04405#bib.bib7)\)和

相似文章

MiniMax 稀疏注意力

Hugging Face Daily Papers

MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。

基于压缩内容选择的无参数自适应稀疏注意力

arXiv cs.LG

本文提出了一种无参数的自适应稀疏注意力方法,利用gzip压缩比动态选择非冗余块进行长程注意力,在PG-19语言建模上相较于固定和学习的稀疏注意力基线取得了显著的困惑度提升。