RIS-Kernel:一种通过稀疏注意力实现长上下文LLM推理的模型无关架构
摘要
RIS-Kernel 提出了一种模型无关的稀疏注意力架构(RIS),将长上下文 LLM 推理中的自注意力复杂度从 O(N^2) 降低到 O(N log N),使得无需 GPU 加速即可在普通 CPU 硬件上运行。
查看缓存全文
缓存时间: 2026/07/27 07:43
# RIS-Kernel: 通过稀疏注意力实现长上下文LLM推理的模型无关架构 来源: https://arxiv.org/html/2607.21927 \[1\]\\fnmAnderson R\.\\surSantos \[1\]\\orgdiv计算机学院,\\orgname联邦大学乌贝兰迪亚分校 (UFU),\\country巴西 ###### 摘要 大型语言模型中的全自注意力计算复杂度为O\(N^2\),这限制了长上下文文档分析只能处理65,536个标记,且需要昂贵的GPU集群。简化交互采样(Reduced Interaction Sampling, RIS)推理引擎作为一种模型无关架构,解决了这一约束。在不修改权重的情况下,RIS利用稀疏随机几何结构将自注意力复杂度降低至O\(N\log N\),使其能适配普通内存限制。我们在Qwen2-1.5B-Instruct上对RIS进行了两种场景的验证。在32,768标记的控制评估中(原生密集注意力作为上界),RIS-Stochastic模式在1%密度和70个集成种子的条件下达到75.00%的准确率,超过了原生密集基线(71.88%);而RIS-Stochastic在5%密度和10个种子的条件下与之持平(71.88%)。这表明稀疏注意力起到了正则化作用:低密度(1%)结合多个种子能过滤序列级噪声,而较高密度(5%)则重新引入了干扰噪声。在预算最紧张的情况下,RIS-Structural模式在1%密度和仅10个种子的条件下达到68.75%的准确率,恢复了相对于零上下文基线(59.38%)75%的上下文差距。在65,536标记时,密集注意力会触发内存不足错误,而RIS相比零上下文基线(51.56%)获得了高达14.06个百分点的检索增益,经McNemar配对检验确认具有边际显著性(p=0.078<0.10)。所有评估均在普通、未加速的CPU服务器(16–128 GB RAM)上运行,证明长上下文LLM推理可在无GPU加速的标准学术硬件上实现。 ###### 关键词: 推理引擎,稀疏注意力,长上下文推理,检索增强生成,旋转位置嵌入 ## 1 引言 通过大型语言模型处理大规模文档语料库需要硬件基础设施,而只有少数研究团队具备这种条件\[1 (https://arxiv.org/html/2607.21927#bib.bib1)\]。全自注意力的计算复杂度为O\(N^2\)\[2 (https://arxiv.org/html/2607.21927#bib.bib2)\]。在65,536个标记时,推理成本将深层文本分析限制在拥有大型GPU集群的机构中。瓶颈在于算法;其实际后果是对大多数团队无法满足的硬件资本的依赖。 在基础工作\[3 (https://arxiv.org/html/2607.21927#bib.bib3)\]中,我们奠定了简化交互采样(RIS)的理论基础,从数学上证明了可以通过随机稀疏化\[4 (https://arxiv.org/html/2607.21927#bib.bib4),5 (https://arxiv.org/html/2607.21927#bib.bib5)\]绕过O\(N^2\)注意力瓶颈,同时保持事实检索能力。本文在LLM推理下对此机制进行了实证验证。将这一理论转化为可用的推理引擎需要解决三个工程问题:(1) 在O\(N^2\)空间中利用轻量级布尔结构生成稀疏几何掩码,以避免分配过程中的内存不足错误;(2) 在不稀释随机标记片段竞争权重的情况下对其进行归一化;(3) 防止位置编码在窗口扩展远超原生训练限制时崩溃。本文描述了RIS-Kernel架构,这是一种系统级实现,通过两种采样机制直接将运行时稀疏性注入未经修改的语言模型\[6 (https://arxiv.org/html/2607.21927#bib.bib6)\]:随机模式(Stochastic Mode)用于全局覆盖,结构模式(Structural Mode)用于局部社区保持。 验证重点放在Qwen2-1.5B-Instruct\[7 (https://arxiv.org/html/2607.21927#bib.bib7)\]和TinyLlama-1.1B\[8 (https://arxiv.org/html/2607.21927#bib.bib8)\]上。小于2B参数的模型定义了长上下文事实检索的最严格场景:足够紧凑以在无GPU加速的CPU硬件上运行,但又具有足够的架构完整性以对推理时提供的上下文做出有意义的响应。 事实准确性需要推理时的上下文传递\[9 (https://arxiv.org/html/2607.21927#bib.bib9),10 (https://arxiv.org/html/2607.21927#bib.bib10)\]。RIS使得这在未加速的CPU硬件上成为可能。将注意力时间复杂度降低至O\(N\log N\)允许高内存CPU服务器处理\[11 (https://arxiv.org/html/2607.21927#bib.bib11)\]65k标记的上下文,消除了对深层文档检索中硬件加速器的依赖。 ## 2 结果 ### 2.1 硬件性能分析与可重复性基线 实验在两台未加速的CPU服务器上进行,无GPU支持。64k可扩展性基准测试(第2.2.2节 (https://arxiv.org/html/2607.21927#S2.SS2.SSS2))运行在高内存Xeon工作站上(ibteci:2个插槽,20个物理核心/40个总线程,128 GB DDR4)。主要的32k控制评估(第2.2.1节 (https://arxiv.org/html/2607.21927#S2.SS2.SSS1))——包括完整的密集O\(N^2\)基线和所有RIS超参数扫描——大部分在桌面级服务器上执行(bioinfo:Intel Core i7-3770,4个物理核心/8个线程,16 GB DDR4),代表了重新用作机构计算节点的标准消费级硬件。由于桌面级bioinfo服务器出现内存不足错误,部分极端密度配置在ibteci服务器上执行。稀疏结构与硬件无关,因此此处报告的所有结果可直接应用于延迟更低的GPU加速部署。 CPU\[12 (https://arxiv.org/html/2607.21927#bib.bib12),13 (https://arxiv.org/html/2607.21927#bib.bib13)\]上的主要瓶颈是L3缓存饱和。对于65k标记序列,matmul_qk(分数计算)耗时约19秒;matmul_av(值聚合)耗时350秒。18倍的差距反映了从DDR到缓存的数据移动成本\[14 (https://arxiv.org/html/2607.21927#bib.bib14)\],而非算术运算。在缺乏原生AVX-512 BF16的CPU上进行Float16模拟\[15 (https://arxiv.org/html/2607.21927#bib.bib15)\]将单个优化步骤时间推至60小时以上;Float32恢复了可预测的运行时间。在40个种子的RIS集成配置下,标准的65k标记预填充大约占用38 GB。更大的集成配置接近128 GB物理上限,从而限制了超参数扫描范围。线程数纪律是一个硬约束:不受约束的PyTorch调度(101个线程)使内存总线饱和\[13 (https://arxiv.org/html/2607.21927#bib.bib13)\],并将预填充时间延长了6倍。线程分配被限制在物理核心边界附近——4核bioinfo服务器上4个线程,多插槽ibteci服务器上8个线程——从而恢复了最佳吞吐量。 ### 2.2 实证评估 定量基准测试的评估上下文通过拼接四篇涵盖不同生物学领域的科学手稿构建:Acetilactobacillus jinshanensis (ajinshanensis)的基因组表征、厌氧海洋甲烷氧化 (aom)、蛋白质-蛋白质相互作用网络预测 (genppi) 以及Jatai蜜蜂幼虫食物宏基因组学 (meta)。在拼接之前,删除所有引言之前的元数据、标题页、关键词和摘要。 #### 2.2.1 实验A:受控精度比较(32k窗口) 在Qwen2的原生位置限制32,768个标记下,全密集注意力在计算上是可行的,并作为真实上界。使用平衡的32题集,零上下文基线(w=0)为59.38%,原生密集目标为71.88%,差距为12.5个百分点。本实验旨在测量RIS-Kernel恢复了多少差距。 表5 (https://arxiv.org/html/2607.21927#Ax1.T5)汇总了随机模式和结构模式在注意力密度(1%、2%、5%)和集成种子数(1到100)网格上的准确率和上下文恢复率。 RIS-Stochastic模式在1%密度和70–80个种子的条件下达到75.00%的准确率,超过了原生密集基线71.88%,取得了125.0%的上下文恢复率。在这种极端稀疏水平下,通过稀疏化剪枝的噪声超过了丢失的信息:集成充当了注意力正则化器。RIS-Stochastic还在多个密度-种子空间点精确匹配了密集基线(71.88%,100%恢复):1%密度下60、90和100个种子;2%密度下40、50和70个种子;以及5%密度下10个种子。 在低密度下,结构模式以更少的种子收敛到密集基线。在1%密度下,它需要40个种子达到71.88%,而随机模式需要60个。在2%密度下,交叉点为30对40个种子。在最严格的预算下——1%密度和10个种子——RIS-Structural恢复了75.0%的上下文差距(68.75%准确率),而随机模式需要50个种子才能达到。块团几何结构优先捕获了低密度下均匀随机采样遗漏的远端锚点。图1 (https://arxiv.org/html/2607.21927#S2.F1)–3 (https://arxiv.org/html/2607.21927#S2.F3)详细展示了这些结果。 参见说明图1:平衡32k窗口下RIS的性能曲面,(a) RIS-Stochastic模式和(b) RIS-Structural模式。蓝色边框的单元格匹配或超过了原生密集基线71.88%(完全恢复上下文信息的种子/密度配置)。虚线边框显示优于零上下文基线59.38%的配置。标记星号(*)的单元格表示由于桌面级bioinfo服务器内存不足错误而在高内存ibteci服务器上执行的配置。参见说明图2:平衡32k窗口下的集成扩展和上下文恢复率。左y轴显示绝对准确率;右y轴显示相对于w=0基线恢复的全注意力差距百分比。在Stochastic 5%(10个种子)下,RIS架构精确匹配原生密集目标(71.88%)。在Structural 1%(10个种子)下,模型在100倍计算稀疏度下恢复了75%的上下文差距。参见说明图3:平衡32k窗口下不同注意力密度(1%、2%、5%)各采样模式的峰值准确率比较。水平参考线表示零上下文基线(59.38%)和全注意力原生密集目标(71.88%)。两种模式都随着密度增加收敛到密集目标;当密度为1%时,结构模式在显著更低的种子数下达到该收敛。 #### 2.2.2 实验B:可扩展性与外推(64k窗口) 在65,536个标记(超出Qwen2原生限制的2倍外推)下,标准Xeon测试平台上原生密集基线因内存需求而被物理禁止,产生内存不足错误。可扩展性使用扩展的64题集进行评估,零上下文基数为51.56%。 结果根据RoPE缩放方法(第2.3节 (https://arxiv.org/html/2607.21927#S2.SS3)详述)出现明显分歧。在线性插值下,单一种子在1%密度下准确率骤降至15.6%,在5%密度下降至23.4%——处于或低于五项选择任务20%的随机猜测水平。接收包含答案原文的64,000标记上下文的模型仍然表现得像没有上下文一样:线性插值不仅降低了…… 注意:由于原文在“线性插值不仅降低了”处似乎被截断,根据上下文推测应为“线性插值不仅降低了位置编码的质量,还导致认知崩溃”。但原文在超链接之后立即结束,故按原文处理。 随机集成通过集成覆盖部分补偿:在5%密度和40个种子下,准确率恢复至59.4%,高于零上下文基线。 在YaRN缩放下,位置几何得以保留,RIS-Kernel在配置网格上可扩展。在1%密度和40个种子下,准确率达到57.8%(图4 (https://arxiv.org/html/2607.21927#S2.F4))。YaRN下所有密度的完整比较结果见第2.3节 (https://arxiv.org/html/2607.21927#S2.SS3)。低于1%的最佳点分析(第2.7节 (https://arxiv.org/html/2607.21927#S2.SS7))进一步描述了结构模式在极端稀疏下的效率前沿,确认62.50%代表了该基准协议下该上下文长度的模型检索容量上限。 参见说明图4:65,536标记下(Qwen2-1.5B, YaRN)(a) RIS-Stochastic和(b) RIS-Structural模式的性能曲面比较。准确率表示为集成种子数和采样密度的函数。零上下文基线:51.56%。 #### 2.2.3 集成覆盖分析 两种模式的集成扩展曲线都是凹形的。这种凹性由集成键值缓存的总上下文覆盖份额决定,定义为每个种子选择的稀疏索引的并集。对于N个独立种子,注意力密度为d,并集覆盖份额U由下式给出: U = 1 - (1-d)^N (1) 公式1 (https://arxiv.org/html/2607.21927#S2.E1)解释了为什么更高的注意力密度会降低检索性能。在32k标记的RIS-Stochastic下,密度d=0.01,集成N=70个种子,产生U≈50.5%:足以检索目标锚点标记,同时剪枝大约一半的序列级干扰项,从而使模型超过密集基线(75.00%对71.88%)。在d=0.05且相同种子预算(N=70)下,U≈97.2%——几乎是密集注意力,它重新引入了序列级噪声并稀释了锚点标记的权重,将准确率限制在密集基线71.88%。超过此阈值,额外的种子积累冗余索引条目和噪声,触发边际性能下降(图5 (https://arxiv.org/html/2607.21927#S2.F5))。两种模式都遵循此模式,尽管结构模式在高种子区域保持更稳定的轨迹:共享的结构团簇抑制了每个额外种子增加的边际噪声,而随机模式则完全依赖于独立的全局抽取。 参见说明图5:集成扩展定律比较:64k标记、YaRN缩放、5%密度下准确率作为集成种子数(N)的函数。随机模式和结构模式都在40–60个种子处趋于平稳,然后噪声积累导致饱和。 ### 2.3 RoPE缩放:线性插值与YaRN 位置编码在65,536个标记下的正确行为限制了RIS检索机制。RIS独立于位置嵌入方案构建稀疏注意力几何结构;然而,由于位置编码的键值对输入注意力计算,降级的位置编码限制了随机几何结构将注意力有效路由到相关标记的能力。表1 (https://arxiv.org/html/2607.21927#S2.T1)汇总了Qwen2-1.5B在两种条件下所有测试密度的完整结果。 ### 2.4 线性插值:位置稀释与认知崩溃 线性位置插值通过外推因子(此处Qwen2的64k为2倍)均匀压缩位置编码空间。模型从未被训练来解释这些压缩编码;位置线索变得不可靠,模型失去了区分近处与远处标记的能力。 实证后果是严重的。在64k下使用单一种子,线性插值产生: - 1%密度下15.6%准确率 - 2%密度下20.3%准确率 - 5%密度下23.4%准确率 这些值处于或低于五项选择任务20%的随机底线。一个接收包含答案原文的64,000标记上下文的模型,其行为仍然像没有上下文一样:线性插值不仅降低了……
相似文章
CoSA: 通过代理-内核协同设计的稀疏注意力加速长上下文推理
CoSA 提出了一种无需训练的稀疏注意力方法,该方法协同设计了内核感知代理和有序跳过内核,以加速长上下文推理,实现了高达 4.93 倍的注意力加速和 2.53 倍的端到端 TTFT 降低,且性能下降可忽略不计。
MISA:用于长上下文大语言模型推理的索引器混合稀疏注意力机制
本文介绍了 MISA,这是一种将混合专家(MoE)方法应用于稀疏注意力机制中索引器头部的技术,在保持性能的同时显著降低了长上下文大语言模型推理的计算成本。
SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力
SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。
推理时上下文稀疏性:幻象还是机遇?
本文认为,极端的上下文稀疏性是LLM推理的一个有原则且可行的基础,展示了当前模型能够容忍高达100倍的稀疏性而无质量损失,并且稀疏解码内核可以在现有硬件上将处理速度提升10倍。
MiniMax 稀疏注意力
MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。