SymbolicLight V2:混合神经形态架构与稀疏执行实现低能耗语言推理
摘要
SymbolicLight V2 是一种混合神经形态语言架构,结合稀疏事件计算和连续状态处理以实现低能耗推理,其在 FPGA 和 ARM 上的实现展示了显著的节能和吞吐量提升。
arXiv:2609.09772v1 公告类型:新
摘要:SymbolicLight V2 在混合神经形态语言架构中结合了稀疏事件计算和连续状态处理。扩展 V1 的脉冲门控双路径,它在进一步投影中增加了分级有符号事件和无 Softmax 的局部注意力。我们使用数字定点算术在 Alveo U50C FPGA 上实现了 194M 参数模型,并在 ARM CPU 上使用稀疏整数执行。在三个相同检查点的 175 MHz FPGA 实现中,活跃行权重收集和有效状态 KV 加载将解码吞吐量从 474.6 提高到 643.2 令牌/秒,适用于 32 个令牌前缀和 128 个输出。估计的总卡能耗从每生成令牌 0.06087 J 降低到 0.04407 J,减少了 27.6%。完整请求能耗(包括预填充)在三个前缀长度上下降了 24.4-27.7%。一个独立的空闲分割将 82.8% 的总卡能耗归因于负载空闲,解释了较短令牌延迟的好处。与记录的 RTX 5090 编译 FP32 基线相比,整数 FPGA 执行在短上下文解码期间使用了少 89.1% 的估计卡能耗;算术精度不同,并且 GPU 基线并非测试中能耗最低的配置。在 ROCK 5T 的四个 Cortex-A76 核心上,完整请求在适配器的交流输入下达到 65.4 令牌/秒,功耗为 9.80 W,每生成令牌能耗为 0.151 J。这些结果将事件稀疏性与省略的计算和数据移动联系起来。这些机制也支持其他专用 V2 实现:通过大于有功功率的因子增加吞吐量会降低每生成令牌的能耗。评估保持部署的检查点固定;其质量落后于相同预算的密集控制,因此结果并未确立等质量效率。
查看缓存全文
缓存时间: 2026/09/10 08:14
# SymbolicLight V2:用于低能耗语言推理的混合神经形态架构与稀疏执行 来源:https://arxiv.org/html/2609.09772 Ting Liu 所属机构:SymbolicLight Research 所在地:中国,广东,佛山 电子邮件:[[email protected]](mailto:[email protected]) 2026年9月7日 ###### 摘要 事件驱动的语言推理在执行系统将零激活转换为省略计算和内存访问时,能够节省能源。我们提出了 SymbolicLight V2,这是一种混合神经形态语言架构,结合了稀疏事件计算和连续状态处理。V2 扩展了 V1 的脉冲门控双路径设计,在额外的投影中加入带符号的分级事件,并采用无 Softmax 的局部注意力。Alveo U50C 现场可编程门阵列(FPGA)实现了一个包含 1.94 亿参数模型的端到端数字定点推理原型,同时还有一个稀疏整数 ARM 实现。在 175 MHz 频率下运行的三个相同检查点 FPGA 实现中,活动行权重收集和有效状态键/值(KV)缓存加载将连续解码吞吐量从 474.6 令牌/秒提升至 643.2 令牌/秒(针对 32 个令牌前缀和 128 个生成令牌),同时将估计的总卡能耗从每个生成令牌 0.06087 焦耳降低至 0.04407 焦耳(降低 27.6%)。完整请求能耗(包括预填充)在三个测试的前缀长度上下降了 24.4%–27.7%。独立的空闲分割测量表明,总卡能耗的 82.8% 归因于加载空闲份额,这解释了缩短令牌延迟对节能的价值。与记录的 RTX 5090 编译 32 位浮点(FP32)基线相比,整数 FPGA 部署在短上下文解码期间使用了少 89.1% 的估计卡能耗;该比较使用了不同的算术精度,并且未使用测试的最低能耗 GPU 配置。在 ROCK 5T 的四个 Cortex-A76 核心上,完整请求达到 65.4 个生成令牌/秒,功耗为 9.80 瓦,适配器交流输入端的能耗为 0.151 焦耳/令牌。结果展示了混合神经形态语言架构的稀疏执行如何通过事件感知计算和数据移动降低测量到的推理成本。这些机制也为其他专用 V2 实现提供了设计基础:通过比有功功耗变化更大的倍数提高吞吐量,从而降低每个生成令牌的能耗。评估固定了部署的检查点,其质量落后于相同预算的密集控制;它并未建立同等质量下的效率标准。 关键词:混合神经形态语言架构;事件驱动计算;FPGA;稀疏整数执行;每个生成令牌的能耗。 ## 1 引言 当执行系统避免相应的算术和内存流量时,激活稀疏性可以降低推理能耗。SymbolicLight V1 结合了二进制 Leaky Integrate-and-Fire(LIF)动力学、连续残差流和双路径时间混合器(Liu, 2026b (https://arxiv.org/html/2609.09772#bib.bib8))。一个循环衰减路径维护时间状态,而局部注意力访问最近的上下文。V1 明确采用了混合设计,将离散脉冲和连续内部动力学的结合作为生物学动机。尽管该模型以稀疏激活进行训练,但其密集的 GPU 实现为那些零激活本可以消除的工作付出了代价。V2 将这一谱系发展为一种具有可执行稀疏性的混合神经形态语言架构。此处,混合神经形态指稀疏事件计算与连续值状态处理的协作:事件选择投影贡献,而循环状态和连续残差承载时间和特征信息。原型使用数字定点算术实现了这两者。V2 将事件编码扩展到前馈上投影和查询/键/值(Q/K/V)输入,再次将投影向量事件化,并使用 ReLU–L1 局部注意力与线性位置偏置。其部署将非零事件转化为选定的权重行访问:ARM 循环跳过零输入贡献,而 FPGA 仅从驻留的高带宽存储器(HBM)收集所需的行。主要实验在保持训练检查点固定的同时改进 FPGA 执行。用活动行收集取代密集权重枚举,然后仅加载有效的键/值(KV)缓存状态,使 p32/n128 连续解码吞吐量提高了 35.5%,并将估计的总卡能耗降低了 27.6%。此处 p32/n128 表示 32 个令牌的前缀后跟 128 个生成的令牌。包括提示摄取在内,能量在三个测试的前缀长度上下降了 24.4%–27.7%。这些是在连续实现中测量到的变化;该实验并未分离每一个硬件更改或热效应。结果还解释了延迟对能耗的重要性。稀疏投影暴露了先前与计算重叠的 KV 加载等待。减少不必要的状态转移恢复了部分执行优势。此处,“加载空闲”指模型权重保留在设备内存中,但没有推理正在运行。在独立的测量中,加载空闲功耗占 FPGA 每个令牌总能耗的 82.8%。因此,即使增量能量变化很小,更快的生成也会减少分配给每个输出的平台能量。两个部署比较将这些结果置于背景中。与记录的 RTX 5090 编译 FP32 基线相比,短上下文整数 FPGA 解码使用了少 89.1% 的估计卡能耗,并在比较时说明了精度和传感器边界。在四个 Cortex-A76 核心上,相同的整数模型以 65.4 个生成令牌/秒的速度完成短请求,在板卡适配器交流输入端的能耗为 0.151 焦耳/令牌。同一板卡上六个 CPU 和神经处理单元(NPU)部署的比较显示了这种边缘部署如何在输入长度增长时权衡吞吐量和能耗。 本文做出三项贡献: 1. 1\. 混合神经形态架构与稀疏执行。源自 V1 的双路径结合了扩展的分级事件投影与连续状态处理,映射到 ARM 上实际的非零输入整数计算和 FPGA 上的活动行权重收集(第 2 (https://arxiv.org/html/2609.09772#S2) 和 3 (https://arxiv.org/html/2609.09772#S3) 节)。 2. 2\. 相同检查点的能耗降低。测量到的 FPGA 实现演进,将选择性权重访问和有效状态 KV 加载与更高吞吐量和更低总能耗联系起来,并包含独立的空闲份额分解(第 5 (https://arxiv.org/html/2609.09772#S5) 节)。 3. 3\. 跨平台部署证据。完整的请求级 ARM 交流测量、FPGA/GPU 卡传感器比较,以及明确的测试工作量和测量边界,并由整数参考验证支持(第 4 (https://arxiv.org/html/2609.09772#S4) 和 5 (https://arxiv.org/html/2609.09772#S5) 节)。 评估侧重于固定检查点的执行。模型质量诊断在第 6 节 (https://arxiv.org/html/2609.09772#S6) 总结,并在附录 A (https://arxiv.org/html/2609.09772#A1) 中报告。 ## 2 从 V1 到 V2 混合神经形态架构 ### 2.1 V1 起点 V1 的两条路径在每个块内运行:一个一阶衰减状态和局部注意力,结合一个连续残差流和一个前馈子层。二进制脉冲输入馈入衰减投影和前馈下投影;LIF 输入编码器和后续块内的无状态阈值操作具有不同的作用。相比之下,Q/K/V 和前馈上投影消耗连续输入。因此,在原始脉冲位置的零激活导致图中其他地方大量的密集计算。逐元素活动也不能作为令牌级注意力掩码。V1 测量到一个几乎始终处于活动状态的位置掩码:减少活动元素的数量并未移除整个键。其发布的实现在应用局部掩码之前计算密集注意力分数,并且缓存解码保留了所有历史 K/V 条目。因此,可见的局部窗口并未限制实际计算,元素级稀疏性也未按比例减少注意力工作量。因此,V2 作用于投影输入和注意力算术内部,而不是仅在令牌的所有元素为零时才将其视为不活动。 ### 2.2 投影输入处的分级带符号事件 设 x 为呈现给事件编码器的激活,具有正阈值 θ 和正整数幅度界限 L。硬前向事件为 \( e_{\theta}(x) = \mathbf{1}[\|x\| \geq \theta] \, \operatorname{clip}\!\left(\operatorname{round}(x/\theta), -L, L\right) \)。(1) 此处 \(\operatorname{round}\) 将结果舍入到最接近的整数(平局时舍入到偶数),\(\operatorname{clip}\) 将结果限制在 \([-L, L]\) 范围内,\(\mathbf{1}\) 是指示函数。零值表示无事件;非零整数同时携带符号和幅度。训练使用直通估计器,具有替代输入导数 \(\widehat{\partial e_{\theta}/\partial x} = 1/\theta\),包括硬前向函数的静默和饱和区域。这遵循了脉冲网络中替代导数的广泛使用(Neftci et al., 2019 (https://arxiv.org/html/2609.09772#bib.bib9))。V2 在每个块的前馈上投影输入和 Q/K/V 投影输入处添加了这些编码器。其选定配置使注意力输出投影输入保持连续。从 V1 继承的消耗二进制脉冲的衰减和前馈下投影保持不变。数学事件字母表和部署有效负载宽度是不同的。训练配置允许 L=255,其有符号范围比有符号 INT8 更宽。硬件表示使用带有指定量化和饱和语义的有符号 8 位有效负载。因此,硬件正确性声明是基于整数部署参考做出的,而不是假设整个训练事件字母表都适合 INT8。 使用列向量,令 \( e \in \mathbb{R}^{d_{\rm in}}, y \in \mathbb{R}^{d_{\rm out}} \), 和 \( W \in \mathbb{R}^{d_{\rm out} \times d_{\rm in}} \)。一个消耗事件的投影为 \( y = We = \sum_{j \in \mathcal{A}(e)} e_j W_{:, j}, \quad \mathcal{A}(e) = \{j: e_j \neq 0\} \)。(2) 活动集合 \(\mathcal{A}(e)\) 选择数学矩阵 \(W\) 的列。硬件按输入索引存储 \(W^{\mathsf{T}}\),因此这些列对应于存储的权重行;零事件不需要行获取。由于非零事件具有分级振幅,它们的执行通常仍然需要整数乘加(MAC)操作。节省来自于省略的贡献和权重移动,而不是将每个事件视为仅加法的二进制脉冲。 ### 2.3 事件注意力和保留的双路径 衰减路径保留循环时间状态。对于层 \(\ell\) 和二进制输入 \(s_{\ell,t}\),向量 \(\alpha_{\ell}\) 包含每个头一个学习到的 sigmoid 参数化衰减系数,广播到该头的所有通道。操作符 \(\odot\) 表示逐元素乘法,新会话从零状态开始。其循环为 \( z_{\ell,t} = W_T s_{\ell,t}, \quad h_{\ell,t} = \alpha_{\ell} \odot h_{\ell,t-1} + (1 - \alpha_{\ell}) \odot z_{\ell,t} \)。(3) 注意力路径提供对最近令牌和固定全局锚点的内容相关访问。在 V2 中,投影后的 Q/K/V 向量被第二次事件化。选定的事件注意力路径使用来自线性偏置注意力(ALiBi)(Press et al., 2022 (https://arxiv.org/html/2609.09772#bib.bib11))的每个头距离惩罚,代替旋转变换,避免旋转离散事件向量。使用基于零的位置和最大回溯距离 \(w\),可见集为 \( \mathcal{K}_{i} = \{j \in \mathbb{Z}: 0 \leq j \leq i, i - j \leq w \ \text{或}\ j < 4\} \)。对于头 \(h\),令 \( \bar{q}_{i}^{(h)}, \bar{k}_{j}^{(h)}, \bar{v}_{j}^{(h)} \in \mathbb{R}^{d_h} \) 为投影后的事件向量。训练级注意力定义为 \( s_{ij}^{(h)} = \frac{(\bar{q}_{i}^{(h)})^{\mathsf{T}} \bar{k}_{j}^{(h)}}{\sqrt{d_h}} - m_h (i - j), \quad j \in \mathcal{K}_{i} \)。(4) \( a_{ij}^{(h)} = \frac{\max(0, s_{ij}^{(h)})}{\sum_{k \in \mathcal{K}_i} \max(0, s_{ik}^{(h)}) + \epsilon}, \quad o_i^{(h)} = \sum_{j \in \mathcal{K}_i} a_{ij}^{(h)} \bar{v}_j^{(h)} \)。(5) 模型有 \( n_{\rm heads} = 12 \) 个头,维度 \( d_h = 64 \),斜率 \( m_h = 2^{-8(h+1)/n_{\rm heads}} \)(对于 \( h = 0, \ldots, n_{\rm heads} - 1 \)),和 \( \epsilon = 10^{-6} \)。四个锚点是前四个序列位置,受因果掩码约束。在 \(\mathcal{K}_{i}\) 之外的位置获得零注意力权重;如果所有允许的分数都非正,则注意力输出为零。ReLU–L1 归一化消除了指数运算,而缩放、累加和输出投影仍保留在执行预算中。FPGA 使用确定性整数算术实现这些操作:其零和分支返回零,正和使用指定的整数除法和舍入,而不是评估训练时的 \(\epsilon\) 表达式。 令 \(o\) 拼接头输出 \(o_i^{(h)}\),\(g\) 为层门控,\(c\) 为连续块输入。省略丢弃率和层/位置索引,融合和前馈路径为 \( u = \operatorname{LN}_1\!\left(c + W_O[g \, o + (1 - g) h]\right) \),(6) \( c' = \operatorname{LN}_2\!\left(u + W_{\rm down} H(W_{\rm up} e_{\theta}(u) - \tau)\right), \quad s' = H(c' - \tau) \)。(7) 此处 \(\operatorname{LN}\) 表示层归一化,\(H\) 是单位阶跃函数,其中 \(H(0) = 1\),\(\tau\) 是脉冲阈值,\(g = \sigma(\gamma_{\ell})\) 是每层一个学习到的标量门控。阈值操作在训练中使用替代梯度;它们不是额外的有状态 LIF 神经元。最终的词汇表投影和上下文条件解码头仍然是完整图的一部分。图 1 (https://arxiv.org/html/2609.09772#S2.F1) 描绘了一个块:公式 (3 (https://arxiv.org/html/2609.09772#S2.E3))–(7 (https://arxiv.org/html/2609.09772#S2.E7)) 保留了 V1 的两条时间路径和连续残差传输,同时添加了事件编码的投影输入和事件注意力。进入衰减投影的二进制脉冲 \(s\) 来自前一个块的阈值输出 \(s'\),或来自第一个块中的 LIF 输入编码器。\(c \xrightarrow{e_\theta} \xrightarrow{W_Q W_K W_V} \xrightarrow{e_\theta} \xrightarrow{\text{ReLU–L1注意力}} \xrightarrow{\text{线性位置偏置} + \text{局部窗口} + \text{4个锚点}} s \xrightarrow{W_T} \text{衰减状态 } h \xrightarrow{\alpha_{\ell} \text{ (每头)}} \xrightarrow{\text{来自前一块的二进制脉冲}} g o + (1 - g) h \xrightarrow{W_O} \xrightarrow{+} \xrightarrow{\operatorname{LN}_1} \xrightarrow{e_\theta} \xrightarrow{W_{\rm up}} \)
相似文章
神经形态扩散语言模型:通过稀疏性和块去噪解决计算与内存瓶颈
提出神经形态掩码扩散语言模型(N-MDLMs),该模型将块扩散与基于尖峰的神经形态计算相结合,通过利用稀疏性和每次参数访问生成多个token来提高吞吐量和能效,并通过类屋顶线模型进行分析。
面向量化模拟回写与可解释程序执行的符号神经CPU
本文提出了一种迹监督的符号神经CPU架构,结合循环控制、显式操作路由器和掩码寄存器回写,实现了可审计、可解释的程序执行,并通过量化模拟回写保留了符号操作路径。
TokenSpeed:面向智能体工作负载的"光速"LLM推理引擎(5分钟阅读)
Lightseek发布TokenSpeed,一款面向智能体工作负载优化的高性能LLM推理引擎,采用编译器驱动的并行技术和先进的内核优化,相关技术已被vLLM采纳。
类脑硬件为AI系统带来更快、更低功耗的异常检测
一种新的类脑硬件设计借鉴神经形态计算原理,使AI系统能够更快、更节能地进行异常检测。
低延迟激活正则化稀疏神经算子与蒸馏辅助实现的实时边缘部署虚拟感知
本文提出了一种Sparse-Activation-ReLU (SAR)层,用于低延迟、高能效的虚拟感知,在延迟-误差-能效指标上实现了显著提升,并通过合成知识蒸馏降低了误差。