Bern2Edge:通过伯恩斯坦多项式网络进行边缘部署的神经符号编译器
摘要
Bern2Edge是一种神经符号编译器,能将预训练神经网络转换为伯恩斯坦多项式表示,以在FPGA上实现高效且可解释的边缘部署,显著降低延迟和资源使用,同时保持准确性。
arXiv:2608.20497v1 公告类型:新
摘要:在资源受限的边缘设备上部署高精度神经网络仍然具有挑战性,因为现有方法将训练、压缩和硬件综合视为独立阶段,导致软件训练模型与高效端到端部署之间存在差距,且对可解释性的支持有限。我们提出了Bern2Edge,一个端到端框架,利用知识蒸馏将预训练的教师前馈网络通过伯恩斯坦多项式激活转换为硬件高效的表示。这种表示支持两种部署路径:(i) 高保真基于LUT的实现,在压缩下保持模型保真度;(ii) 基于符号规则的表示,从伯恩斯坦激活几何导出,实现可解释的推理,并具有明确的输入空间约束。由此产生的BNNs在相同压缩约束下,比ReLU的准确率提高了最多2.12个百分点(pp)。在系统层面,Bern2Edge在AMD Xilinx KV260 FPGA上,相对于W8A8量化教师网络,延迟降低最多99.8%,BRAM减少最多95.2%,同时准确性保持在0.5 pp以内,并进一步部署在低功耗Spartan-7 XC7S15 FPGA上。基于规则的路径将DSP使用量减少最多89.0%,但总准确性损失1.5 pp。
查看缓存全文
缓存时间: 2026/08/24 04:30
# 基于伯恩斯坦多项式网络实现边缘部署的神经符号编译器
来源:https://arxiv.org/html/2608.20497
## Bern2Edge:通过伯恩斯坦多项式网络实现边缘部署的神经符号编译器
**致谢**
代码仓库地址:
https://github.com/PervasiveAutonomyLab/Bern2Edge\.
归档于
https://zenodo.org/records/21726441\.
PubID:pubid:
© 2026 IEEE。允许个人使用本材料。所有其他用途(包括在任何当前或未来媒体中转载/重新发布本材料用于广告或促销目的、创建新的汇编作品、转售或再分发至服务器或列表,或在其他作品中重用本作品的任何受版权保护的组件)必须获得IEEE许可。
一帆·张 / 扬瑟·舒克里 / 索涛·黄 / 萨尔马·马拉基
**致谢**
所有作者均隶属于美国加利福尼亚州欧文市加州大学欧文分校电气工程与计算机科学系,邮编92697(电子邮箱:mgamalel@uci\.edu;yifanz58@uci\.edu;yshoukry@uci\.edu;sitaoh@uci\.edu;selmalak@uci\.edu)。
###### 摘要
在资源受限的边缘设备上部署高精度神经网络仍然具有挑战性,因为现有方法将训练、压缩和硬件综合视为独立阶段,在软件训练的模型与高效端到端部署之间留下了鸿沟,且对可解释性的支持有限。我们提出**Bern2Edge**,这是一个端到端框架,利用知识蒸馏将预训练的教师前馈网络通过伯恩斯坦多项式激活转换为硬件高效的表示。这种表示支持两种部署路径:(i)基于查找表(LUT)的高保真实现,在压缩下保持模型保真度;(ii)基于伯恩斯坦激活几何结构推导的符号规则表示,支持具有显式输入空间约束的可解释推理。生成的伯恩斯坦神经网络(BNN)在相同的压缩约束下,相比ReLU实现了高达2.12个百分点(pp)的精度提升。在系统层面,在AMD Xilinx KV260 FPGA上,**Bern2Edge**相对于W8A8量化教师网络实现了高达99.8%的延迟降低和95.2%的BRAM减少,同时保持精度在0.5pp以内,并可进一步部署在低功耗Spartan-7 XC7S15 FPGA上。基于规则的路径以1.5pp的总体精度损失为代价,将DSP使用量降低了高达89.0%。
###### 索引词:伯恩斯坦多项式、激活函数、知识蒸馏、查找表、FPGA推理、符号规则提取、边缘机器学习。
## I 引言
深度神经网络(DNN)的快速发展推动了预测性能的显著提升,但使其在资源受限的边缘设备上部署变得日益困难。网络通常在软件中训练,未考虑硬件约束,导致模型难以映射到严格的延迟和资源预算中,而有限的可解释性进一步限制了其在透明度和可靠性至关重要的边缘场景中的应用。连接高层模型设计与高效的硬件实现仍然是一个关键挑战,因为现有方法将模型设计和硬件优化分开处理,限制了其同时满足精度和系统级约束的能力\[24 (https://arxiv.org/html/2608.20497#bib.bib1)\]。先前的工作通过模型压缩、量化和硬件编译框架(如hls4ml\[15 (https://arxiv.org/html/2608.20497#bib.bib2)\]、FINN\[8 (https://arxiv.org/html/2608.20497#bib.bib3)\]和CGRA4ML\[1 (https://arxiv.org/html/2608.20497#bib.bib4)\])解决了部分问题,这些框架将训练好的网络转换为可综合的硬件,通常在部署期间应用量化和剪枝。然而,它们操作的是固定的神经表示,主要是映射或优化预训练模型以适应硬件,而非联合设计本质上与硬件效率对齐的表示。
我们引入**Bern2Edge**,这是一个基于伯恩斯坦多项式激活\[26 (https://arxiv.org/html/2608.20497#bib.bib5)\]、面向边缘部署的端到端神经符号编译器,目标是前馈网络(FFN),包括多层感知机(MLP)和Transformer的FFN子层。伯恩斯坦多项式的结构化、有界表示既适合硬件实现,也适合符号推理\[16 (https://arxiv.org/html/2608.20497#bib.bib6)\]。我们的框架通过知识蒸馏(KD)\[20 (https://arxiv.org/html/2608.20497#bib.bib7)\]将训练好的DNN教师网络转换为硬件高效的表示,训练一个具有伯恩斯坦激活的紧凑学生网络,我们称之为伯恩斯坦神经网络(BNN)。这支持两种部署路径:基于查找表(LUT)的实现,其中每个神经元的LUT表示伯恩斯坦激活,以实现紧凑高效的综合;以及可选的基于符号规则的表示,该表示从伯恩斯坦激活的几何结构中推导得出,实现进一步压缩和可解释推理。
据我们所知,这是首个联合利用伯恩斯坦多项式激活的结构特性来实现高效硬件综合和符号规则提取的工作。本工作的贡献如下:
- **端到端教师到硬件部署框架。** 我们提出**Bern2Edge**,这是一个统一的流程,通过KD将训练好的教师DNN压缩为硬件高效的BNN,支持两种部署路径:基于LUT的实现用于高效硬件执行,以及基于符号规则的表示用于额外的压缩和可解释推理。
- **伯恩斯坦激活用于在知识蒸馏下改善压缩。** 我们引入伯恩斯坦多项式激活作为一种结构化的学生表示,在强压缩下改进了KD:BNN在压缩配置下比标准激活(如ReLU)更有效地恢复大型DNN教师的精度,同时仍非常适合硬件实现和可解释性。
- **基于LUT的硬件实现。** 伯恩斯坦多项式激活允许直接的基于LUT的实现,利用其归一化的输入域和固定的功能结构,实现高效的逐神经元LUT实现和紧凑的边缘推理表示。
- **符号规则提取与综合。** 我们开发了一种特定于BNN的规则提取方法,从学习到的伯恩斯坦激活的几何结构中推导出紧凑的符号规则,形成一种结构化、硬件高效的表示,支持量化到低位宽且精度损失可忽略不计。
- **在压缩和部署场景下的评估。** 我们在多个表格数据集和Transformer FFN设置上评估了**Bern2Edge**,证明了:(i)BNN在强压缩下的性能提升;(ii)在成本相当或低于标准激活的情况下,实现高效的基于LUT的硬件综合;(iii)紧凑有效的符号规则表示;(iv)在AMD Xilinx KV260和低功耗Spartan-7 XC7S15 FPGA上的端到端部署;以及(v)规则网络在输入噪声和分布偏移下的鲁棒性。
## II 背景与相关工作
### II-A 边缘部署框架与模型压缩
大量工作通过编译器框架和模型压缩,针对资源受限硬件上的神经网络部署。hls4ml\[15 (https://arxiv.org/html/2608.20497#bib.bib2)\]通过高级综合将训练好的网络转换为FPGA实现,将密集和卷积算子映射到具有定点量化的流式架构。FINN\[8 (https://arxiv.org/html/2608.20497#bib.bib3)\]将其扩展到量化网络,为低位宽、高吞吐量的FPGA推理生成数据流加速器。CGRA4ML\[1 (https://arxiv.org/html/2608.20497#bib.bib4)\]将这些方法扩展到粗粒度可重构架构(CGRAs)。这些系统主要通过训练后变换(量化、剪枝、算子融合)映射和优化预训练模型以适应硬件,而非联合设计模型表示本身。
我们的工作则针对*训练时*表示:我们训练伯恩斯坦多项式激活,其学习到的形式本质上是可部署的,而不是事后为硬件适配任意激活,从而实现直接的符号提取和从训练到硬件实现的统一流程。由于许多高性能模型是使用基于ReLU的架构预训练的,我们采用知识蒸馏(KD)将大型预训练教师网络迁移到紧凑的BNN中。KD是一种标准的压缩技术,匹配教师和学生之间的软输出或中间表示\[20 (https://arxiv.org/html/2608.20497#bib.bib7)\]。在**Bern2Edge**中,KD训练的学生BNN在保持大型模型精度的同时,保持了结构化的、硬件友好的表示。
### II-B 非线性激活的硬件实现
非线性激活的高效实现仍然是硬件部署中的一个关键挑战。分段线性函数(如ReLU)可以有效地映射到基于比较器的逻辑,但表达性强的光滑激活函数(如GeLU\[19 (https://arxiv.org/html/2608.20497#bib.bib8)\]和Swish\[31 (https://arxiv.org/html/2608.20497#bib.bib9)\])需要更复杂的算术运算,通常使用查找表或分段多项式方法进行近似\[11 (https://arxiv.org/html/2608.20497#bib.bib10)\],这会在训练和部署的函数之间引入差距。
以LUT为核心的设计通过直接将神经元计算映射到查找表来解决这个问题。LUTNet\[37 (https://arxiv.org/html/2608.20497#bib.bib11)\]使用FPGA原生的LUT作为推理算子以减少算术成本,而LogicNets\[35 (https://arxiv.org/html/2608.20497#bib.bib29)\]则协同设计可提取为LUT真值表的稀疏量化神经元。基于多项式的方法,如PolyLUT\[4 (https://arxiv.org/html/2608.20497#bib.bib12)\]和PolyLUT-Add\[28 (https://arxiv.org/html/2608.20497#bib.bib13)\]将其扩展到结构化的多项式类,但两者都要求每个神经元的硬扇入限制为≤7个输入,以约束LUT大小:PolyLUT强制稀疏连接,而PolyLUT-Add对低扇入子神经元求和。这与我们目标中的密集表格MLP(14-54个输入特征)不兼容,需要额外的稀疏化或重新设计才能应用。**Bern2Edge**则保留密集的MLP层,并使学习到的激活本身可硬件实现。KANÉLÉ\[21 (https://arxiv.org/html/2608.20497#bib.bib14)\]通过Kolmogorov-Arnold网络(KANs)探索以激活为中心的LUT映射,将MLP计算替换为可学习的一维边函数,这些函数被离散化为逐神经元的LUT,从而偏离了标准MLP结构。相比之下,**Bern2Edge**保留了标准的FFN架构,并直接针对激活:伯恩斯坦激活系数定义了部署的函数,能够通过小型逐神经元LUT实现精确实现,且不存在训练-部署差距。
### II-C 伯恩斯坦多项式激活
- **伯恩斯坦多项式。** 定义在区间 \([l,u]\) 上的 n 阶伯恩斯坦多项式 \(\sigma(z)\) 写为 \[16 (https://arxiv.org/html/2608.20497#bib.bib6)\]:
\[
\sigma(z;\,l,u,\mathbf{c}) = \sum_{k=0}^{n} c_k \, b_{n,k}(t), \quad t = \frac{z-l}{u-l} \in [0,1], \quad z \in [l,u], \tag{1}
\]
其中 \(z\) 是多项式函数的输入,\(t\) 是归一化的输入,\(\mathbf{c} = \{c_0, \ldots, c_n\}\) 是控制激活形状的多项式系数。伯恩斯坦基函数定义为:
\[
b_{n,k}(t) = \binom{n}{k} t^k (1-t)^{n-k}, \quad k=0,\ldots,n, \tag{2}
\]
满足单位划分性质:
\[
\sum_{k=0}^{n} b_{n,k}(t) = 1, \quad \forall t \in [0,1]. \tag{3}
\]
这定义了多项式在其定义域内为系数的凸组合,系数直接控制激活的形状。
- **伯恩斯坦神经网络(BNN)。** 伯恩斯坦多项式因其良好的分析和近似特性,已被探索作为神经网络中的非线性激活。Khedr 等人 \[26 (https://arxiv.org/html/2608.20497#bib.bib5)\] 引入了深度伯恩斯坦网络,这是一种前馈网络,其中标准激活被可学习的伯恩斯坦多项式替换。我们在整个**Bern2Edge**中采用这种表述,并称之为伯恩斯坦神经网络(BNN)。对于深度为 \(L\) 的网络,输入记为 \(\mathbf{x}^{(0)}\),第 \(l\) 层的输出为 \(\mathbf{x}^{(l)}\),传播规则为:
\[
\mathbf{x}^{(l)} = \sigma\left(\mathbf{z}^{(l)};\,\mathbf{c}^{(l)}\right), \quad z_i^{(l)} = \left(\mathbf{w}_i^{(l)}\right)^\top \mathbf{x}^{(l-1)} + \beta_i^{(l)} \tag{4}
\]
其中 \(\mathbf{w}_i^{(l)}\) 和 \(\beta_i^{(l)}\) 是可学习的权重和偏置。激活函数 \(\sigma\) 逐元素操作,由可学习的伯恩斯坦系数 \(\mathbf{c}^{(l)} = \{c_k^{(l)}\}_{k=0}^{n}\) 参数化,其中 \(n\) 是多项式次数的超参数,允许网络与其权重一起学习其非线性的形状。为简化符号,我们在本文剩余部分省略上标 \((l)\)。
- **BNN的理论特性。**
(1) 稳定训练:与其他多项式激活不同(它们因梯度爆炸而不稳定,且随次数增加而恶化)\[18 (https://arxiv.org/html/2608.20497#bib.bib39)\],伯恩斯坦多项式保持稳定 \[26 (https://arxiv.org/html/2608.20497#bib.bib5),3 (https://arxiv.org/html/2608.20497#bib.bib15)\]。
(2) 指数级近似率和参数效率:基于伯恩斯坦的架构实现了优于标准前馈ReLU网络的近似误差界 \[3 (https://arxiv.org/html/2608.20497#bib.bib15)\],以远低于分段线性ReLU网络的复杂度近似光滑函数。这些特性促使了使用BNN来压缩更大的网络。在**Bern2Edge**中,我们利用伯恩斯坦多项式激活的结构来进行硬件综合和符号规则提取。
### II-D 符号规则提取
先前关于从神经网络中提取符号规则的工作分为教学法和分解法。教学法方法(如TREPAN\[13 (https://arxiv.org/html/2608.20497#bib.bib16)\])将训练好的网络视为黑盒,通过查询其输入-输出行为来归纳决策树。分解法则利用内部网络结构:DeepRED\[40 (https://arxiv.org/html/2608.20497#bib.bib17)\]将早期的规则提取方法扩展到深度网络,逐层提取中间规则,并使用决策树描述隐藏层行为,而ECLAIRE\[39 (https://arxiv.org/html/2608.20497#bib.bib18)\]在保持高质量、可解释规则集的同时,提高了分解规则提取的可扩展性。NeuSym-HLS\[29 (https://arxiv.org/html/2608.20497#bib.bib37)\]应用硬件感知的符号回归,用紧凑的解析表达式替换内部神经层。早期的激活感知技术(如有效性区间分析\[34 (https://arxiv.org/html/2608.20497#bib.bib19)\])在网络中传播激活区间以推导符号描述,但将相似文章
通过进化程序性瓶颈解读神经组合优化
介绍进化程序性瓶颈(EPB),一种通过LLM驱动的进化将黑箱模型蒸馏为人类可读的程序组合以解读神经组合优化策略的框架。
面向边缘系统的延迟约束DNN架构学习:使用Zerorized Batch Normalization
本文提出了一种面向延迟的神经网络学习方法,使用Zerorized Batch Normalization优化严格延迟约束下边缘系统的DNN架构。实验表明,在NVIDIA Jetson设备上,该方法在精度损失极小的情况下显著降低了延迟。
基于大语言模型的空间构建中的2.5维分解
本文提出了一种利用2.5维分解的神经符号流水线,通过将垂直坐标计算卸载至确定性执行器,提高了基于大语言模型的空间构建准确性,在基准测试和边缘硬件上均实现了高精度。
ByteDance/Bernini-R
字节跳动开源了 Bernini-R,一种视频扩散渲染器,结合了基于 MLLM 的语义规划器和基于 DiT 的渲染器,用于统一的视频生成和编辑,在视频编辑上达到顶尖性能。
Bitnet.cpp:面向三值大语言模型的高效边缘推理
Bitnet.cpp 提出了一个混合精度矩阵乘法库,用于高效边缘推理三值大语言模型(如 BitNet b1.58),相比全精度基线实现了高达 6.25 倍的加速。该系统已在 GitHub 上开源。