BearingNAS:使用笔记本电脑获取轴承内传感器智能故障诊断系统
摘要
本文介绍了BearingNAS,一种硬件感知的神经架构搜索框架,用于设计轴承的智能故障诊断系统,目标是微控制器和传感器处理单元,这些单元内存极为有限(4-8 KiB RAM,16-32 KiB Flash),而整个框架完全在笔记本电脑CPU上运行,并达到99.50%的诊断准确率。
arXiv:2607.18287v1 Announce Type: new
摘要:本文介绍了BearingNAS,一种硬件感知神经架构搜索(HW-NAS)框架,旨在通过传感器内处理将智能直接移至传感器芯片上。BearingNAS将搜索建模为一个受约束的优化问题,针对极微预算(4至8 KiB RAM和16至32 KiB Flash)。为了消除对昂贵独立GPU的依赖,我们提出了一种轻量级、无导数的搜索策略,配合单一数据流搜索空间,利用衰减核增长公式防止参数爆炸。我们在凯斯西储大学(CWRU)轴承基准上评估了我们的框架,为三个意法半导体目标优化架构:两个通用微控制器和LSM6DSO16IS智能传感器处理单元(ISPU)。整个搜索完全在笔记本电脑CPU上运行,不到一小时收敛。得到的最终传感器内架构在ISPU上实现了极具竞争力的99.50%诊断准确率。这些结果证明了将机器学习工作负载移至传感器封装内部的可行性,从而实现低成本、生产规模的轴承故障诊断。
查看缓存全文
缓存时间: 2026/07/22 08:18
# BearingNAS:利用笔记本电脑获取轴承的传感器内智能故障诊断系统
###### 摘要
本文介绍 BearingNAS,一种硬件感知神经架构搜索(HW-NAS)框架,旨在通过传感器内处理将智能直接迁移到传感器芯片上。BearingNAS 将搜索形式化为一个针对极端微预算(4 至 8 KiB RAM 和 16 至 32 KiB Flash)的约束优化问题。为消除对昂贵离散 GPU 的依赖,我们提出一种轻量级无导数搜索策略,配合单一数据流搜索空间,该空间利用衰减卷积核增长公式防止参数爆炸。我们在凯斯西储大学(CWRU)轴承基准数据集上评估该框架,为三个 STMicroelectronics 目标优化架构:两种商用微控制器和 LSM6DSO16IS 智能传感器处理单元(ISPU)。整个搜索过程完全在笔记本电脑 CPU 上运行,一小时内收敛。最终在 ISPU 上得到的最佳传感器内架构实现了 99.50% 的高竞争性诊断准确率。这些结果证明了将机器学习工作负载转移到传感器封装内部、实现低成本、量产级轴承故障诊断的可行性。
## I 引言
轴承是关键的机械部件,对多个工业部门的可靠性产生重要影响,包括铁路[29 (https://arxiv.org/html/2607.18287#bib.bib1)]、生产机械[19 (https://arxiv.org/html/2607.18287#bib.bib2)]、风电[13 (https://arxiv.org/html/2607.18287#bib.bib3)]、机器人[28 (https://arxiv.org/html/2607.18287#bib.bib4)]、航空航天[16 (https://arxiv.org/html/2607.18287#bib.bib5)]、核能[31 (https://arxiv.org/html/2607.18287#bib.bib16)]和石油[8 (https://arxiv.org/html/2607.18287#bib.bib6)]等。因此,识别轴承故障对于确保连续运行至关重要;历史上,约 40-50% 的旋转设备故障归因于轴承退化[15 (https://arxiv.org/html/2607.18287#bib.bib7)]。当轴承失效时,后果可能级联至整个系统,导致严重的经济损失甚至灾难性伤亡[3 (https://arxiv.org/html/2607.18287#bib.bib8)]。
为降低这些风险,研究人员长期关注轴承故障的鲁棒设计与自动识别[14 (https://arxiv.org/html/2607.18287#bib.bib19)]。近年来,最先进的机器学习技术,从支持向量机(SVM)[27 (https://arxiv.org/html/2607.18287#bib.bib9)]、长短期记忆网络(LSTM)[9 (https://arxiv.org/html/2607.18287#bib.bib10)],到卷积神经网络(CNN)[6 (https://arxiv.org/html/2607.18287#bib.bib13)]、Transformer[7 (https://arxiv.org/html/2607.18287#bib.bib14)]和大语言模型(LLM)[17 (https://arxiv.org/html/2607.18287#bib.bib15)],已被广泛用于故障诊断。然而,绝大多数这类模型依赖强大且耗电的外部计算单元,使得在边缘大规模、经济高效地部署变得不切实际[5 (https://arxiv.org/html/2607.18287#bib.bib17)]。相反,现有针对边缘部署优化的故障诊断算法通常需要高度专门且大量的人工工程技能才能部署到实际工业场景[30 (https://arxiv.org/html/2607.18287#bib.bib18)]。
为弥合这一差距,我们引入 BearingNAS,一个端到端框架,旨在自动生成针对商用微控制器和现代惯性测量单元(IMU)内资源受限智能传感器处理单元(ISPU)的最先进智能故障诊断系统(IFDS)。通过利用这些目标电子器件的紧凑外形、高能效和低于 1 美元的成本,我们的解决方案使 IFDS 的获取更加民主化,从而在大规模生产层面实现局部故障诊断能力的普遍集成。
## II 相关工作
早期的智能故障诊断系统(IFDS)迭代严重依赖从振动或声学信号中手动提取特征,随后使用传统机器学习分类器,如支持向量机(SVM)[27 (https://arxiv.org/html/2607.18287#bib.bib9)]。虽然在受控实验室环境下有效,但这些方法难以应对实际工业环境特有的非线性、非平稳噪声。
为克服这些局限,深度学习(DL)已成为主导范式。深度架构能够直接从原始或经过最少处理的传感器数据中学习层次特征表示。长短期记忆网络(LSTM)[9 (https://arxiv.org/html/2607.18287#bib.bib10)]被广泛用于捕获序列信号流中的时间依赖性,而卷积神经网络(CNN)则在信号转换为时频谱图[21 (https://arxiv.org/html/2607.18287#bib.bib26)]或直接作为时变时序信号处理[20 (https://arxiv.org/html/2607.18287#bib.bib27)]时利用空间关系。最近,该领域转向高容量架构。Transformer[7 (https://arxiv.org/html/2607.18287#bib.bib14)]利用自注意力机制对传感器数据中的长程相关性建模,当代框架甚至开始评估大语言模型(LLM)[17 (https://arxiv.org/html/2607.18287#bib.bib15)]用于零样本异常分类。然而,深度学习研究这条脉络上的一个系统性缺陷是仅聚焦于最大化分类准确率,而这以过度且不可持续的计算开销为代价。
受低延迟、数据隐私和减少通信带宽的需求驱动,将 IFDS 能力从集中式云服务器转移到工业边缘正成为一个关键焦点[30 (https://arxiv.org/html/2607.18287#bib.bib18), 24 (https://arxiv.org/html/2607.18287#bib.bib30)]。这种范式转变广为人知,称为 TinyML,即机器学习(ML)推理在资源受限的嵌入式设备上原生实现。
然而,在此类受限硬件上部署最先进的机器学习算法需要专门的硬件协同设计技能,这与故障诊断领域常见的技能有很大不同[23 (https://arxiv.org/html/2607.18287#bib.bib29)]。硬件感知神经架构搜索(HW-NAS)已成为自动化设计满足严格资源约束的 ML 模型的主要解决方案[1 (https://arxiv.org/html/2607.18287#bib.bib28)]。早期的 HW-NAS 框架计算成本极高,需要多达 40,000 个图形处理单元(GPU)小时才能找到最优解[22 (https://arxiv.org/html/2607.18287#bib.bib22)]。随后的迭代成功将搜索成本降低到 300 GPU 小时[18 (https://arxiv.org/html/2607.18287#bib.bib21)],最终降至仅 3 GPU 小时[10 (https://arxiv.org/html/2607.18287#bib.bib23)],最终完全消除了对 GPU 加速的需求[11 (https://arxiv.org/html/2607.18287#bib.bib24)],并实现了直接在边缘设备上搜索[12 (https://arxiv.org/html/2607.18287#bib.bib25)]。
尽管取得了这些进展,但这些 HW-NAS 框架均未明确考虑传感器内计算的特殊性。例如,ColabNAS[10 (https://arxiv.org/html/2607.18287#bib.bib23)]主要关注图像输入;虽然图像是分析振动的广泛采用的输入格式,但处理图像超出了 ISPUs 的严格资源限制。同样,尽管 NanoNAS[11 (https://arxiv.org/html/2607.18287#bib.bib24), 12 (https://arxiv.org/html/2607.18287#bib.bib25)]在 CWRU 数据集上取得了最先进的结果,但其生成的架构所需的硬件资源大于 ISPU 上可用的资源。
为弥合设计轴承故障诊断系统所需的专业知识与 TinyML 实现所需的专门知识之间的差距,我们提出 BearingNAS。我们的方法引入了一个 HW-NAS 框架,针对提供传感器内智能故障诊断系统(IS-IFDS)进行了优化。通过在普通笔记本电脑上高效运行,BearingNAS 消除了繁重的基础设施障碍,同时提供与最先进的云连接轴承 IFDS 相媲美的诊断性能。
## III BearingNAS
BearingNAS 是一种专门设计用于在没有独立 GPU 的笔记本电脑上运行的 HW-NAS。它针对资源受限的微控制器或 ISPU,这些器件具有 4 至 8 KiB RAM 和 16 至 32 KiB Flash,如表 I (https://arxiv.org/html/2607.18287#S4.T1) 所示。
### III-A 问题陈述
\{argminAf(A)φRAM(A)≤ξRAM,φFlash(A)≤ξFlash,φMAC(A)≤ξMAC,ξRAM,ξFlash,ξMAC>0 (1)
主要目标是找到最适合目标硬件资源约束的神经架构,这可以形式化为一个优化问题。对于微控制器,RAM 和 Flash 容量决定了通用候选架构的可行性。相反,乘累加(MAC)指令的数量决定了延迟。因此,RAM、Flash 和 MAC 被选为优化问题的约束条件,如方程 1 (https://arxiv.org/html/2607.18287#S3.E1) 所示。具体来说,函数 φ\_RAM、φ\_Flash 和 φ\_MAC 返回候选架构 A 的 RAM、Flash 和 MAC 占用;而 ξ\_RAM、ξ\_Flash 和 ξ\_MAC 定义了所选目标硬件施加的上限。在可行解中,我们选择训练期间验证损失最小的架构,该损失由方程 1 中的函数 f 衡量。
### III-B 搜索空间
搜索空间定义了通用候选架构 A 的构建方式。鉴于目标硬件严格的资源约束,我们避免了包含有向无环图(DAG)或残差连接的复杂搜索空间,以减少 RAM 和 Flash 使用。相反,我们采用了一个具有单一数据流的搜索空间。候选架构通过堆叠卷积层、池化层和批归一化层来构建。每个候选架构以包含 k 个大小为 1×3 的卷积核的卷积层开始。然后,堆叠 c 个单元,每个单元由一个 1×2 最大池化层、一个批归一化层和一个包含 n 个大小为 1×3 的卷积核的卷积层组成。最后,一个全局平均池化层压缩提取的特征,一个带 softmax 激活的全连接层对其进行分类。通用单元中卷积层采用的卷积核数量 n 由以下方程定义:
n\_c = n\_{c-1} + floor( 2^{1-c} * n\_{c-1} ),其中 n\_0 = k。
这种衰减增长公式确保卷积核数量以逐渐减小的速率扩展,从而有意识地防止参数和激活内存爆炸,而这通常是深度网络在资源受限微控制器上的瓶颈。每个卷积层采用硬件友好的 ReLU 激活函数。结果是一个二维搜索空间,候选架构可以由元组 (k, c) 唯一标识。
### III-C 搜索策略
搜索策略定义了如何找到优化问题的解。为适应缺乏独立 GPU 的笔记本电脑的计算能力,我们采用了一种受 NanoNAS[12 (https://arxiv.org/html/2607.18287#bib.bib25)] 启发的自定义无导数搜索策略。它由两个嵌套循环组成:外层循环(算法 1,第 5 行)探索搜索空间的 k 轴,内层循环(算法 1,第 7 行)探索 c 轴。从零开始,内层循环在具有 k 个卷积核的基础卷积层之上逐个堆叠单元,以确定当前 k 值下的最佳可行深度。然后,外层循环根据算法 1 第 19 行的方程提出基础卷积层的新卷积核数量 k。
对 c 轴的穷举探索是与 NanoNAS[12 (https://arxiv.org/html/2607.18287#bib.bib25)] 的关键区别,后者的搜索在首次性能下降时截断。这种早停机制阻止了搜索策略在低 k 值下探索更深的架构(由于训练噪声),从而阻碍 HW-NAS 收敛到性能更好、更轻量的解。此外,我们采用基于验证损失而非验证准确率的目标函数;这考虑了智能故障诊断中典型的数据稀缺性,原始算法在搜索过程中使用的验证子集上发现完美分数时会过早终止。
搜索过程从候选架构 (1,0)(最小者)开始,并在搜索空间的两个方向上交替探索。只要在 c 轴上找到更好的候选,k 值就逐渐增加。当在 k 轴的两次移动之间首次出现目标函数下降时,触发可选增量缩减机制(算法 1,第 18 行),以检查较小的增量是否能提供更好的解。当变量增量变为零时,搜索停止,算法返回找到的最佳解。
1: procedure search strategy
2: k ← 1, c ← 0 ▷ 起点
3: β ← 0, γ ← 0
4: k̄ ← k
5: repeat ▷ 外层循环
6: c̄ ← 0, c* ← 0
7: while (k̄, c̄+1) 可行 do ▷ 内层循环
8: if f(k̄, c̄+1) < f(k̄, c*) then
9: c* ← c̄+1 ▷ 更新最佳 c
10: end if
11: c̄ ← c̄+1
12: end while
13: if f(k̄, c*) < f(k, c) then
14: k ← k̄, c ← c* ▷ 候选确认
15: else
16: γ ← 1 ▷ 开始 k 增量缩减
17: end if
18: β ← β + γ ▷ 可选的 k 增量缩减
19: k̄ ← k + floor( 2^{-β} * k ) ▷ k 的变量增量
20: until floor( 2^{-β} * k ) = 0 ▷ 停止准则
21: end procedure
算法 1:提出的搜索策略。
## IV 实验设置
为评估 BearingNAS,我们使用了凯斯西储大学(CWRU)轴承数据集,这是工业状态监测中故障诊断的广泛采用基准[5 (https://arxiv.org/html/2607.18287#bib.bib17)]。该数据集由 CWRU 轴承数据中心提供,包含从一台 2 马力电机驱动端和风扇端在高相似文章
设备端神经架构搜索
提出了一种轻量级神经架构搜索方法,直接在部署设备上执行,用于近传感器计算。在sEMG手语和故障诊断数据集上进行了验证,提高了准确率并减少了RAM占用。
基于物理可验证证据与LLM报告的轴承故障诊断
本文介绍了诊断证据网络(DENet),一个多任务框架,它将基于AI的轴承故障诊断扩展为生成物理可验证的证据,例如预测的特征频率和脉冲的时间定位,同时使用QLoRA适配的语言模型生成受限的诊断报告,以减少幻觉内容。
数据稀缺下基于强化学习的数字孪生驱动自适应仿真到真实对齐方法用于振动轴承健康监测
本文提出了一种基于强化学习的自适应仿真到真实对齐方法,用于振动轴承健康监测,通过近端策略优化解决数据稀缺和异质故障类型差距问题。
一种基于置信规则库并考虑鲁棒性分析的可靠故障诊断方法
本文提出了一种基于置信规则库并考虑鲁棒性分析的可靠故障诊断方法,解决了传感器可靠性问题,并在WD615柴油机和轴承数据集上验证了该方法。
类脑硬件为AI系统带来更快、更低功耗的异常检测
一种新的类脑硬件设计借鉴神经形态计算原理,使AI系统能够更快、更节能地进行异常检测。