用于透明传感器诊断管道搜索的候选命运核算
摘要
本文提出候选命运核算,作为一种框架,用于审计传感器诊断中的自动化机器学习管道搜索,通过跟踪所有候选及其结果来提升透明度。
arXiv:2608.18665v1 公告类型:新
摘要:工业传感器诊断依赖于预处理、表示和分类管道,因此自动化管道搜索有助于降低手动设计成本。然而,现有的自动化机器/深度学习(AutoML/AutoDL)报告通常只保留拟合的试验、分数和获胜者,忽略了生成的无效、剪枝、跳过、缓存或未拟合的候选方案。这种遗漏限制了审查员检查信号约束、预算使用和未评估的合法替代方案的能力。为了解决这个问题,我们提出了候选命运核算,这是一个用于诊断搜索跟踪的候选级别审计框架。它将每个观察到的候选方案记录为可审计的证据:哈希合并重复观察,合法性检查标记无效候选方案,分配理由解释预算决策,并且封闭的命运账本为每个候选方案分配一个终端命运。在三个轴承诊断数据集上的实验表明,该框架能检测无效候选方案并识别出仅拟合试验报告中遗漏的30-41个候选方案,封闭的命运记录验证了完整的候选方案核算,同时保持了具有竞争力的诊断性能。代码可在 https://github.com/XXIE999/candidate-fate-accounting 获取。
查看缓存全文
缓存时间: 2026/08/20 10:18
# 透明传感器诊断流水线搜索中的候选命运核算 来源:https://arxiv.org/html/2608.18665 \\correspondingauthor ## 透明传感器诊断流水线搜索中的候选命运核算DOI:10.1145/3799682.3839938 (https://doi.org/10.1145/3799682.3839938)会议:第35届ACM国际信息与知识管理会议论文集;2026年11月7日至11日;意大利罗马会议录:第35届ACM国际信息与知识管理会议 (CIKM '26),2026年11月7日至11日,意大利罗马ISBN:979-8-4007-2539-5/2026/11CCS:计算方法学 机器学习CCS:信息系统 数据挖掘CCS:应用计算 工业与制造 谢浩涛OrcID:0009-0002-3061-8090 (https://orcid.org/0009-0002-3061-8090)单位:北京航空航天大学杭州国际创新研究院,中国杭州邮箱:[[email protected]](mailto:[email protected])陈宇天OrcID:0009-0006-6114-8756 (https://orcid.org/0009-0006-6114-8756)单位:北京航空航天大学杭州国际创新研究院,中国杭州邮箱:[[email protected]](mailto:[email protected]),刘阳琪OrcID:0009-0003-7688-1190 (https://orcid.org/0009-0003-7688-1190)单位:暨南大学网络安全学院,中国广州邮箱:[[email protected]](mailto:[email protected])和姜小雨OrcID:0000-0003-4170-5579 (https://orcid.org/0000-0003-4170-5579)单位:北京航空航天大学杭州国际创新研究院,中国杭州邮箱:[[email protected]](mailto:[email protected]) 2026©,2026年; ###### 摘要\. 工业传感器诊断依赖于预处理、表示和分类流水线,这使得自动化流水线搜索对于降低人工设计成本十分有用。然而,现有的自动化机器学习/深度学习(AutoML/AutoDL)报告通常只保留拟合过的试验、分数和获胜者,省略了生成的、无效的、被剪枝的、跳过的、被缓存的或未拟合的候选方案。这种省略限制了审查者检查信号约束、预算使用和未评估的合法替代方案的能力。为了解决这个问题,我们提出了候选命运核算,这是一种面向诊断搜索轨迹的候选级审计框架。它记录每个观察到的候选方案作为可审计的证据:哈希值合并重复观察,合法性检查标记无效候选方案,分配原理解释预算决策,并且一个封闭的命运账本为每个候选方案分配一个最终命运。在三个轴承诊断数据集上的实验表明,该框架能检测无效候选方案,并识别出仅拟合试验报告遗漏的30-41个候选方案,同时封闭的命运记录验证了完整的候选方案核算,并在受控协议下保持了具有竞争力的诊断性能。代码可在https://github.com/XXIE999/candidate-fate-accounting获取。 ###### 关键词: 工业传感器诊断,搜索透明度,候选命运核算 ††cc-许可:by三部分图对比了专家建模、AutoML/AutoDL搜索和候选命运核算。专家建模被描述为可解释和可检查,但手动成本高;AutoML/AutoDL被描述为自动化,但搜索过程可见性有限;候选命运核算被描述为通过合法性检查、分配原理和最终命运来跟踪生成的候选方案。图1\。专家设计工作流、AutoML/AutoDL搜索和候选命运核算之间的动机比较。三部分图对比了专家建模、AutoML/AutoDL搜索和候选命运核算。专家建模被描述为可解释和可检查,但手动成本高;AutoML/AutoDL被描述为自动化,但搜索过程可见性有限;候选命运核算被描述为通过合法性检查、分配原理和最终命运来跟踪生成的候选方案。## 1\。引言 工业传感器诊断依赖于将机器信号转换为可靠故障判断的流水线 (31 (https://arxiv.org/html/2608.18665#bib.bib31))。在部署的维护环境中,这些流水线必须既准确又可检查:工程师需要知道哪些信号变换是可接受的,哪些分类器可以处理每种表示,以及为什么所选模型是合理的 (14 (https://arxiv.org/html/2608.18665#bib.bib30);25 (https://arxiv.org/html/2608.18665#bib.bib32))。专家构建的流水线提供了这种可审查性,但在不同的机器、通道和操作状态间重复这种推理是昂贵的 (32 (https://arxiv.org/html/2608.18665#bib.bib33))。自动化流水线搜索 (20 (https://arxiv.org/html/2608.18665#bib.bib21);5 (https://arxiv.org/html/2608.18665#bib.bib22);24 (https://arxiv.org/html/2608.18665#bib.bib23)) 通过生成和评估候选的预处理、表示和分类流水线来减少这种手动负担。然而,自动化不应移除审查搜索过程所需的证据。一个有用的诊断搜索报告不仅应该显示哪个流水线获胜,还应该显示那些从未被拟合的生成候选方案发生了什么。图1 (https://arxiv.org/html/2608.18665#S0.F1)总结了这种对比。 现有工作 (13 (https://arxiv.org/html/2608.18665#bib.bib27);33 (https://arxiv.org/html/2608.18665#bib.bib28);19 (https://arxiv.org/html/2608.18665#bib.bib29)) 解决了部分问题,但并未弥补生成候选方案的审计缺口。AutoML和AutoDL方法报告拟合后的配置;超参数优化框架如Optuna记录已调度试验的状态,如完成、失败或被剪枝的试验 (1 (https://arxiv.org/html/2608.18665#bib.bib12);12 (https://arxiv.org/html/2608.18665#bib.bib16);26 (https://arxiv.org/html/2608.18665#bib.bib17);7 (https://arxiv.org/html/2608.18665#bib.bib19);16 (https://arxiv.org/html/2608.18665#bib.bib20));语法和有效性方法拒绝非法程序;溯源系统跟踪已执行的产物 (22 (https://arxiv.org/html/2608.18665#bib.bib1);9 (https://arxiv.org/html/2608.18665#bib.bib2);10 (https://arxiv.org/html/2608.18665#bib.bib3);29 (https://arxiv.org/html/2608.18665#bib.bib4);8 (https://arxiv.org/html/2608.18665#bib.bib5);18 (https://arxiv.org/html/2608.18665#bib.bib6);21 (https://arxiv.org/html/2608.18665#bib.bib7);2 (https://arxiv.org/html/2608.18665#bib.bib11);27 (https://arxiv.org/html/2608.18665#bib.bib13))。这些工具很有用,但它们的报告单元通常是拟合后的配置、已调度的试验、被拒绝的程序或已执行的产物,而不是规范的生成候选方案。因此,重复提案、从未成为试验的类型无效候选方案,以及因预算或缓存决策而被跳过的合法候选方案可能缺乏一个最终解释,使得在候选级别难以审计搜索有效性和预算使用情况。候选命运核算补充而不是替代这些系统:它增加了一个规范的候选级分区,该分区也覆盖无效和未执行的替代方案。这个共同的报告单元支持在AutoML搜索策略间进行可重复、优化器无关的合法性和预算轨迹比较。 一个简单的诊断轨迹说明了这种差距。假设一个搜索生成了带有逻辑回归的短时傅里叶变换(STFT)图、一个z-score加对数梅尔支持向量机(SVM)流水线,以及一个高通原始向量XGBoost流水线,但只拟合了第三个候选方案。拟合试验报告仅记录评估过的流水线和分数,隐藏了第一个候选方案类型无效而第二个合法但因成本被阻止的事实。在预算有限的情况下,这些隐藏的结果很重要,因为它们暴露了合法性检查、预算分配、缓存重用和未测试的合法替代方案。 为了解决这个差距,我们设计了候选命运核算,一种面向生成的诊断搜索轨迹的候选级审计框架。该框架记录观察到的规范候选方案,而不是枚举从未出现的候选方案。它使用稳定的哈希值合并重复观察,使用类型化的合法性检查在拟合前暴露类型和语义错误,使用分配原理解释合法候选方案的预算决策,并使用带有Δclose\\Delta\_{\mathrm{close}\}的封闭命运账本验证每个观察到的候选方案恰好获得一个最终命运。这样,未拟合的候选方案成为可报告的证据,而不是优化器的簿记。分配策略保持可替换性:引导账本搜索是我们在实验中设计的一种分配器,而候选命运核算才是本文的主要贡献。图2 (https://arxiv.org/html/2608.18665#S1.F2)总结了工作流程。 我们在三个轴承诊断数据集上评估候选命运核算:凯斯西储大学(CWRU)轴承数据集、渥太华大学轴承数据集(Ottawa)和东南大学(SEU)轴承数据集。实验测试该框架是否在拟合前检测无效候选方案、通过完整的命运核算解释仅拟合试验报告遗漏的候选方案,以及在受控协议下保持有用的诊断性能。 主要贡献是: \(1\)我们在自动化工业诊断搜索中定义了生成候选方案的审计缺口,展示了为什么未拟合的候选方案应被视为关于有效性、预算使用和未测试合法替代方案的证据。 \(2\)我们设计了一个类型化的候选命运核算框架,将观察到的规范候选方案映射到可审计的合法性、分配原理、最终命运和封闭证据。 \(3\)我们在CWRU、Ottawa和SEU数据集上,通过无效候选方案探测、封闭命运账本、分配检查和受控协议诊断性能来评估该框架。 三阶段候选命运核算工作流程。首先,一个生成的诊断程序被分解为预处理、信号表示和估计器组件,并检查输入/输出兼容性和语义有效性。其次,预算分配器使用可替换的搜索策略,为生成的、有效的、未缓存的、尚未分配最终命运的候选方案确定优先级。第三,规范化的候选哈希将重复观察合并到账本中,为每个观察到的候选方案分配六种命运之一:无效、重复或缓存、剪枝、跳过、完全评估或剩余合法未拟合。零封闭缺口产生可审计的搜索证据。图2\。候选命运核算概览。类型化合法性检查对生成的候选方案进行分类;可替换的分配器确定合格候选方案的优先级;基于哈希的账本合并重复项并为每个观察到的候选方案分配一个最终命运——包括未拟合的结果。封闭条件Δclose=0\\Delta\_{\mathrm{close}\}=0验证了完整、不重叠的核算。三阶段候选命运核算工作流程。首先,一个生成的诊断程序被分解为预处理、信号表示和估计器组件,并检查输入/输出兼容性和语义有效性。其次,预算分配器使用可替换的搜索策略,为生成的、有效的、未缓存的、尚未分配最终命运的候选方案确定优先级。第三,规范化的候选哈希将重复观察合并到账本中,为每个观察到的候选方案分配六种命运之一:无效、重复或缓存、剪枝、跳过、完全评估或剩余合法未拟合。零封闭缺口产生可审计的搜索证据。## 2\。方法 我们将候选命运核算形式化为对生成的诊断搜索轨迹的报告约定。如图2 (https://arxiv.org/html/2608.18665#S1.F2)所示,该框架在封闭命运账本中记录类型化的合法性证据、分配原理和最终命运。这些记录使得信号约束、预算使用和未评估的合法替代方案变得可检查,同时保持审计层与优化器无关。第2.1节 (https://arxiv.org/html/2608.18665#S2.SS1)定义合法的诊断候选方案,第2.2节 (https://arxiv.org/html/2608.18665#S2.SS2)定义预算分配,第2.3节 (https://arxiv.org/html/2608.18665#S2.SS3)分配最终命运。 ### 2.1.类型化合法性证据 一个生成的候选方案是一个诊断程序c=(p,r,e)c=(p,r,e),其中p是预处理链,r是信号表示,e是估计器。这些组件交换的对象具有声明的类型,例如波形、向量、时频图和块序列。每个原语u声明一个输入类型\\tau\_{\\mathrm{in}}(u)\\tau\_{\mathrm{in}\}(u)、一个输出类型\\tau\_{\\mathrm{out}}(u)\\tau\_{\mathrm{out}\}(u)以及用于语义检查的轻量级元数据。第一个合法性条件是类型兼容性: Ctype=\\{c=(p,r,e):\\tau\_{\\mathrm{out}}(p)=\\tau\_{\\mathrm{in}}(r),\\tau\_{\\mathrm{out}}(r)=\\tau\_{\\mathrm{in}}(e)\\}.\\mathcal\\{C\\}\\_{\\mathrm\\{type\\}\\}=\\{c=(p,r,e):\\tau\\_{\\mathrm\\{out\\}\\}(p)=\\tau\\_{\\mathrm\\{in\\}\\}(r),\\,\\tau\\_{\\mathrm\\{out\\}\\}(r)=\\tau\\_{\\mathrm\\{in\\}\\}(e)\\}. 集合Ctype\\mathcal\\{C\\}\\_{\\mathrm\\{type\\}\\}包含签名匹配的候选方案。它在考虑任何搜索策略之前捕获了语法可行性。该规则通过拒绝诸如将图表示馈送给仅接受向量的分类器之类的错误,将信号类型约束转化为拟合前的证据。确定性语义映射\\rho:Ctype\\rightarrow\\{0,1\\}\\rho:\\mathcal\\{C\\}\\_{\\mathrm\\{type\\}\\}\\rightarrow\\{0,1\\}通过保守拒绝解决冲突:当数据集元数据报告零缺失时,缺失值原语是无效的,而第二个z-score归一化或滤波步骤作为冗余操作是无效的。固定规则优先级在检查重叠时记录一个原因。 第二步区分内在合法性和预算可接受性。给定预算B和其成本守卫CostOK(c,B)\\mathrm\\{CostOK\\}(c;B),我们定义 Legal(c)\\displaystyle\\mathrm\\{Legal\\}(c)\\equiv c\\in\\mathcal\\{C\\}\\_{\\mathrm\\{type\\}\\}\\wedge\\rho(c)=1,\\displaystyle\\equiv c\\in\\mathcal\\{C\\}\\_{\\mathrm\\{type\\}\\}\\wedge\\rho(c)=1, Admissible(c,B)\\displaystyle\\mathrm\\{Admissible\\}(c;B)\\equiv\\mathrm\\{Legal\\}(c)\\wedge\\mathrm\\{CostOK\\}(c;B).\\displaystyle\\equiv\\mathrm\\{Legal\\}(c)\\wedge\\mathrm\\{CostOK\\}(c;B). 因此Cleg=\\{c:Legal(c)\\}\\mathcal\\{C\\}\\_{\\mathrm\\{leg\\}\\}=\\{c:\\mathrm\\{Legal\\}(c)\\}是独立于预算的合法候选方案空间。类型/语义不兼容的候选方案在拟合前是无效的,而因成本、缓存或终止被阻止的合法候选方案仍然是合法的,并随后获得未评估的命运。 ### 2.2.分配原理 分配原理使预算使用可审查而不改变候选方案的合法性。在搜索步t,拟合预算 (17 (https://arxiv.org/html/2608.18665#bib.bib18)) 只能用于生成的、合法的、未缓存的且尚未分配最终命运的候选方案。令Gt\\mathcal\\{G\\}\\_{t\\}为生成的候选方案,Ht-1\\mathcal\\{H\\}\\_{t-1\\}为缓存的规范哈希值,h(c)h(c)为候选方案c的稳定哈希值,l(c)\\ell(c)为其当前账本状态。可分配集合为 At=\\{c\\in Gt\\cap Cleg:h(c)\\notin Ht-1,l(c)\\text{未分配}\\}.\\mathcal\\{A\\}\\_{t\\}=\\{c\\in\\mathcal\\{G\\}\\_{t\\}\\cap\\mathcal\\{C\\}\\_{\\mathrm\\{leg\\}\\}:h(c)\\notin\\mathcal\\{H\\}\\_{t-1\\},\\ \\ell(c)\\ \\text{未分配}\\}. 搜索策略仅在At\\mathcal\\{A\\}\\_{t\\}上操作:RLS (4 (https://arxiv.org/html/2608.18665#bib.bib14)) 均匀采样,TPE风格的采样器 (3 (https://arxiv.org/html/2608.18665#bib.bib15)) 从观察到的验证集宏F1调整原语分布,GLS (15 (https://arxiv.org/html/2608.18665#bib.bib26)) 使用语法批准的宏动作上的MCTS风格选择。它们只改变合法候选方案的优先级,而不改变合法性、预算资格、缓存处理或最终命运。 可选的训练集分割、无标签描述符,例如脉冲性、
相似文章
SearchAuditor:长时程搜索智能体故障的审计与归因
本文介绍了SearchAuditBench,这是一个包含1,243条带有专家标注的失败长时程搜索智能体轨迹的基准测试,以及SearchAuditor,一个从多视角进行审计的框架,用于定位、归因并修复智能体故障。实验表明,SearchAuditor优于基线方法,在使用GPT-5.5等前沿模型时,端到端通过率达到32.3%。
AgentForesight:多智能体系统中用于早期故障预测的在线审计
本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。
长周期研究智能体的搜索纪律
本文识别了长周期研究智能体中的一种失败模式:优化聚合指标可能选出提升核心数字但破坏关键子群体(反转)的候选项。它提出了一种搜索纪律协议,该协议使用一个外部控制环路,基于候选项的分解行为而非得分进行审计。
从准确性到可审计性:金融AI系统中的确定性综述
本综述研究了金融AI系统中的计算非确定性,涵盖表格模型、图网络和基于LLM的工作流,并提出了一个用于可审计性的分层评估框架。
通过失败轨迹进行基于策略的自我进化以实现智能体安全对齐
本文提出了 FATE,这是一种基于策略(on-policy)的框架,它利用失败轨迹通过自我进化和感知帕累托前沿的优化来增强使用工具的 LLM 智能体的安全性和性能。