Counterfactual Fragility Certificates: 揭露结构化证据失效下的高置信度脆弱性
摘要
Counterfactual Fragility Certificates (CFC) 引入了一种模型无关的审计协议,用于检测机器学习模型在结构化证据失效场景下的高置信度脆弱性,相比现有方法有所改进。
arXiv:2609.00366v1 Announce Type: new
摘要:高测试准确性和良好的整体校准并不能表明单个预测是否由其证据在结构上支持。在表格决策系统中,当特征族变得不可用、延迟、有噪声、过时或低可信度,而模型仍保持高置信度时,故障经常发生。现有的校准、不确定性、选择性预测、解释和扰动方法提供标量分数或归因图,但无法提供可重新计算的审计对象来回答:在声明的证据失效协议下,什么轨迹会使这个预测失去支持?我们引入了反事实脆弱性证书(CFC),这是一种模型无关的协议级审计证书——而非形式化的鲁棒性证书——它将每个预测映射到一个有序的证据失效轨迹,该轨迹由贪婪翻转预算、归一化边界坍缩区域、退化阈值和脆弱性主导分数总结。在七个表格基准测试和强线性、基于树、提升和神经网络基线中,CFC-FDS 以 0.915 AUROC 识别独立脆弱的高置信度案例,相比最强非证书分数提高了 +0.405。这种优势在扰动、排列重要性、组-SHAP、基线选择、种子方差、预算审查和自然字段不可用检查中持续存在。在 20% 的审查预算下,CFC-FDS 捕获了 88.9% 的脆弱高置信度案例,而置信度和能量分数分别为 31.8-37.4%。我们还评估了脆弱性感知正则化和脆性感知温度校正作为次要用途。CFC 提供了一个具体的可靠性框架,用于揭露普通以分数为中心的评估所遗漏的高置信度脆弱性。
查看缓存全文
缓存时间: 2026/09/02 06:12
# 反事实脆弱性证书:结构化证据失效下高置信度脆弱性的揭示 来源:https://arxiv.org/html/2609.00366 Filippo Cenacchi, Longbing Cao, Runze Yang 悉尼麦考瑞大学 [email protected], [email protected], [email protected] ###### 摘要 高测试准确率和良好的整体校准无法表明单个预测是否在结构上由其证据支撑。在表格决策系统中,当某个特征族变得不可用、延迟、含噪、过时或置信度低,而模型仍保持高度自信时,故障往往会发生。现有的校准、不确定性、选择性预测、解释和扰动方法提供标量分数或归因图,但无法生成可重新计算的审计对象来回答:*在声明的证据失效协议下,是什么轨迹使该预测失去支撑?* 我们引入*反事实脆弱性证书*,这是一种与模型无关的协议级审计证书——而非形式化的鲁棒性证书——它将每个预测映射为一个有序的证据失效轨迹,并通过贪心翻转预算、归一化裕度坍塌面积、退化阈值和脆弱性主导分数进行概括。CFC 是在固定分组、基线、压力算子、严重性网格和审计深度下的确定性见证。 在七个表格基准测试以及强大的线性、基于树、提升和神经网络基线上,CFC-FDS 能识别出独立的脆弱性高置信度案例,AUROC 达到 0.915,比最强的非证书分数提升了 +0.405。这一优势在面对扰动、置换重要性、组-SHAP、基线选择、种子方差、预算审查和现实场景字段不可用性检查时依然存在。在 20% 的审查预算下,CFC-FDS 捕获了 88.9% 的脆弱性高置信度案例,而置信度分数和能量分数仅捕获 31.8-37.4%。我们还评估了脆弱性感知正则化和脆性感知温度校正作为次要用途。CFC 为揭示普通评分中心评估所遗漏的高置信度脆弱性提供了一个具体的可靠性框架。 ## 1 引言 平均情况评估仍然主导着机器学习报告,但部署故障通常集中在那些在证据受到压力前看起来很强的预测上。一个分类器可能具有高 AUROC、宏 F1 和负对数似然,但对于某些案例,它依赖的支撑集却危险地狭窄。校准研究表明,现代预测器可能过度自信,而事后方法如温度缩放、贝叶斯分箱和狄利克雷校准可以改善概率语义而不改变决策规则。选择性预测在风险较高时增加了弃权和基于置信度的过滤。然而,这些方法仍然主要将可靠性简化为标量置信度,而没有测量预测在结构化证据退化下是否保持稳定。 这在表格系统中尤为重要,因为故障通常源于缺失、延迟、过时或低质量的特征组,而非对抗性噪声。最近的表格基准测试表明,树集成和基础模型仍然难以被超越;鲁棒性研究显示现实的分布偏移和对抗性压力仍未解决;选择性分类研究表明,基于置信度的拒绝可能会遗漏未检测到的错误风险。缺失的产物是一个标准的、可重新计算的对象,用于量化当语义有意义的特征组被削弱或移除时,预测崩溃的速度。 图 1 概述了 CFC。图 1 帧定了这一差距;我们用*反事实脆弱性证书*解决了这个问题,这是一种每样本、模型无关的审计对象,通过对训练好的模型和分组预处理特征进行受控的前向传播计算得出。与置信度、校准误差、归因、单步扰动重要性或反事实追索不同,CFC 记录了一个声明的*失效路径*:有序的证据状态、首次预测翻转、翻转前后或无翻转时的裕度坍塌面积,以及部分退化何时变为决策改变时的严重性。因此,可靠性分析的单元从标量分数转变为一个操作性问题:*在此声明的证据失效协议下,是什么轨迹使该预测失去支撑?*该证书是确定性和可检查的,但有意地相对协议,而非形式化的最坏情况保证。 在实证上,我们使用分离的协议:分数通道从确定性移除中构建证书,而标签通道则使用保留的随机掩码、丢弃和未用于分数的压力噪声定义脆弱性高置信度案例。我们进一步测试了预算检索、扰动和归因基线、校准校正、种子级方差、自举置信区间、基线选择敏感性和验证控制的脆弱子集校准。核心主张并非 CFC 能预测所有部署故障,而是声明的、可重新计算的证据失效轨迹能够识别出跨算子的高置信度脆弱性,而置信度、能量、扰动和归因分数则会遗漏这些;将协议与实际事件日志匹配仍然是特定于部署的验证工作。 本文有四个贡献:(i) 它将*结构化证据失效脆弱性*形式化为一个区别于置信度估计、校准、归因和反事实追索的可靠性问题,其中对象是预测在声明的压力协议下失去支撑的有序轨迹;(ii) 它引入了*反事实脆弱性证书*,这是一种具有固定分组、基线、压力算子、审计深度、确定性轨迹构建、可检查的翻转预算、裕度坍塌面积、退化阈值以及单独评估的排序头的每样本可重新计算审计对象;(iii) 它表明,CFC 导出的排序在识别独立脆弱性高置信度案例方面,显著优于置信度、熵、裕度、能量、单步扰动、置换重要性和组-SHAP 基线;(iv) 它提供了一个验证套件,涵盖预算捕获、扰动和归因基线、种子级方差、自举置信区间、基线选择敏感性、现实场景字段不可用性和脆性感知温度校正,且不泄露测试标签。 ## 2 相关工作 校准研究确立了现代预测器即使在准确率很高时也可能分配扭曲的概率。事后方法如温度缩放、贝叶斯分箱和狄利克雷校准在域内修复概率语义,而集成和近似贝叶斯方法则将讨论扩展到认知不确定性。最近的工作进一步研究了信任估计、故障预测、密度感知校准和校准基准测试。这些工作表明为什么仅靠置信度是不充分的,但它们没有直接量化*支撑脆弱性*:一个样本可能在整体上校准良好,但仍可能距离决策翻转仅一次证据失效。 选择性预测通过弃权和覆盖率-风险控制将置信度转化为行动,但它通常仍然以置信度为中心。它无法区分广泛不确定性与一个极小子特征组几乎承载整个决策的情况。CFC 通过揭示这种操作风险来补充弃权:预测不仅是不确定或自信的,而且是结构上支撑充分或支撑不足的。 表格学习仍然是一个要求严苛的评估领域,因为基于树的方法仍然非常强大,而真实数据集混合了连续值、分类值和缺失值结构。关于表格数据的鲁棒性研究越来越多地考虑自然偏移和对抗性压力测试,但结构化证据失效仍不够明确。我们的工作与局部解释和反事实解释方法相近,后者解释预测或提出替代输入。然而,归因、扰动敏感性和脆弱性是不同的对象。高归因特征不一定是最能导致决策崩溃的特征,而单步组扰动无法揭示支撑是突然侵蚀、逐渐侵蚀,还是仅在部分退化时才发生侵蚀。 CFC 在精神上更接近于有序移除和最小子集分析,例如充分输入子集、最相关优先扰动曲线和 ROAR 式特征移除评估。区别在于,SIS 询问哪个保留的子集对原始决策是充分的,MoRF/ROAR 通过移除重要特征或在移除后重新训练来评估归因排序,而 CFC 则为每个预测记录一个相对协议的失效轨迹,并评估该轨迹是否能在保留的压力器下预测独立的脆弱性高置信度案例。因此,CFC 并非作为一种新的归因方法被提出:它是一个具有可检查路径、贪心翻转预算、归一化裕度坍塌面积、退化阈值和单独评估的排序头的可重新计算压力证书。 ## 3 方法 ### 3.1 结构化证据失效设置 设 fθ:Rd→ΔC−1 为一个训练好的分类器,返回概率 pθ(x)、预测标签 ŷ(x)=arg maxc pθ(c|x) 和置信度 p̂(x)=maxc pθ(c|x)。对于所有模型家族,包括仅输出概率的树和提升模型,裕度和能量分数使用附录 C 中标准化的伪 logits 转换从相同的裁剪、重归一化概率向量计算得出。 预处理后,转换后的坐标被划分为语义上有意义的证据组 G={g1,...,gG}。我们通过将转换后的特征追溯到其原始变量来构建每个组,因此所有派生列,例如独热编码,构成一个连贯的证据块。这种原始来源分组是默认的审计惯例,并非声称因果最优性:选择它是因为它是可重复的、预处理感知的,并且与可能一起缺失、延迟、过时或低置信度的字段对齐。当领域证据块可用时,相同的证书可以用这些组来实例化;任意或冗余的分组会削弱语义解释,被视为协议选择而非隐藏的真值。 我们还从训练数据中定义了一个基线替换向量 x̄(预处理后)。该基线不是因果性的;它是一个中性的转换空间状态,用于模拟缺失或低置信度信息。我们考虑两种证据失效算子。首先,确定性组移除将子集 S⊆G 中的所有坐标替换为它们的基线值,记为 R(x,S)。其次,分级退化将一个组向基线插值,记为 Aλ(x,g),严重性 λ∈[0,1],可选择随机变体如组内丢弃或有界加性噪声。 这些算子并非旨在模拟每个真实的损坏过程或产生因果反事实;它们定义了一个标准化的、可审计的压力协议,用于工作流式的证据丢失。因此,我们报告对基线选择的敏感性,并将真实事件匹配视为外部验证问题,而非证书的假设。 ### 3.2 反事实脆弱性证书 该证书被设计为一个统一的审计对象,而非置信度的替代品。校准
相似文章
证书失效时:嵌入式神经接口模型的统一安全框架
本文表明,嵌入式神经接口模型的正式鲁棒性证书可能在任务准确率因对抗攻击而崩溃时仍能通过,并提出一个统一的实证审计框架,以解决训练目标与操作用户福利之间的对齐失败问题。
认证或拒绝:协变量偏移下带覆盖率下限的选择性风险控制的跨模型映射
本文引入了一种跨模型映射,用于认证必须在协变量偏移下同时满足自动化下限和风险上限的选择性预测器,推导了可行性边界和双资源样本复杂度权衡。
选择性信号分类中的虚假安全感:对风险控制的边界紧密性与可交换性的审计
本文审计了信号域检测器中用于选择性分类的无分布风险控制方法的可靠性,发现朴素阈值法常常超出其声称的预算,并且可交换性违反导致证书失败。
FragileFlow:通过频谱控制正确但脆弱的预测以增强基础模型的鲁棒性
本文介绍了 FragileFlow,这是一种插件式正则化器,通过频谱分析和 PAC-Bayes 界来控制“正确但脆弱”的预测,从而提高 LLM 和 VLM 的鲁棒性。
预测认证无法取代解释认证:复合压力下可信AI的能力包络
本文认为,仅基于预测的认证无法确保可信AI,并提出了一种'能力包络'框架,该框架集成了解释认证以检测隐藏故障。