超越输出空间校准:时间序列分类中选择性可靠性估计的频谱证据捆绑
摘要
本文介绍SEB-Cal,一种通过频谱特征(频带能量、熵、峰值主导性、相位稳定性)增强输出空间校准的方法,以改善时间序列分类中的选择性可靠性估计,在多个数据集上实现更高的Corr-AUROC和更低的[email protected]。
arXiv:2607.18279v1 公告类型:新
摘要:时间序列分类的事后校准通常重新映射输出分数,但部署决策(如信任、弃权和审查)取决于置信预测是否得到当前时间信号的支持。我们解决了三个时间序列可靠性差距:相同的置信度值可能隐藏不同的时间支持,平均校准可能遗漏假高置信度错误,输出空间重校准提供的输入相关审计能力有限。我们引入了一种验证门控的固定标签可靠性策略,该策略保持骨干网络预测不变,同时估计是否应信任该预测。该方法将输出端线索与全样本频谱描述符(包括频带能量、熵、峰值主导性、周期支持和相位稳定性)相结合,形成标量可靠性估计和诊断性频带级证据。验证门仅在正确性排名改善且不违反[email protected]或AURC容差时启用频谱条件,否则回退到更安全的输出空间基线。在八个异构UCR/UEA数据集、八个时间序列骨干网络系列以及标准重新校准器上,无约束方法在匹配评估子集上改进了固定标签选择性可靠性指标,将Corr-AURC从0.693提高到0.779。验证门控策略进一步将Corr-AURC提高到0.786,并将[email protected]降低到0.094。这些结果表明,时间序列分类器的可靠性估计受益于将输出置信度与频谱证据捆绑,而验证门控防止了无支持的频谱调节。
查看缓存全文
缓存时间: 2026/07/22 08:18
# 超越输出空间校准:时间序列分类中用于选择性可靠性估计的光谱证据捆绑 来源:https://arxiv.org/html/2607.18279 Filippo Cenacchi, Longbing Cao, and Runze Yang 麦考瑞大学,悉尼,澳大利亚 [email protected], [email protected], [email protected] ###### 摘要 事后校准通常重新映射输出分数,但诸如信任、弃权和审查等部署决策取决于一个高置信度的预测是否得到当前时间信号的支持。这产生了三个时间序列特有的差距:相同的置信度值可能隐藏着不同的时间支持程度;平均校准可能遗漏虚假的高置信度错误;输出空间校准器提供的与输入相关的可审计性有限。我们提出 SEB-Cal,一种验证门控的固定标签可靠性策略,它保持骨干网络和预测标签不变,同时评估该预测是否应被信任。为了针对这些差距,SEB-Cal 用确定性的全样本光谱描述符增强输出侧线索:频带能量追踪证据集中度,熵测量扩散程度,峰值主导性衡量周期性支持,相位稳定性测量相干对齐,从而产生一个标量可靠性估计和频带级诊断。验证门是一个留出模型选择规则:仅当正确性排序在不违反 [email protected] 或 AURC 容忍度的情况下得到改善时,才启用光谱条件作用,否则回退到更安全的输出空间基线。在八个异构的 UCR/UEA 数据集、八个时间序列骨干系列以及标准输出空间校准器上,无约束的 SEB-Cal 在匹配的评估子集上改进了固定标签的选择性可靠性指标,将 Corr-AUROC 从 0.693 提高到 0.779,而验证门控策略进一步将 Corr-AUROC 提高到 0.786,并将 [email protected] 降低到 0.094。 ## 1 引言 时间序列分类系统越来越多地部署在置信度触发信任、推迟、升级、过滤或下游审查的工作流程中。因此,操作问题不仅仅是分类器是否准确,而是其置信度是否跟踪当前样本的正确性。这在时间序列中很困难,因为两个预测可能具有相同的输出空间锐度,但得到非常不同的时间证据支持。 大多数事后校准方法仍然几乎完全在输出空间中操作。温度缩放 (Naeini 等人, 2015 (https://arxiv.org/html/2607.18279#bib.bib4))、等渗回归 (Guo 等人, 2017 (https://arxiv.org/html/2607.18279#bib.bib1))、贝塔校准 (Kull 等人, 2017 (https://arxiv.org/html/2607.18279#bib.bib2)) 以及狄利克雷校准 (Kull 等人, 2019 (https://arxiv.org/html/2607.18279#bib.bib3)) 在训练后重新映射 logits 或概率,可以改善平均概率对齐。然而,它们并未显式建模当前序列是否展现出全样本的组织性:集中的频率能量、低光谱扩散、主导性的周期成分以及稳定的相位对齐。0.92 的分数可能源于相干的长程组织,也可能源于脆弱、嘈杂、局部显著的证据。这一点很重要,因为时间序列的可靠性不仅受分数锐度影响,还受到时间依赖性、序列形态以及跨时间和频率的证据分布影响。因此,基于频率的视角很有吸引力,因为近期的时间序列模型表明周期性、块级结构、全局依赖性和频域能量压缩是时间表示的核心 (Wu 等人, 2023 (https://arxiv.org/html/2607.18279#bib.bib17);Nie 等人, 2023 (https://arxiv.org/html/2607.18279#bib.bib18);Yi 等人, 2023 (https://arxiv.org/html/2607.18279#bib.bib20);Liu 等人, 2024 (https://arxiv.org/html/2607.18279#bib.bib19)),并且它能够简洁地描述信号能量是否在整组样本上全局组织,而不仅仅是局部激活。 我们测试的现象是证据差异:输出分数可能很高,但输入缺乏本应使这种置信度可靠的全局时间组织。图1 (https://arxiv.org/html/2607.18279#S1.F1) 应从左到右阅读,依次为问题、光谱审计、可靠性层和掩码诊断。频带能量定位证据质量,熵测量它是扩散还是集中,峰值主导性测试是否少数几个周期成分承载了信号,相位稳定性测试各成分是否相干对齐而非相位分散。这些描述符并非作为正确性的通用预测器提出;它们是针对一种特定失败模式的探针,即分数锐度与时间支持不一致。因此,SEB-Cal 作为一个验证门控的可靠性策略:仅当留出数据显示这种差异信号在不违反高置信度错误约束的情况下改善了排序时,才启用光谱证据。 参照图标题 图 1:事后可靠性的光谱证据捆绑。(A) 同样高置信度的预测可能具有不同的信号结构和正确性结果。(B) 光谱分析揭示了输出分数遗漏的能量集中度、熵、峰值主导性和相位稳定性。(C) SEB-Cal 通过事后可靠性层将置信度条件于光谱证据,产生可靠性估计和频带级诊断。(D) 对排名最高的光谱频带进行掩码,测试可靠性是否遵循诊断结果。 我们通过 SEB-Cal(一种用于时间序列分类的验证门控固定标签可靠性策略)来应对这些差距。骨干网络被冻结,预测标签不变,仅针对该预测的可靠性在留出数据上进行估计。光谱束通过从单个全样本傅里叶变换计算得到的频带能量集中度、光谱熵、峰值主导性和相位稳定性来总结每个序列。这些描述符并非用于改善类别分离;它们测试骨干网络的置信度是否得到全局组织的光谱证据支持。本文的贡献超出了一个新的重校准模块。我们认为,时间序列分类的事后可靠性不应纯粹被视为输出空间变换问题。在许多时间序列场景中,一个高置信度预测是否值得信任,部分取决于证据在输入本身中是如何全局组织的。SEB-Cal 是该论点的具体实例:它将确定性的全样本光谱证据作为事后可靠性信号引入——区别于局部或学习到的表示——并通过经过掩码压力测试的频带级诊断来展示由此产生的置信度调整。 实验正是为了测试该论点而在最困扰时间序列可靠性的条件下进行:异构的时间依赖性、变化的序列形态以及跨时间和频率的不同信息证据分布。因此,我们评估了来自 UCR 和 UEA 档案 (Dau 等人, 2019 (https://arxiv.org/html/2607.18279#bib.bib10);Bagnall 等人, 2018 (https://arxiv.org/html/2607.18279#bib.bib11)) 的八个数据集、涵盖循环、卷积、残差、Inception 风格和 Transformer 风格预测器 (Wang 等人, 2017 (https://arxiv.org/html/2607.18279#bib.bib13);Bai 等人, 2018 (https://arxiv.org/html/2607.18279#bib.bib15);Ismail Fawaz 等人, 2020 (https://arxiv.org/html/2607.18279#bib.bib14);Vaswani 等人, 2017 (https://arxiv.org/html/2607.18279#bib.bib16)) 的八个骨干系列,以及除原始置信度分数之外的六个标准事后重校准器。与仅询问输出分数是否平均更好地匹配正确性的传统校准基准不同,我们的评估提出了三个互补问题:该方法在通用校准质量上是否保持竞争力;在与部署相关的场景中是否改善了正确性感知的可靠性排序;其诊断在干预下是否具有可测量的行为对齐。实证结果是一个具有明确部署规则的选择性可靠性结果。在匹配的评估子集上,SEB-Cal 改进了与选择性预测密切相关的固定标签可靠性指标,包括正确性感知排序、校准误差、负对数似然、虚假高置信度错误率和保留风险行为,完整数值见表1 (https://arxiv.org/html/2607.18279#S5.T1)。准确率和宏 F1 仅作为冻结骨干网络的描述符报告,因为 SEB-Cal 不改变预测标签。在数据集和骨干网络层面,收益是结构化的而非统一的:FordA、ECG200、UWaveGestureLibrary、SelfRegulationSCP1 以及注意力/循环骨干网络提供了最清晰的正收益区间,而其他设置被验证门拒绝。这种模式是该方法的预期行为:当光谱证据在安全约束下改善可靠性时使用它,当输出空间置信度仍然是更安全的决策信号时则拒绝它。 我们的贡献有四方面:(i) 我们识别出时间序列分类中的证据差异作为一种可靠性失败模式,即输出置信度可能很高,但所选预测缺乏全局时间支持;(ii) 我们通过 SEB-Cal 将这一想法实例化,这是一种固定标签的证据条件可靠性策略,使用能量集中度、熵、峰值主导性和相位稳定性的确定性光谱探针来决定输出置信度是否得到时间支持;(iii) 我们引入了一个部署约束门,将区间依赖性转化为显式选择规则,仅当留出验证在不超过 [email protected] 或保留风险容忍度的情况下改善了正确性感知排序时,才使用光谱可靠性;以及 (iv) 我们提供了一个匹配的实证研究,涵盖八个数据集、八个骨干系列、标量校准器、非输出空间比较器、光谱成分消融、时频变体、时域对照和掩码测试。 ## 2 相关工作 事后校准将原始模型分数转换为更好地匹配经验正确性的概率。温度缩放、等渗回归、贝塔校准、向量缩放和狄利克雷校准被广泛使用,因为它们模块化且通常在不重新训练骨干网络的情况下改善概率对齐 (Naeini 等人, 2015 (https://arxiv.org/html/2607.18279#bib.bib4);Guo 等人, 2017 (https://arxiv.org/html/2607.18279#bib.bib1);Kull 等人, 2017 (https://arxiv.org/html/2607.18279#bib.bib2), 2019 (https://arxiv.org/html/2607.18279#bib.bib3))。基准研究表明,校准行为因架构、数据集和指标而异 (Tao 等人, 2023 (https://arxiv.org/html/2607.18279#bib.bib6);Le Coz 等人, 2024 (https://arxiv.org/html/2607.18279#bib.bib7)),这表明仅靠输出分数可能不完整。样本依赖方法如 ProCal 结合了几何或邻域结构 (Xiong 等人, 2023 (https://arxiv.org/html/2607.18279#bib.bib5));而 SEB-Cal 则将可靠性条件于全样本时间组织的确定性输入侧描述符。 时间序列文献日益强调频域视角的价值。诸如 TimesNet、PatchTST 和 iTransformer 等模型表明,强性能通常依赖于捕捉周期性、长程结构和组织化的变化,而这些难以通过简单的逐点时间处理来表现 (Wu 等人, 2023 (https://arxiv.org/html/2607.18279#bib.bib17);Nie 等人, 2023 (https://arxiv.org/html/2607.18279#bib.bib18);Liu 等人, 2024 (https://arxiv.org/html/2607.18279#bib.bib19))。聚焦频率的方法强化了这一直觉。FreTS 认为频域学习提供了全局视角和有效的能量压缩 (Yi 等人, 2023 (https://arxiv.org/html/2607.18279#bib.bib20)),而 FilterNet 使用学习到的频率滤波器更选择性地利用频谱 (Yi 等人, 2024 (https://arxiv.org/html/2607.18279#bib.bib21))。同时,近期工作警告不要对傅里叶特征进行简单化解释,并强调其价值取决于如何处理和解释 (Yang 等人, 2024 (https://arxiv.org/html/2607.18279#bib.bib22))。我们对频率的使用不同于预测建模工作:我们并未围绕频谱重新设计骨干网络,也未声称全局傅里叶表示普遍足够。相反,我们询问一个紧凑的确定性全样本光谱组织摘要是否可以作为事后可靠性信号。 选择性预测和失败检测工作将置信度视为弃权、分诊和保留风险控制的决策信号,而不仅仅是概率报告 (El-Yaniv 和 Wiener, 2010 (https://arxiv.org/html/2607.18279#bib.bib24);Geifman 和 El-Yaniv, 2017 (https://arxiv.org/html/2607.18279#bib.bib25);Traub 等人, 2024 (https://arxiv.org/html/2607.18279#bib.bib9);Zhu 等人, 2023 (https://arxiv.org/html/2607.18279#bib.bib8))。这激发了我们的设置:与仅作用于输出分数的标准事后校准不同,SEB-Cal 将可靠性条件于输出侧校准线索和全样本光谱证据。正式的固定标签流程在公式 (1) (https://arxiv.org/html/2607.18279#S3.E1) 中定义;其设计原理是,仅凭分数锐度可能无法捕捉到信号是否以支持预测信任的方式全局组织、集中且稳定。 可解释性提出了进一步的要求。在高风险场景中,仅提供与决策中实际使用的置信度信号脱节的描述性可视化是不够的 (Rudin, 2019 (https://arxiv.org/html/2607.18279#bib.bib26);Carvalho 等人, 2019 (https://arxiv.org/html/2607.18279#bib.bib27))。因此,SEB-Cal 仅解释可靠性调整本身,而非语义类别决策。这个较窄的目标是有意为之。由于诊断源自驱动可靠性估计的相同光谱特征,其相关性可以通过掩码进行行为测试:被排名为强支持的频带,当被抑制时,应比排名较低的频带导致校准后可靠性的更大下降。因此,可解释性的主张并非现实世界的因果关系,而是经干预测试的与可靠性调整的对齐。 ## 3 问题设置 我们定义 SEB-Cal 估计的固定标签可靠性目标。令 x ∈ ℝ^{C×T} 为多元时间序列,f_θ 为冻结的分类器,z(x) ∈ ℝ^K 为其 logits,ŷ(x) = arg max_k z_k(x),p(x) = softmax(z(x))。事后流程为 z(x) = f_θ(x), ŷ(x) = arg max_k z_k(x), p(x) = softmax(z(x)), (1) h(x) = φ_out(z(x)), g(x) = φ_spec(x), φ(x) = [h(x) ∥ g(x)], φ̄(x)
相似文章
CALIBER:语言模型中推理前后的置信度校准
本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。
CalBrief:大型语言模型证据校准式科学简报的试点诊断基准
本文介绍了CalBrief——一个包含16个证据包和96个人工验证结论的试点诊断基准,用于评估大型语言模型是否能够生成证据校准的科学简报。研究发现,结构化组织能提升推理能力,但显式的强度校准策略过于保守,且这种保守性主要源于标签空间的扩展,而非信号注入。
自我评估已然存在:用极少数据激发基础大语言模型中的潜在评判校准
本文介绍了自我评估激发(SEE)方法,该方法通过校准耦合的强化学习和掩码蒸馏,用极少数据激发基础大语言模型中的潜在评判校准,在保持答案质量的同时提升了跨基准的校准效果。
CALAD: 通道感知对比学习用于多变量时间序列异常检测
提出了CALAD,一个用于多变量时间序列异常检测的通道感知对比学习框架,该框架利用估计的通道相关性构建对比样本,实现了最先进的性能。
基于语义级奖励的LLM校准
提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。