C-Score:开放世界无标签污染下半监督学习的鲁棒性评估超越准确性
摘要
本文介绍了C-Score,一个用于评估在开放世界无标签污染下的伪标签半监督学习的诊断框架,表明干净准确性不足以检测隐藏的性能退化。
arXiv:2608.20667v1 Announce Type: new
摘要:伪标签半监督学习因其简单性和可扩展性而取得了强大性能。然而,它通常是在封闭世界假设下开发的,即无标签数据与标签数据来自同一分布。在实际部署中,无标签数据通常从开放环境中收集,可能包含OOD样本。在这种污染下,OOD样本仍可能获得高置信度预测,并被当作有效目标样本纳入训练。这导致了一个重要的评估问题:即使在SSL的内部学习动态已经恶化的情况下,干净的分布内测试准确性可能看起来稳定。为解决此问题,我们从诊断评估的角度研究了开放世界无标签污染下伪标签SSL中的隐藏崩溃。我们提出了C-Score,一个紧凑的框架,从预测、特征表示和优化三个互补空间评估训练行为。C-Score包括用于无标签预测行为的PLE和CCI,用于偏离标签语义锚点的Sem-Drift,以及用于标签和无标签优化兼容性的Grad-Align。在CIFAR-10和CIFAR-100上的实验,使用多个OOD源、变化污染比例和四种伪标签SSL算法,表明C-Score指标揭示了仅靠干净准确性无法检测到的隐藏退化:在SVHN污染下,CCI上升超过280%,而最佳准确性保持在未污染基线的3%以内;近OOD源(CIFAR-100、STL-10)导致高达14.9%的准确性崩溃(FlexMatch,r=0.5)。结果表明,仅靠干净准确性不足以评估开放世界环境下的SSL鲁棒性,需要在无标签污染下进行更可靠的鲁棒性评估的内部诊断信号。
查看缓存全文
缓存时间: 2026/08/24 04:32
# C-Score:面向开放世界未标注数据污染的半监督学习鲁棒性评估新标准 来源:https://arxiv.org/abs/2608.20667 查看PDF (https://arxiv.org/pdf/2608.20667) > 摘要:基于伪标签的半监督学习因其简洁性和可扩展性取得了优异性能。然而,现有方法通常建立在封闭世界假设下,即未标注数据与标注数据服从相同分布。在实际部署中,未标注数据常来自开放环境,可能包含分布外样本。在这种污染情境下,分布外样本仍可能获得高置信度预测,并被当作有效目标样本参与训练,这引发了重要的评估问题:即使内部学习动态已恶化,干净的域内测试准确率也可能表现稳定。为解决这一问题,我们从诊断评估视角研究开放世界未标注数据污染下基于伪标签的半监督学习隐藏崩塌现象。我们提出C-Score框架,通过预测、特征表示和优化三个互补空间评估训练行为。该框架包含用于未标注预测行为的PLE与CCI指标、衡量偏离标注语义锚点程度的Sem-Drift指标,以及评估标注与未标注数据优化兼容性的Grad-Align指标。在CIFAR-10和CIFAR-100数据集上的实验表明,该框架能揭示单一干净准确率无法检测的隐藏性能退化:在SVHN污染下,CCI上升超过280%而最佳准确率仅偏离无污染基线3%以内;近域分布外数据源(CIFAR-100、STL-10)在FlexMatch算法(r=0.5)中导致最高14.9%的准确率崩塌。研究结果表明,单一的干净准确率不足以评估开放世界环境下的半监督学习鲁棒性,内部诊断信号对于未标注污染下的可靠鲁棒性评估至关重要。 ## 提交历史 来自:TsaoLun Chen \[查看邮件 (https://arxiv.org/show-email/8c8a041f/2608.20667)\] **\[v1\]**2026年8月21日 周五 01:58:39 UTC \(693 KB\)
相似文章
学习对未观测混杂因素鲁棒的风险评分
本文提出了一种从观测数据中学习风险评分的方法,该方法对未观测混杂因素具有鲁棒性,采用敏感性分析和Wasserstein分布鲁棒优化。该方法在传统基准和最先进方法上提高了校准性。
困难案例与不良标签:在有限标签噪声下测试不确定性采样中的误差暴露与误差定位
本研究在有限标签噪声条件下测试主动学习中的不确定性采样,通过比较不同数据集上的误差暴露和误差定位效应,以评估其鲁棒性和性能。
无标签策略下准确性与顺序敏感性出现分化
本文研究了多项选择基准上的无标签策略能否消除大型语言模型对选项顺序的敏感性,发现两阶段提示和独立假设评分均无法可靠地提高准确性。
污染虚增分数,但很少重排大型语言模型排行榜
本文表明,基准污染会提高大型语言模型的绝对分数,但很少改变排行榜排名。通过使用一种控制释义的措施,表明污染在公共模型中大体上是均匀的。
当无基准存在时:验证无真实标签的LLM安全评分比较
本文介绍了一个框架,用于在没有真实标签的情况下验证LLM安全评分比较,通过使用'工具有效性链'来建立部署证据。该方法通过一个名为SimpleAudit的本地优先工具在挪威安全包上进行了演示,并比较了Borealis和Gemma 3等模型。