揭示移除预算混淆:自适应数据清洗的匹配操作点评估框架

arXiv cs.LG 论文

摘要

介绍了一种面向操作点的自适应数据清洗评估框架,用于纠正移除预算混淆。在 CIFAR-10 和 ImageNet-100 上的实验表明,当操作点匹配时,表面上的性能提升会消失,这表明许多改进反映的是更小的移除预算,而非真正的损坏判别能力。

arXiv:2608.06511v1 公告类型:新 摘要:自适应数据清洗方法用数据驱动的分区取代了人工过滤阈值。然而,改变分区粒度——即用于按估计损坏风险对样本进行分组的组数——可能会隐式地移动决策边界,并改变被移除样本的总数。这会产生一种称为“移除预算混淆”的偏差:在精确率或假阳性率等指标上表现出的提升,反映的是较小的移除预算,而非更优的损坏判别能力。为解决这一评估偏差,我们提出了一种面向操作点的评估框架,该框架使用匹配预算和匹配召回率的对照,以及阈值无关的指标(AUROC 和 AUPRC)来评估方法。我们在一个多线索自适应清洗器重新设计上测试了该框架,该设计包含重新加权的学习难度线索、辅助的欧氏距离线索,以及旨在分离“干净但困难”样本的更细分区粒度。虽然朴素评估(在各配置自身诱导的操作点上评估配置)表明该重新设计有显著的性能提升,但一旦操作点被均衡,这些增益便消失。假阳性分解显示,“干净但困难”样本在低损坏率下主要驱动错误计数,在中等损坏率下变得依赖阈值,在严重损坏下贡献可忽略不计。在 CIFAR-10 和 ImageNet-100 上的实验表明,当操作点匹配时,朴素评估中观察到的大多数性能差异在低到中等损坏率下会缩小或消失。真正的排序优势仅保留在特定的低流行率设置以及严重损坏下的高召回区域。这些发现强调,自适应清洗方法必须在匹配的操作点下进行基准测试,以确保性能提升反映真正的损坏判别能力。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:01

# 揭示移除预算混淆:一种用于自适应数据清理的匹配工作点评估框架
来源:https://arxiv.org/abs/2608.06511
查看 PDF (https://arxiv.org/pdf/2608.06511)

> 摘要:自适应数据清理方法用数据驱动的分区取代了手动过滤阈值。然而,改变分区粒度(即用于按估计损坏风险对样本进行分组的分组数量)可能会隐式地移动决策边界,并改变被移除样本的总体数量。这会产生一种称为移除预算混淆的偏差,即精度或假阳性率等指标的表面提升反映了更小的移除预算,而非更优的损坏判别能力。为解决这一评估偏差,我们引入了一种工作点感知的评估框架,该框架结合匹配预算和匹配召回率的对照,以及阈值无关指标(AUROC 和 AUPRC)来评估方法。我们在一个多线索自适应清理器重新设计上测试了该框架,该设计包含加权的学习难度线索、辅助的欧氏距离线索,以及旨在隔离“干净但难”样本的更细分区粒度。虽然朴素评估(在各配置自身诱导的工作点上评估配置)表明该重新设计带来了显著的性能提升,但一旦工作点被均衡,这些提升便消失。假阳性分解揭示,“干净但难”样本主要驱动低损坏率下的错误计数,在中度损坏下变得依赖阈值,而在严重损坏下贡献可忽略不计。在 CIFAR-10 和 ImageNet-100 上的实验表明,当工作点匹配时,朴素评估中观察到的大部分性能差异在低到中度损坏下会缩小或消失。真实的排序优势仅在特定的低患病率设置以及严重损坏下的高召回率区域中保留。这些发现强调,自适应清理方法必须在匹配的工作点上进行基准测试,以确保性能提升反映真正的损坏判别能力。

## 提交历史

来自:JungHua Wang \[查看电子邮件 (https://arxiv.org/show-email/e9335786/2608.06511)\] **\[v1\]** 2026年8月6日 星期四 18:50:35 UTC \(367 KB\)

相似文章

CaRE:面向掩码扩散语言模型的计算感知重掩码评估协议

arXiv cs.AI

本文提出 CaRE,一种用于掩码扩散语言模型的计算感知评估协议,它标准化了步数、指标和随机性。该协议表明,先前的比较混淆了算法改进与评估伪影,并揭示温度解释了 MAUVE 的大部分方差,而计算匹配的比较则颠覆了已发表的排名。