标签
本文介绍了一种名为证据对抗训练(EV-AT)的方法,通过结合基于证据的损失与鲁棒证据对齐,改善了分类器的鲁棒性-不确定性权衡,在选择性分类基准上取得了最先进的结果。
本文审计了信号域检测器中用于选择性分类的无分布风险控制方法的可靠性,发现朴素阈值法常常超出其声称的预算,并且可交换性违反导致证书失败。
本文提出使用成对查询来改进二分类中的选择性分类,特别是在置信度估计不一致的情况下(如大语言模型的上下文学习)。理论条件及在合成和真实数据集上的实验表明,基于成对查询的算法比原始置信度估计能实现更好的准确率-成本权衡。