RUBRIC:面向不平衡分类的实况-效用均衡排序方法

arXiv cs.LG 论文

摘要

RUBRIC是一个与生成器无关的过滤框架,用于不平衡分类,通过平衡实况(通过判别器)和效用(基于边界的评分)来选择合成样本,在信用卡欺诈检测等基准上提高了F1宏观和召回率。

arXiv:2607.09816v1 公告类型:新 摘要:类别不平衡在风险敏感应用(如欺诈检测和医学诊断)中构成了基本挑战,其中少数类样本稀缺但对准确分类至关重要。现有的过采样方法生成合成样本来重新平衡类别分布;然而,它们往往产生大量低质量候选样本,扭曲决策边界或引入伪影,导致过拟合和泛化性能下降。 在这项工作中,我们引入了RUBRIC,这是一个与生成器无关的过滤框架,将合成样本选择形式化为一个质量优先于数量的优化问题。RUBRIC使用实况-效用权衡对候选样本进行排名:实况通过一个训练有素的判别器来量化,该判别器区分真实样本和合成样本,而效用通过一个凹的基于边界的评分函数来捕捉靠近决策边界的程度。我们表明,在温和的正则条件下,所提出的过滤策略通过联合减少分布偏移和抑制近负尾贡献,单调地收紧基于边界分类器的泛化界。 通过在信用卡欺诈检测和其他不平衡基准上的广泛实验,我们证明RUBRIC在多个生成器上提高了F1宏观和召回率,同时保持了相当的ROC-AUC。我们还提供了明确的λ敏感性分析,以展示当排名质量优先时用户如何恢复AUPRC。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:14

# 1 引言
来源:https://arxiv.org/html/2607.09816
RUBRIC:面向不平衡分类的真实性-效用平衡排序

Yanxuan Yu¹,*  Dong Liu²,*  Renata Borovica\-Gajic³  Ying Nian Wu²

¹哥伦比亚大学  ²加州大学洛杉矶分校  ³墨尔本大学

¹yy3523@columbia\.edu  ²pikeliu@ucla\.edu  ³renata\.borovica@unimelb\.edu\.au  ²ywu@stat\.ucla\.edu

*共同第一作者。

###### 摘要

类别不平衡在欺诈检测和医疗诊断等风险敏感应用中构成根本性挑战,这些场景中少数类样本稀缺但对准确分类至关重要。现有过采样方法通过生成合成样本来重新平衡类别分布;然而,它们往往产生大量低质量候选样本,这些样本会扭曲决策边界或引入伪影,导致过拟合和泛化能力下降。在本工作中,我们引入RUBRIC,一个生成器无关的筛选框架,将合成样本选择形式化为一个质量优先于数量的优化问题。RUBRIC利用真实性-效用权衡对候选样本进行排序:真实性通过一个训练用于区分真实与合成样本的判别器进行量化,而效用则通过一个基于边界的凹评分函数捕捉与决策边界的接近程度。我们证明,在温和的正则性条件下,所提出的筛选策略通过联合减少分布偏移和抑制近负尾部贡献,单调收紧基于边界的分类器的泛化界。通过在信用卡欺诈检测和其他不平衡基准上的广泛实验,我们展示了RUBRIC在多个生成器上改善了F1宏平均值和召回率,同时保持可比的ROC-AUC,并进行了显式的λ敏感性分析,展示了当排序质量优先时用户如何恢复AUPRC。

严重的类别不平衡广泛存在于风险筛查和医疗决策支持中[He and Garcia (2009)](https://arxiv.org/html/2607.09816#bib.bib2); [Krawczyk (2016)](https://arxiv.org/html/2607.09816#bib.bib7)。我们聚焦于具有公开、高度不平衡表格基准(例如欺诈检测)的风险筛查场景,其中极端偏斜常见且评估可重现。标准应对措施是对少数类进行过采样,然而广泛使用的生成器可能产生大量低质量候选样本。例如,SMOTE [Chawla et al. (2002)](https://arxiv.org/html/2607.09816#bib.bib1) 在局部邻域内插值;若不加控制,合成点可能不真实,或推动决策边界进入真实数据不支持的区域。

大多数先前工作关注*在哪里*合成少数样本。边界感知变体强调困难区域,而基于GAN的方法通过对抗训练追求更高的样本真实性[Douzas and Bacao (2018)](https://arxiv.org/html/2607.09816#bib.bib8); [Fiore et al. (2019)](https://arxiv.org/html/2607.09816#bib.bib9)。然而,真实性和下游效用并不等同:一个看似合理的样本可能对学习无信息甚至有害,而激进地聚焦边界的合成可能放大分布偏移。

我们的前提是正交的。我们不设计新的生成器,而是询问*哪些*合成样本应该保留。我们提出RUBRIC,一个生成器无关的后过滤器,为每个候选样本 \(\tilde{x}\) 评分:(i) 相对于目标分类器家族的边界效用 \(u(\tilde{x})\) 和 (ii) 来自判别器的真实性评分 \(r(\tilde{x})\),该判别器经过训练以区分真实与合成样本。RUBRIC随后在预算下选择一个固定大小的子集,该子集最优地权衡了效用和真实性。虽然我们的实验强调欺诈和风险基准,但相同的选择原理适用于其他高风险不平衡领域,包括医疗决策支持。

我们进一步证明,在温和的正则性条件下,选择性筛选单调收紧基于边界的泛化界(第4节),通过联合减少分布偏移并抑制近负尾部贡献。经验上,在信用卡欺诈检测和其他不平衡基准上,RUBRIC在固定选择预算下改善召回率和F1,同时保持可比的ROC-AUC,并且我们显式地描述了在激进边界优先化下AUPRC何时可能下降。

总之,本工作做出以下贡献:

- • 我们引入了一个生成器无关的后过滤器,将合成样本选择形式化为一个带约束的效用-真实性优化问题。
- • 我们提供了理论,证明在温和假设下选择性筛选收紧基于边界的泛化界。
- • 我们将固定合成预算下的多样性感知选择建模为单调子模最大化问题,并使用具有 \((1-1/e)\) 近似保证的贪心算法 [Nemhauser et al. (1978)](https://arxiv.org/html/2607.09816#bib.bib56); [Krause and Golovin (2014)](https://arxiv.org/html/2607.09816#bib.bib57)。
- • 我们在多个不平衡基准上展示了持续改进,并对真实性-效用权衡、预算行为和度规行为进行了显式分析。

## 2 相关工作

不平衡学习方法通常根据其对少数样本生成的处理方式进行分类。经典的基于插值的方法如SMOTE [Chawla et al. (2002)](https://arxiv.org/html/2607.09816#bib.bib1) 及其变体强调局部邻域、边界区域或自适应难度加权 [He et al. (2008)](https://arxiv.org/html/2607.09816#bib.bib4); [Han et al. (2005)](https://arxiv.org/html/2607.09816#bib.bib3); [Last et al. (2018)](https://arxiv.org/html/2607.09816#bib.bib17); [Bunkhumpornpat et al. (2009)](https://arxiv.org/html/2607.09816#bib.bib22)。基于GAN的方法旨在通过对抗训练提高真实性 [Douzas and Bacao (2018)](https://arxiv.org/html/2607.09816#bib.bib8); [Fiore et al. (2019)](https://arxiv.org/html/2607.09816#bib.bib9); [Mariani et al. (2018)](https://arxiv.org/html/2607.09816#bib.bib25),而诸如MWMOTE [Barua et al. (2014)](https://arxiv.org/html/2607.09816#bib.bib23) 等技术则融入多数类结构。尽管有这些进展,综合调查 [Fernández et al. (2018)](https://arxiv.org/html/2607.09816#bib.bib24); [Haixiang et al. (2017)](https://arxiv.org/html/2607.09816#bib.bib41); [Johnson and Khoshgoftaar (2019)](https://arxiv.org/html/2607.09816#bib.bib42) 指出在平衡样本合理性与下游有效性方面仍存在持续挑战。

我们的工作与这些方法互补。我们不修改样本生成的*方式*或*位置*,而是引入一种生成后筛选视角,对合成候选样本进行排序和选择。这使得RUBRIC区别于生成器特定的改进,并允许其与任何过采样方法堆叠使用。代价敏感学习 [Elkan (2001)](https://arxiv.org/html/2607.09816#bib.bib37); [Zhou and Liu (2006)](https://arxiv.org/html/2607.09816#bib.bib38) 和基于集成的重采样 [Galar et al. (2012)](https://arxiv.org/html/2607.09816#bib.bib39); [Seiffert et al. (2010)](https://arxiv.org/html/2607.09816#bib.bib40) 通过重新加权或数据选择解决不平衡问题,但并未显式地基于真实性和边界效用对合成候选样本进行评分或筛选。自适应多任务到单任务迁移 [Liu and Yu (2025b)](https://arxiv.org/html/2607.09816#bib.bib58) 提供了在任务漂移下稳定少数类学习的互补视角。

理论上,我们基于判别器的真实性评分与密度比估计 [Sugiyama et al. (2012)](https://arxiv.org/html/2607.09816#bib.bib30) 和分布偏移分析 [Ben-David et al. (2010)](https://arxiv.org/html/2607.09816#bib.bib49); [Duchi and Namkoong (2021)](https://arxiv.org/html/2607.09816#bib.bib19); [Pinsker (1964)](https://arxiv.org/html/2607.09816#bib.bib35) 相关。我们的效用公式基于边界泛化理论 [Schapire et al. (1998)](https://arxiv.org/html/2607.09816#bib.bib33); [Bartlett and Mendelson (2002)](https://arxiv.org/html/2607.09816#bib.bib18); [Koltchinskii and Panchenko (2002)](https://arxiv.org/html/2607.09816#bib.bib31),从而能够实现显式的过量风险收紧保证。近期工作探索了SMOTE候选池的边界感知筛选 [Yu et al. (2025)](https://arxiv.org/html/2607.09816#bib.bib54);RUBRIC通过将选择形式化为带预算的真实性-效用优化问题并附带生成器无关的理论,扩展了这一思路。在长上下文表示方面的正交进展——语义感知分词 [Liu and Yu (2026b)](https://arxiv.org/html/2607.09816#bib.bib59)、层次化段-图记忆 [Liu and Yu (2025a)](https://arxiv.org/html/2607.09816#bib.bib60)、以及记忆键控注意力 [Liu et al. (2026)](https://arxiv.org/html/2607.09816#bib.bib61)——与可扩展的KV缓存服务 [Liu and Yu (2026a)](https://arxiv.org/html/2607.09816#bib.bib62) 一起,在将真实性-效用筛选扩展到表格数据之外时具有互补性。

## 3 方法

现在我们描述RUBRIC,包括问题设置、对抗筛选目标,以及由此产生的选择过程如何支撑我们的理论分析。

### 3.1 问题设置

令 \(\mathcal{X}\subset\mathbb{R}^d\) 表示特征空间,\(\mathcal{Y}=\{0,1\}\) 表示标签空间(少数类为 \(=1\))。我们观察到 \(n_0\) 个多数样本和 \(n_1\) 个少数样本,其中 \(n_1\ll n_0\),从 \(P(X,Y)\) 中独立同分布采样。一个过采样器 \(\mathsf{Gen}\) 生成一个合成候选多重集 \(\mathcal{S}=\{\tilde{x}_i\}_{i=1}^m\),旨在近似少数类流形 \(\mathcal{M}=\mathrm{supp}(P(X\mid Y{=}1))\)。

当 \(\mathsf{Gen}{=}\text{NONE}\) 时的候选生成。尽管RUBRIC设计用于在外部生成器之后运行,我们也评估了一种NONE设置,其中候选样本通过一种轻量级、无生成器的机制产生。这产生了NONE\_RUBRIC,我们筛选后生成设计的一个自包含实例。该过程的详细技术细节,包括最近邻插值、边界导向扰动以及可选的基于KDE的重采样,在附录中给出。

### 3.2 对抗筛选目标

RUBRIC一次性训练两个辅助模型,然后冻结它们用于候选评分。术语*对抗*仅指判别器在区分真实与合成样本中的作用;我们不采用迭代对抗训练。

训练顺序。两个辅助模型在候选评分之前训练:(i) *边界模型* \(f:\mathcal{X}\to\mathbb{R}\) 仅在实际训练数据 \(\mathcal{D}\) 上训练(以少数类为正类)以生成边缘分数。最终分类器从未在合成候选上训练。(ii) *判别器* \(D:\mathcal{X}\to[0,1]\) 被训练来区分真实少数样本与合成候选池 \(\mathcal{S}\),将 \(\mathcal{S}\) 视为负类。

对于一个候选样本 \(\tilde{x}\),我们定义:

\[
u(\tilde{x}) \triangleq g\!\left(\mathrm{margin}_{f}(\tilde{x})\right), \tag{1}
\]
\[
r(\tilde{x}) \triangleq \log\frac{D(\tilde{x})}{1-D(\tilde{x})}. \tag{2}
\]
其中 \(\mathrm{margin}_{f}(x)=f(x)\) 的方向使得更大的值表示对少数类的更高亲和性。

效用整形函数 \(g\)。整形函数 \(g:\mathbb{R}\to\mathbb{R}_{\geq 0}\) 是一个凹的、非递减的函数(默认:\(g(t)=\log(1{+}e^{t/\tau})\),温度 \(\tau{>}0\))。凹性对大边缘产生*递减收益*:靠近决策边界的样本获得最高的边际效用,而远离边界的易正类贡献较小。这优先考虑信息丰富的近边界区域,而不过度加权平凡情形。在理论分析(第4节)中,\(g\) 的凹性和Lipschitz性质导致近负尾部贡献的指数级抑制(引理4.6)。

判别器logit与密度比。RUBRIC使用判别器对候选池进行*相对排序*,而非绝对密度估计。当 \(D\) 被训练来区分真实少数样本(\(+\))与合成候选(\(-\))时,贝叶斯最优判别器满足 \(D^*(x)=\frac{p(x)}{p(x)+q(x)}\),其中 \(p(x)\equiv p(x\mid Y{=}1)\) 是真实少数类密度,\(q(x)\) 是候选密度。取log-odds精确得到身份 \(\log\frac{D^*(x)}{1-D^*(x)}=\log\frac{p(x)}{q(x)}\)。在实践中,我们通过估计误差对偏差进行建模(假设4.1);即使在校准不佳的情况下,RUBRIC仍然有效,因为选择依赖于分数顺序,而非绝对logit值。我们在第4节利用近似密度比关系,通过Pinsker不等式来界定分布偏移。

\(u\) 和 \(r\) 的量纲。效用 \(u\) 和真实性 \(r\) 不必处于相同的原始量纲:对于典型的整形函数 \(u\) 是有界的(例如,对于截断形式 \(g(t)\leq\tau\)),而 \(r\) 是无界的。选择依赖于*组合排序分数* \(s(\tilde{x})=\lambda u+(1{-}\lambda)r\);只有给定 \(\lambda\) 下的相对排序重要,而非绝对幅度。因此权衡参数 \(\lambda\) 直接控制由所选训练分布诱导的精确率-召回率运行状态。

给定权衡参数 \(\lambda\in[0,1]\) 和选择预算 \(K\),RUBRIC求解:

\[
\max_{\mathcal{U}\subseteq\mathcal{S},\ |\mathcal{U}|=K}\ \underbrace{\sum_{\tilde{x}\in\mathcal{U}}\Big(\lambda\,u(\tilde{x})+(1{-}\lambda)\,r(\tilde{x})\Big)}_{\text{真实性–效用分数}}\;+\;\underbrace{\gamma\,\mathrm{Div}(\mathcal{U})}_{\text{多样性(子模)}}, \tag{3}
\]
其中 \(s(\tilde{x})=\lambda u(\tilde{x})+(1{-}\lambda)r(\tilde{x})\),\(\gamma\geq 0\) 控制多样性。我们将 \(\mathrm{Div}(\cdot)\) 实例化为候选池上的设施位置覆盖函数:

\[
\mathrm{Div}(\mathcal{U})\triangleq\sum_{\tilde{x}\in\mathcal{S}}\max_{\tilde{u}\in\mathcal{U}}\kappa(\tilde{x},\tilde{u}), \tag{4}
\]
其中 \(\kappa\) 是相似性核(例如,特征空间中的RBF或 \(k\)NN图相似性)。

###### 命题3.1(式(3)的子模性)。

式(4)中的设施位置函数 \(\mathrm{Div}(\cdot)\) 是单调子模的。组合目标 \(F(\mathcal{U})=\sum_{\tilde{x}\in\mathcal{U}}s(\tilde{x})+\gamma\,\mathrm{Div}(\mathcal{U})\) 在基数约束下因此是单调子模的。在 \(|\mathcal{U}|=K\) 约束下对 \(F\) 进行贪心最大化实现 \((1{-}1/e)\) 近似于最

相似文章

逆评分优化:智能体科学的测试平台

Hacker News Top

Fulcrum Research 提出了逆评分优化(IRO),这是一个用于研究长期智能体行为的测试平台,其中智能体必须优化黑箱法官的偏好。该方法实现了平滑扩展和丰富的行为分析,实验表明,Fable 5 和 Opus 4.6 等前沿模型具有不同的扩展特性。

C2:基于二元偏好的可扩展评分增强奖励建模

Hugging Face Daily Papers

C2 提出了一种可扩展的评分增强奖励建模框架,该框架仅通过二元偏好训练一个协作的评分生成器和一个批判性验证器,无需昂贵的评分标注,同时在 RM-Bench 上实现了最高 6.5 分的提升。

RUBAS:基于评分标准的强化学习智能体安全框架

arXiv cs.LG

RUBAS 是一个面向智能体安全的评分标准强化学习框架,将 LLM 智能体行为分解为四个维度——工具使用安全性、参数安全性、响应安全性和有用性——在完整轨迹上提供细粒度奖励。实验表明,RUBAS 在标准对齐基线基础上提升了安全性,同时减少了工具相关的幻觉现象,并保持了具有竞争力的实用性。

生物医学二分类中不平衡处理方法的系统评估

arXiv cs.LG

本文系统评估了五种不平衡处理方法(RUS、ROS、SMOTE、重加权、直接F1优化)在三个生物医学数据集(表格、文本、图像)上使用不同复杂度模型的效果。结果表明,收益取决于模型复杂度和数据模态,其中ROS、重加权和直接F1优化对非结构化数据上的复杂模型有效。