使用两个判别器区分协变量偏移与机制变化:CJSD,一种具有精确协变量-概念分解的条件差异度量

arXiv cs.LG 论文

摘要

本文提出了CJSD,一种使用两个判别器来精确区分数据集中的协变量偏移与机制变化的方法,具有理论保证和实证结果。

arXiv:2608.19885v1 公告类型:新 摘要:维护专家模型池的流式系统必须反复决定是为到达的数据重用现有专家、生成新专家还是延迟。我们提出了一种决策层,使三种结果都具有统计意义。重用和生成被设定为基于条件(机制级别)差异的单侧序列假设,由无关区间分隔;延迟正好是两个投注e-过程都未积累足够证据的状态。我们证明了可预测判别器序列的观测代理差异具有有限时间任意时点有效性,以及无条件单侧转移到总体量,其中每侧的松弛是单个判别器的多余风险;经验观察到的向下偏差规律性使得生成侧恰好是保守的。通过重启的e-检测器获得时效性而不牺牲保证:一组在几何间隔重启时间(O(log t)内存)的未加窗投注超鞅,误差预算在重启实例上分配,这保持了生命周期任意时点有效性;在专家创建顺序上分配同样控制了对无限多专家的多重性。在合成多概念流、Electricity、Covertype和复发频繁的INSECTS基准上,实例分配的重启库在切换后实现了零错误生成和零错误重用,并达到或超过了退役的加窗启发式(INSECTS复发准确率0.675),使得部署的算法和保证的算法合二为一。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:29

# 使用两个判别器区分协变量偏移与机制变化:条件差异度 CJSD(精确的协变量–概念分解)  
来源:https://arxiv.org/html/2608.19885  
Kentaro Oda  
附属机构:鹿儿岛大学信息管理技术中心  
邮箱:[[email protected]](mailto:)

###### 摘要  

在已知输入 \(X\) 后,标签 \(Y\) 关于样本所属数据集能提供多少*额外*信息?这个单一量值——可通过两个判别器的留出交叉熵之差进行估计,即 \(D_{\mathrm{CJS}} = \mathrm{CE}(Z \mid X) - \mathrm{CE}(Z \mid X, Y)\)——恰好是数据集中协变量偏移无法解释的那部分差异。判断两个监督学习问题是否共享相同的输入–输出机制,是持续学习中专家复用、漂移类型诊断和类别发现的核心基础操作。现有的任务比较方法可分为两类,各有盲点:基于输入分布距离的方法(如 MMD、Wasserstein)对 \(P(Y \mid X)\) 的变化不敏感,而基于交换评估的方法(如交叉学习分数)则混淆了协变量偏移与机制变化,因为模型在训练支持域之外进行评估时会产生外推误差。我们提出*条件 Jensen–Shannon 差异度*(CJSD):通过任务指标 \(Z\),互信息链式法则 \(I(Z; X, Y) = I(Z; X) + I(Z; Y \mid X)\) 将总任务差异*精确*分解为协变量轴和功能轴,其中功能轴可通过两个判别器(一个仅见 \(x\),另一个见 \((x, y)\))的留出交叉熵之差进行估计,而无需训练任务特定的预测器、生成模型或自助法替代模型。我们证明了协变量零性质(在纯协变量偏移下功能轴精确为零,无论偏移多严重)、漂移质量定律(\(D_{\mathrm{CJS}} / \ln 2\) 等于确定性标签的分歧区域质量)、单侧误设控制不等式(损失差距估计量至多超过 \(D_{\mathrm{CJS}}\) 为 \(x\)-判别器的超额风险,至多不足为 \((x, y)\)-判别器的超额风险,因此每个单侧决策仅依赖单一超额风险),以及基于固定测度的度量化(通过似然比恒等式从判别器中可识别条件分布,从而在固定参考测度下得到机制间的真实度量;而该量对本身可证不是度量)。实证上,在涵盖合成数据、电力数据和 Covertype 数据对族(202 对;另有针对 INSECTS、MNIST 和 CIFAR-10 的独立实验)的十项指标测试中,仅有两种条件信息估计器——CJSD 与基于邻域插入的条件互信息估计——能在漂移质量敏感度相等的条件下,以 AUC 1.0(其他方法为 0.0–0.90)将概念偏移与协变量偏移干净地区分开来;CJSD 相较于插入估计器的优势在于实用性而非估计目标(见第5节);我们展示了其在合成数据保真度审计、漂移类型诊断、标注漂移检测和公平性审计中的下游价值。

## 1 引言  

在线系统维护一组预测模型时,必须反复回答一个问题:*现在到达的数据是否与现有模型训练数据所遵循的输入–输出机制相同?*若在一个方向上错误回答,则会浪费容量(为已有专家已能解释的数据生成新专家);若在另一个方向上错误,则会污染专家(吸收标注机制已变化的数据)。该问题也是漂移类型诊断(是否应重新训练或重新加权)、动态类别发现(这是新类别还是旧类别的新表现?)以及数据流水线质量控制(标注指南是否改变?)的基础。

两类任务比较方法占主导地位。*基于输入分布距离*的方法(如 MMD、最优传输)比较 \(P(X)\),天生对机制变化不敏感。*基于交换评估*的方法为每个任务训练一个预测器并进行交叉评估:最近提出的交叉学习分数(CLS)[1]对交换预测器的超额风险进行对称化,在总体层面上等同于我们称为 CPD 的互逆遗憾量。基于交换评估的方法确实对机制变化有响应,但我们指出其存在结构性混淆:在*纯协变量偏移*下(\(P(Y \mid X)\) 相同,\(P(X)\) 变化),交换后的模型在其训练支持域之外被评估,其外推误差被伪装为机制变化。在一个二维基准测试中,当支持域分离时,交换分数从 0.001 膨胀到 0.346,而机制并无任何变化;共享深度编码器并未消除这种影响(在 90° 输入旋转下为 0.80)。

我们采取不同的路径。将两个数据集与任务指标 \(Z\) 合并,考虑 \(Z\) 的可识别程度。互信息链式法则  
\[ I(Z; X, Y) = \underbrace{I(Z; X)}_{\text{协变量轴 } I_x} + \underbrace{I(Z; Y \mid X)}_{\text{功能轴 } D_{\mathrm{CJS}}} \]  
将总差异分解为输入所能解释的部分,以及仅由输入–输出关系所解释的部分。两项均可通过两个判别器进行估计:\(T_1: x \mapsto Z\) 和 \(T_2: (x, y) \mapsto Z\),利用在留出数据上的  
\[ \widehat{D_{\mathrm{CJS}}} = \mathrm{CE}(Z \mid X) - \mathrm{CE}(Z \mid X, Y) \]  
(图1)。无需训练任务特定的预测器,因此没有任何内容在支持域之外进行评估;与基于分类器的条件互信息估计器 [2] 和条件独立性检验 [3] 不同,也不需要生成模型或最近邻自助法。

数据集 \(A\):\((x, y)\),\(Z=0\)  
数据集 \(B\):\((x, y)\),\(Z=1\)  
合并 + 交叉拟合 \(T_1: x \to Z\),\(T_2: (x, y) \to Z\)  
\(\widehat{I_x} = \ln 2 - \mathrm{CE}_1\)(协变量轴)  
\(\widehat{D}_{\mathrm{CJS}} = \mathrm{CE}_1 - \mathrm{CE}_2\)(功能轴)  
留出 \(\mathrm{CE}_1\)、留出 \(\mathrm{CE}_2\)  

图1:完整估计器。两个普通分类器预测数据集指标 \(Z\),一个仅基于 \(x\),另一个基于 \((x, y)\);将它们的留出交叉熵相减即得功能轴——在 \(X\) 已知后 \(Y\) 所添加的关于 \(Z\) 的信息。没有任何内容在其训练支持域之外被评估。

### 贡献  
(1)我们定义了 CJSD,并推导其基本表示(加权条件 Jensen–Shannon 散度)及精确的两轴分解(式1)。  
(2)我们证明了四个使其适合作为基础决策操作的性质:*协变量零*定理(命题1)、*漂移质量*定律(命题2)、*单侧误设控制*不等式(命题4:每个误差方向均由单个判别器的超额风险界定,对另一方无任何假设),以及*基于固定测度的度量化*与可识别性引理,可从判别器恢复两个条件分布(命题3,引理2)。  
(3)我们给出一个简单的交叉拟合估计器,具有成对置信区间,对样本量不对称具有鲁棒性(通过设计平衡),其误设偏差在所有主要基准配置中一致偏低(这是一个经验上的细化,强化但未承载单侧保证;附录 A 给出了一个在已证明松弛范围内符号反转的工程化反例)。  
(4)在涵盖三个数据对族的十种竞争指标上(另有专门实验中的进一步数据集),仅有两种条件信息估计器(CJSD 和基于 kNN 的条件互信息插入估计)能在漂移质量敏感度相等的条件下,以 AUC 1.0(其他方法为 0.0–0.90)干净地区分概念偏移与协变量偏移;CJSD 相较于插入估计器的优势在于实用性而非估计目标(第5节);我们展示了其在合成数据保真度审计、漂移类型诊断、标注漂移检测和公平性审计中的下游价值。

## 2 相关工作  

基于交换评估与监督任务相似性。CLS [1] 对交换超额风险进行对称化;Taskonomy、LEEP、LogME 估计定向可迁移性;OTDD [6] 在特征和标签上联合传输;Task2Vec [7] 通过 Fisher 信息嵌入任务——这些均以迁移或全局相似性为目标,而非可观测区域上的条件机制等价性。它们量化*已训练模型的复用风险*,混合了机制变化与支持域不匹配;我们的实验量化了这种混淆。而 CJSD 在两者均可观测的区域上比较机制本身。  
基于输入分布与表示距离。MMD、OT/W2、CKA 比较 \(P(X)\) 或内部表示;它们对 \(P(Y \mid X)\) 不敏感(在我们的概念–协变量任务中 AUC 为 0.0)。  
条件双样本检验与条件互信息估计。\(P(Y \mid X)\) 的条件等价性可通过密度比约简或保序设备 [4,5] 进行检验;条件互信息可通过分类器加上生成/自助法替代模型进行估计 [2,3]。我们的估计器既不需要替代模型,目标也不同:不是 p 值,而是一个*有界的、可归一化的、可分解的差异度*(在其固定测度形式下可度量化),可用于调控在线决策。  
漂移检测。错误流检测器(ADWIN、DDM)隐含假设机制变化;输入空间检测器(D3)仅检测协变量偏移。CJSD 的两轴可诊断类型(第6节)。

## 3 条件 Jensen–Shannon 差异度  

令任务 \(A, B\) 在 \(\mathcal{X} \times \mathcal{Y}\) 上具有法则 \(P_T = P_T^X \otimes \eta_T(\cdot \mid x)\),\(\|\mathcal{Y}\| = K\)。抽取 \(Z \sim \mathrm{Bern}(1/2)\),且 \((X, Y) \mid Z=T \sim P_T\);令 \(\tilde{\mu} = \frac{1}{2}(P_A^X + P_B^X)\),\(w(x) = P(Z=A \mid X=x)\)。

###### 引理 1(表示)  

\(I(Z; X) = \mathrm{JS}(P_A^X, P_B^X)\) 且  
\(D_{\mathrm{CJS}} := I(Z; Y \mid X) = \mathbb{E}_{x \sim \tilde{\mu}} \left[ \mathrm{JS}_{w(x)} \big( \eta_A(\cdot \mid x), \eta_B(\cdot \mid x) \big) \right]\),  
其中 \(\mathrm{JS}_w(p, q) = H(wp + (1-w)q) - wH(p) - (1-w)H(q)\)。此外式 (1) 成立,且 \(0 \leq D_{\mathrm{CJS}} \leq \ln 2\)。

###### 命题 1(协变量零)  

若对于 \(\tilde{\mu}\)-几乎处处的 \(x\),\(\eta_A(\cdot \mid x) = \eta_B(\cdot \mid x)\),则对于*任意*的 \(P_A^X, P_B^X\)(包括支持域不相交),\(D_{\mathrm{CJS}}(A, B) = 0\)。反之,\(D_{\mathrm{CJS}} = 0\) 意味着在 \(w(x) \in (0,1)\) 的 \(\tilde{\mu}\)-几乎处处 \(x\) 上,\(\eta_A = \eta_B\)。

###### 命题 2(漂移质量定律)  

若 \(P_A^X = P_B^X = P_X\) 且两个标签均为确定性的,即 \(\eta_T(\cdot \mid x) = \delta_{f_T(x)}\),则  
\(D_{\mathrm{CJS}}(A, B) = \ln 2 \cdot P_X \big( f_A(X) \neq f_B(X) \big)\)。

###### 引理 2(重构)  

在 \(w(x) \in (0,1)\) 处,令 \(q_y(x) = P(Z=A \mid X=x, Y=y)\),混合条件概率 \(m(y \mid x)\),则  
\(\rho_y(x) := \frac{\eta_A(y \mid x)}{\eta_B(y \mid x)} = \frac{q_y}{1 - q_y} \cdot \frac{1 - w}{w}\),  
且 \(\eta_B(y \mid x) = \frac{m(y \mid x)}{w(x) \rho_y(x) + 1 - w(x)}\),\(\eta_A = \rho_y \eta_B\)。因此,对于任意有限 \(K\),两个条件分布均可从 \((T_1, T_2)\) 加上一个混合标签模型中识别。

###### 命题 3(基于固定测度的度量化)  

对于固定参考测度 \(\mu\),  
\(d_\mu(A, B) := \sqrt{ \mathbb{E}_{x \sim \mu} \, \mathrm{JS}_{1/2} \big( \eta_A(\cdot \mid x), \eta_B(\cdot \mid x) \big) }\)  
是模 \(\mu\)-零集下条件分布上的一个度量。若使用依赖于数据对的混合分布代替 \(\mu\),则三角不等式不成立(在支持域异构的随机三元组中,11% 的数值反例)。

### 轴的互斥性  

由于 \(I(Z; X, Y) \leq H(Z) = \ln 2\),链式法则强制 \(D_{\mathrm{CJS}} \leq \ln 2 - I_x\):严重的协变量可分性限制了*可观测的*功能信号。轴是可加的而非正交的;大的 \(I_x\) 意味着小的 \(D_{\mathrm{CJS}\) 是不确定的,决策层必须推迟而非得出“无机制变化”的结论。

证明见附录 A。这些命题共同界定了条件差异度所能诚实宣称的范围:差异在两者机制均可观测的区域(\(w \in (0,1)\))内测量;在该区域外,CJSD 报告*零,而非虚构的差异*——而协变量轴 \(I_x\) 报告输入的可分程度,这通过互斥不等式限制了可观测的功能信号;决策层将此类情况路由至*推迟*。

## 4 估计  

### 假设  

全文中:(A1)预测概率被裁剪到 \([\epsilon, 1-\epsilon]\),使逐点损失有界;(A2)估计采用交叉拟合,因此每个留出损失由未在该点上训练的模型计算;(A3)任务先验为 \(\mathrm{Bern}(1/2)\),通过平衡子抽样强制执行。在(A1)–(A3)下,若两个判别器的对数损失风险一致(即 \(\mathrm{CE}(T_1) \to H(Z \mid X)\),\(\mathrm{CE}(T_2) \to H(Z \mid X, Y)\) 依概率收敛),则 \(\widehat{D_{\mathrm{CJS}}} \to D_{\mathrm{CJS}}\);在固定干扰量下,配对差异服从中心极限定理,这即是所报告区间跟踪的基础(我们不主张在模型选择下具有有限样本覆盖率)。

在 \(\{(x_i, z_i)\}\) 上训练 \(T_1\),在 \(\{((x_i, y_i), z_i)\}\) 上训练 \(T_2\)。

相似文章

CDS: 空间图中结构化干预的反事实方向性评分

arXiv cs.LG

本文介绍了CDS,一种用于估计空间图中节点群体之间方向性影响的反事实方向性评分。该框架训练了一个邻居影响模型(NIM),并应用结构化干预来测量节点状态对邻域扰动的敏感性。

概念调制模型:可识别性与外推的统一框架

arXiv cs.LG

本文介绍了概念调制模型(CMMs),一个用于条件生成模型可识别性和外推的统一框架。它表明,已观测属性上的特征一致性通过属性势产生约束,从而使得代数外推准则能够恢复并泛化现有结果。