谁在哪里胜出?局部优越性的共形模型比较
摘要
引入了一种共形化的分割样本框架,用于局部模型比较,生成经过校准的局部最佳模型图,并为声明局部优越性提供有限样本保证。
arXiv:2607.29053v1 公告类型:新
摘要:标准模型比较是全局性的,在协变量空间上聚合损失以声明单一胜者。这可能掩盖异构性能,即不同模型在不同区域更受青睐。我们引入了共形化局部模型比较,这是一种分割样本框架,用于构建经过校准的局部最佳模型图。给定一个模型比较分数,例如两个平方损失之间的差值,该方法使用三个不相交的分割来拟合竞争模型,从样本外分数估计局部中心和尺度,并对残差不确定性进行共形校准。在目标点,该过程仅当单侧共形边界排除平局时声明局部胜者,分数的符号决定受青睐的模型。我们证明了对已实现未来比较分数的单侧错误声明的有限样本边际控制,建立了平局边界之外局部化均值分数估计器的逐点一致性,表明聚合比较可能与局部优越性的普遍性严重不一致,并推导出平方损失偏差-方差分解,阐明模型结构如何影响局部胜出。合成和真实数据实验表明,该方法能够恢复异构胜者区域,在不确定性下弃权,并产生比全局选择更高的条件增益。
查看缓存全文
缓存时间: 2026/08/03 07:35
# 谁在何处胜出?局部优势的保形模型比较 来源:https://arxiv.org/html/2607.29053 Yi Zhou Baishi Li Xuan Yao Ke-Wei Huang 亚洲数字金融研究所,新加坡国立大学 [email protected]@u.nus.edu [email protected]@nus.edu.sg ###### 摘要 标准模型比较是全局性的,它在协变量空间上聚合损失以宣告单一胜者。这可能掩盖异质性表现——不同模型在不同区域可能更优。我们提出*保形化局部模型比较*(conformalized local model comparison),一个用于构建经校准的局部最优模型图的样本拆分框架。给定一个模型比较分数,例如两个平方损失之差,该方法使用三个不相交的拆分来拟合竞争模型、基于样本外分数估计局部中心与尺度,并对残差不确定性进行保形校准。在目标点处,仅当单侧保形界排除平局时,该流程才宣告局部胜者,分数的符号决定被偏好的模型。我们证明了对已实现未来比较分数上的单侧错误宣告具有有限样本边际控制,建立了平局边界之外局部化均值分数估计量的逐点一致性,展示了聚合比较可能与局部优势的普遍性严重不一致,并推导了一个平方损失偏差–方差分解,以阐明模型结构如何影响局部胜出。合成数据与真实数据实验表明,该方法能够恢复异质性胜者区域、在不确定性下弃权,并比全局选择产生更高的条件增益。我们的代码可在 https://anonymous.4open.science/r/Model-Winner-submission-DD01/ 获取。 ## 1 引言 模型比较是机器学习的核心问题。给定两个训练好的预测器,标准做法是在验证集上比较它们的损失,对观测值上的这些损失取平均,然后宣布一个全局胜者。当某个模型在全体范围内一致占优时,这种流程简单且通常合适。但并非所有实际重要的比较都是全局性的。结构化或理论指导的模型可能在其归纳偏置与数据生成机制一致的区域表现更好,而灵活的黒箱模型可能在别处表现更好。同样,在专家路由(expert-routing)场景中,不同预测器在协变量空间的不同子空间可能更受青睐。 本文研究*保形化局部模型比较*。我们不是问哪个模型在整个分布上平均胜出,而是问在目标协变量值 \(x_0\) 附近哪个模型更优。我们的主要估计目标(estimand)是条件均值比较分数 \(\mu(x)=\mathbb{E}[S(X,Y)\mid X=x]\),例如两个平方损失之差,其中负值偏好模型 \(A\),正值偏好模型 \(B\)。这就在特征空间上诱导出一个局部最优模型图。均值分数的有限半径邻域平均提供了一个稳定的局部平滑目标,而另外两个摘要——局部多数(local majority)概念和局部分位数概念——作为局部一致性的次级描述。然而,主要的统计发展集中在局部期望优势上。 第二个且主要的挑战是推断。一旦比较变成局部的,该流程对异质性更敏感,但也更具变异性。为解决这一问题,我们使用三路拆分。一个拆分拟合竞争模型,第二个拆分用样本外比较分数估计局部分数中心与尺度,第三个拆分校准保形残差。仅当单侧保形上界低于零时才宣告胜者。这一构造刻意保持谦逊:它为*已实现未来分数*上的错误提供有限样本*边际*保护,而不是对 \(\mu(x_0)\) 本身提供有限样本置信陈述。 相应的理论结果也聚焦于此。首先,基于独立评估样本的局部化估计量在平局边界之外渐近地恢复 \(\mu(x_0)\) 的正确符号。其次,聚合比较以全局均值分数为目标,因此可能与局部优势的普遍性严重不一致。第三,在平方损失下,局部均值分数可分解为协变量空间上的平方偏差与方差之差,这使得该框架对结构化模型与灵活模型之间的比较尤为自然。总之,我们的贡献是:(i) 一个基于条件均值分数 \(\mu(x)\) 及其有限半径邻域平均的局部模型比较框架,连同次级多数与分位数描述;(ii) 一个样本拆分、局部中心的保形比较规则,对已实现未来分数上的虚假局部胜者宣告具有有限样本边际控制;以及 (iii) 一致性、全局–局部失配以及偏差–方差结果,它们刻画了局部胜者区域何时出现以及为何出现。 本文其余部分组织如下。第 2 节回顾相关文献。第 3 节介绍局部目标。第 4 节给出保形流程。第 5 节发展理论性质。第 6 节总结实验设计与结果。 ## 2 相关文献 保形预测、局部化与加权。 保形预测在可交换性下提供有限样本、无分布假设的预测保证 [10, 8, 5],并在 Angelopoulos 和 Bates [1] 的综述中得到了总结。后续工作使保形方法适应异质性,例如通过保形分位数回归 [7]、协变量偏移下的加权保形预测 [9] 以及局部化保形预测 [3]。这些论文激发了这样的观点:校准应响应局部的、依赖特征的结构,而非依赖全局残差分布。本文借鉴了这一直觉,但推断对象不同:我们校准的是*两个模型之间的比较分数*,而不是单个模型的预测区间。 局部化模型选择与选择后有效性。 保形推断的最新进展已涉及模型选择。例如,局部化保形模型选择 [11] 提供了一个框架,用于选择能产生高效保形区间同时保持覆盖率的模型,而 [6] 研究了数据依赖模型选择后的预测有效性。我们的工作赞同模型适用性是异质的这一观点,但目标互补。我们不是优化区间长度或刻画选择后预测覆盖率,而是将保形校准重新用作在通用比较分数下支持邻域级优势的证据。 模型比较与路由。 更广泛的动机还与条件预测能力检验和局部模型路由相关。全局预测能力检验比较评估样本上的平均损失 [2],而专家混合与算法选择视角则强调不同模型在输入空间的不同区域可能更优 [4]。本文介于这两种观点之间:它保留了基于损失的模型比较语言,但用特征空间上的局部分数图取代了单一数字的全局排名。 ## 3 问题设定与局部优势目标 设 \((X,Y)\) 为一个随机对,取值于 \(\mathcal{X}\times\mathbb{R}\),其中 \(X\) 表示协变量,\(Y\) 表示响应。我们比较两个拟合的预测模型 \(A\) 和 \(B\),其预测器为 \(\hat{f}_A,\hat{f}_B:\mathcal{X}\to\mathbb{R}\)。对每个模型 \(m\in\{A,B\}\),令 \(L_m(X,Y)\) 表示其在 \((X,Y)\) 处的损失。为比较两个模型,我们使用一个通用分数 \[ S(X,Y)\coloneqq s\!\bigl(L_A(X,Y),L_B(X,Y);X\bigr), \tag{1} \] 其中负分数偏好 \(A\),正分数偏好 \(B\),零表示平局。我们假设 \(s(\ell_A,\ell_B;x)\) 关于 \(\ell_A\) 弱递增、关于 \(\ell_B\) 弱递减。例子包括:差值 \(s_{\mathrm{gap}}(L_A,L_B)=L_A-L_B\);对数比率 \(s_{\mathrm{ratio}}(L_A,L_B)=\log((L_A+\tau)/(L_B+\tau))\),其中 \(\tau>0\);以及标准化差值 \(s_{\mathrm{std}}(L_A,L_B;X)=(L_A-L_B)/v(X)\),其中 \(v(X)>0\)。 我们的主要总体目标(population target)是条件均值分数 \[ \mu(x)\coloneqq\mathbb{E}[S(X,Y)\mid X=x]. \tag{2} \] 当 \(\mu(x_0)<0\) 时,模型 \(A\) 更优;当 \(\mu(x_0)>0\) 时,模型 \(B\) 更优。为稳定局部估计,固定目标点 \(x_0\in\mathcal{X}\) 和局部化参数 \(r>0\),令 \(K_r:\mathcal{X}\times\mathcal{X}\to[0,\infty)\) 为一个非负邻域权重。在第 5 节的渐近理论中,当 \(\mathcal{X}\subseteq\mathbb{R}^d\) 时,我们使用紧支撑核局部化器,例如箱形核 \[ K_r(x,x_0)=r^{-d}\mathbf{1}\{\|x-x_0\|\leq r\}, \] 这对应于基核 \(K(u)=\mathbf{1}\{\|u\|\leq 1\}\),或 Epanechnikov 形式 \(K_r(x,x_0)=r^{-d}\bigl(1-\|x-x_0\|^2/r^2\bigr)_+\)。在有限样本实现中,当需要精确紧支撑时,KNN 权重是一种实用替代。相应的邻域平均分数为 \[ \theta(x_0;r):=\frac{\mathbb{E}\!\left[K_r(X,x_0)S(X,Y)\right]}{\mathbb{E}[K_r(X,x_0)]} =\frac{\mathbb{E}\!\left[K_r(X,x_0)\mu(X)\right]}{\mathbb{E}[K_r(X,x_0)]}. \tag{3} \] \(\theta(x_0;r)\) 是 \(\mu(x_0)\) 的平滑版本;在 \(\mu\) 连续的情况下,当 \(r\to 0\) 时它趋于 \(\mu(x_0)\)。 ###### 定义 1(局部期望胜者与最优模型图)。 若 \(\mu(x_0)<0\),则模型 \(A\) 在 \(x_0\) 处是*局部期望胜者*。对于固定半径 \(r\),若 \(\theta(x_0;r)<0\),则模型 \(A\) 是 \(x_0\) 周围的 *\(r\)-局部期望胜者*。由此诱导的逐点局部最优模型图为 \[ \mathcal{W}(x)=A\mathbb{I}_{\{\mu(x)<0\}}+B\mathbb{I}_{\{\mu(x)>0\}}+\text{tie}\cdot\mathbb{I}_{\{\mu(x)=0\}}, \] 其有限半径类比通过将 \(\mu(x)\) 替换为 \(\theta(x;r)\) 得到。 我们还记录由局部分数分布 \(F_{x_0,r}(t)\coloneqq\mathbb{E}[K_r(X,x_0)\mathbf{1}\{S(X,Y)\leq t\}]/\mathbb{E}[K_r(X,x_0)]\)(其中 \(t\in\mathbb{R}\))导出的两个次级局部一致性摘要。模型 \(A\) 的局部多数分数(记为 \(\pi_A(x_0;r)\))和 \((1-\beta)\) 分位数分数 \(Q_{1-\beta}(x_0;r)\) 为 \[ \pi_A(x_0;r)\coloneqq\frac{\mathbb{E}[K_r(X,x_0)\mathbf{1}\{S(X,Y)<0\}]}{\mathbb{E}[K_r(X,x_0)]} \quad\text{和}\quad Q_{1-\beta}(x_0;r)\coloneqq\inf\{t\in\mathbb{R}:F_{x_0,r}(t)\geq 1-\beta\}, \] 其中 \(\beta\in(0,1)\)。在我们的实验中,我们分别将条件 \(\pi_A(x_0;r)>1/2\) 和 \(Q_{1-\beta}(x_0;r)<0\) 定义为 `local_def2` 和 `local_def3`;它们表明邻域在局部多数和局部分位数摘要下偏好模型 \(A\)。我们使用 `local_def1` 表示基于 \(\theta(x_0;r)\) 符号的局部均值规则。本文其余部分聚焦于局部均值目标 \(\mu(x)\)(等价地 \(\theta(x_0;r)\)),因为它与我们的估计量和理论直接相关。 ## 4 局部中心化保形比较 现在我们为比较分数 \(S(X,Y)\) 附加一个有限样本推断层。设 \(\{(X_i,Y_i)\}_{i=1}^n\) 为一个 i.i.d. 样本,将其拆分为三个不相交部分:拟合拆分 \(I_{\mathrm{fit}}\),仅用于训练竞争预测器 \(\hat{f}_A\) 和 \(\hat{f}_B\);估计拆分 \(I_{\mathrm{est}}\),仅用于从*样本外*分数估计局部中心与尺度;校准拆分 \(I_{\mathrm{cal}}\),仅用于保形校准。这一分离消除了若用同一批观测同时拟合模型并估计局部比较分数时可能出现的内样本损失问题。以在 \(I_{\mathrm{fit}}\) 上拟合的模型为条件,总体目标 \(\mu(x)\) 以及 \(j\in I_{\mathrm{est}}\) 的样本外分数 \(S_j\) 按 (1) 和 (2) 计算。令 \(\bar{S}_{\mathrm{est}}\) 和 \(\widehat{V}_{\mathrm{est}}\) 分别表示它们的经验均值和未修正方差;后者避免 Bessel 修正,因为保形保证只需一个严格正的尺度。 对于目标点 \(x\),令 \(W_x\coloneqq\sum_{j\in I_{\mathrm{est}}}K_r(X_j,x)\)。当 \(W_x>0\) 时,对正则化参数 \(\lambda>0\),我们定义局部化中心与正则化尺度为 \[ \widehat{\theta}_r(x)\coloneqq\sum_{j\in I_{\mathrm{est}}}\frac{K_r(X_j,x)}{W_x}S_j \quad\text{和}\quad \widehat{\sigma}_r(x)\coloneqq\Biggl[\lambda+\sum_{j\in I_{\mathrm{est}}}\frac{K_r(X_j,x)}{W_x}\bigl(S_j-\widehat{\theta}_r(x)\bigr)^2\Biggr]^{1/2}. \] 若 \(W_x=0\),则退回到全局估计 \(\widehat{\theta}_r(x)\coloneqq\bar{S}_{\mathrm{est}}\) 和 \(\widehat{\sigma}_r(x)\coloneqq(\widehat{V}_{\mathrm{est}}+\lambda)^{1/2}\)。令 \(\widehat{\sigma}_r\equiv 1\) 即可恢复未标准化流程。 在校准拆分 \(I_{\mathrm{cal}}\)(大小为 \(n_{\mathrm{cal}}\))上,我们类似地计算分数 \(S_i\),并形成局部化残差 \(R_i\coloneqq(S_i-\widehat{\theta}_r(X_i))/\widehat{\sigma}_r(X_i)\)。令 \(R_{(1)}\leq\dots\leq R_{(n_{\mathrm{cal}})}\) 为排序后的残差。设 \(k_\alpha\coloneqq\lceil(n_{\mathrm{cal}}+1)(1-\alpha)\rceil\),保形阈值为 \(\hat{q}_{1-\alpha}\coloneqq R_{(k_\alpha)}\),其中 \(\alpha\in(0,1)\)。最终比较规则为:若 \[ \widehat{\theta}_r(x_0)+\hat{q}_{1-\alpha}\widehat{\sigma}_r(x_0)<0, \] 则宣告模型 \(A\) 是局部胜者。这一定义使得只有当未来的比较分数在保形意义上以 \(1-\alpha\) 的置信度低于零时,才宣告胜者;否则规则弃权。 ###### 定义 2(局部中心化保形比较规则)。 给定 \(x_0\)、半径 \(r>0\)、正则化参数 \(\lambda>0\) 和水平 \(\alpha\in(0,1)\),若 \[ \widehat{\theta}_r(x_0)+\hat{q}_{1-\alpha}\widehat{\sigma}_r(x_0)<0, \] 则局部中心化保形比较规则宣告模型 \(A\) 在 \(x_0\) 处胜出。若该不等式反向成立且 \(\widehat{\theta}_r(x_0)-\hat{q}_{1-\alpha}\widehat{\sigma}_r(x_0)>0\),则宣告模型 \(B\) 胜出。否则宣告平局/弃权。 为了在单一规则中同时支持两个方向,我们使用校准残差 \(\{R_i\}\),利用其经验分布构造两个临界值。具体地,令 \(\hat{q}_{1-\alpha}^{+}\) 为残差的经验 \((1-\alpha)\) 分位数(即 \(R_{(k_\alpha)}\)),并令 \(\hat{q}_{1-\alpha}^{-}\) 为残差的经验 \(\alpha\) 分位数(即 \(R_{(\lfloor \alpha(n_{\mathrm{cal}}+1)\rfloor)}\))。则规则为:若 \[ \widehat{\theta}_r(x_0)+\hat{q}_{1-\alpha}^{+}\widehat{\sigma}_r(x_0)<0, \] 则宣告 \(A\);若 \[ \widehat{\theta}_r(x_0)-\hat{q}_{1-\alpha}^{-}\widehat{\sigma}_r(x_0)>0, \] 则宣告 \(B\);否则弃权。 ## 5 理论性质 本节给出三个主要理论结果。第一个结果涉及局部化均值分数估计量的一致性。在正则条件下,当估计样本量 \(n_{\mathrm{est}}\) 趋于无穷并且 \(r\to 0\) 适当控制时,对满足 \(\mu(x_0)\neq 0\) 的目标点 \(x_0\),有 \(\mathbb{P}(\mathrm{sign}(\widehat{\theta}_r(x_0))\neq \mathrm{sign}(\mu(x_0)))\to 0\)。换言之,远离平局边界时,基于独立评估样本的局部化估计量以趋于 1 的概率恢复条件比较分数在目标点处的正确符号。 第二个结果强调全局与局部比较之间可能出现的严重不一致。设 \(\bar{\mu}\coloneqq\mathbb{E}[S(X,Y)]\) 为全局均值分数。若 \(\bar{\mu}<0\),全局比较宣告模型 \(A\) 获胜。然而,即使 \(\bar{\mu}<0\),也可能存在一个协变量区域 \(G\subset\mathcal{X}\),其测度 \(\mathbb{P}(X\in G)>c>0\),在该区域上 \(\mu(x)>0\),且在该区域上模型 \(B\) 的局部优势足够大,从而在条件增益意义下选择 \(B\) 更优。形式上,我们构造满足 \[ \mathbb{P}(X\in G)>0,\qquad \mu(x)>0\ \forall x\in G,\qquad \bar{\mu}<0 \] 的数据分布族。因此,全局胜者并不能告诉实践者谁在何处胜出;局部胜者图携带了额外的、在聚合中丢失的信息。 第三个结果在平方损失下将局部均值分数分解为偏差与方差贡献。令 \(L_m(X,Y)=(Y-\hat{f}_m(X))^2\),并令 \(\mu_m(x)\coloneqq\mathbb{E}[Y\mid X=x]-\hat{f}_m(x)\) 为模型 \(m\) 在 \(x\) 处的偏差,\(\Sigma_m(x)\coloneqq\mathrm{Var}(Y\mid X=x)\) 为固有噪声。则条件平方损失为 \[ \mathbb{E}[(Y-\hat{f}_m(X))^2\mid X=x] =\mu_m(x)^2+\Sigma_m(x). \] 因此,平方损失比较分数 \(S(X,Y)=L_A(X,Y)-L_B(X,Y)\) 的条件均值为 \[ \mu(x)=\mu_A(x)^2-\mu_B(x)^2. \] 这一分解表明,局部胜者区域出现在模型 \(A\) 的平方偏差低于模型 \(B\) 的区域;方差项 \(\Sigma_m(x)\) 在逐点比较中相互抵消,但在全局比较中则不然。特别地,一个在大多数地方偏差较大但在少数区域偏差较小的模型,可以赢得一个局部胜者区域,即使它在全局上失败。 ###### 命题 1(局部均值的偏差–方差分解)。 在平方损失下,比较分数 \(S(X,Y)=L_A(X,Y)-L_B(X,Y)\) 满足 \[ \mu(x)=\mu_A(x)^2-\mu_B(x)^2, \] 其中 \(\mu_m(x)\coloneqq\mathbb{E}[Y\mid X=x]-\hat{f}_m(x)\)。因此,局部期望胜者完全由两个模型的条件平方偏差之差决定;固有噪声在条件比较中不出现。 这些结果共同刻画了局部胜者区域何时出现以及为何出现:当一个模型的归纳偏置在某个邻域内与真实回归函数对齐,从而降低平方偏差,而另一个模型因过拟合或欠拟合在该邻域内具有更高的偏差时,局部胜者区域就会出现。 ## 6 实验设计与结果 我们在合成数据和真实数据上评估所提出的方法。由于版面限制,本节给出实验设置的要点和主要发现;完整细节见附录。 **合成数据。** 我们生成协变量 \(X\sim\mathrm{Unif}([0,1]^2)\),响应 \(Y=g(X)+\varepsilon\),其中 \(\varepsilon\sim N(0,0.1)\),而 \[ g(x)=2\sin(4\pi x_1)x_2 + \mathbb{I}\{x_1>0.5\}\cdot (x_1-0.5)^2 + 1. \] 我们比较两个模型:线性回归模型 \(A\) 和随机森林模型 \(B\)。在 \(g\) 近似线性的区域,线性模型 \(A\) 应局部占优;在强非线性区域,随机森林 \(B\) 应局部胜出。实验随机重复 50 次,使用不同的训练/估计/校准拆分。每个目标点 \(x_0\) 处的宣告被记录并绘制为散点图,以形成估计的局部最优模型图。 **真实数据。** 我们使用一个公开的公路骑行功率预测数据集,其中包含功率计读数、坡度、风速和骑行者特征。我们比较一个基于物理的功率模型(结构化模型)和一个梯度提升机(灵活模型)。评估网格覆盖输入协变量空间的一个二维切片(坡度与风速)。对每个网格点,我们计算 \(r\)-局部保形规则及三个局部摘要。 **主要发现。** (1)所提出的方法恢复了异质性胜者区域:在合成斜坡区域中,线性模型的显著局部优势被清晰识别,而随机森林在非线性区域占优。(2)该规则在目标点邻域内证据不足时弃权;弃权率随 \(r\) 增大而降低,随 \(\alpha\) 减小而升高。(3)局部保形选择的条件增益(即给定 \(X=x\) 时所选模型与真实最优模型之间的平方损失差)低于全局选择,尤其在高异质区域。(4)聚合比较可能误导:在多个设置中,全局胜者的误分类率(在随机目标点 \(X=x\) 下,当局部真实最优为 \(B\) 时全局宣称 \(A\) 获胜的比例)超过 30%,而局部规则通过弃权有效控制误分类。 这些实验佐证了理论结果,并表明局部中心化保形比较是全局模型选择的一个实用、可解释的替代方案,当模型在输入空间中具有互补优势时尤其如此。
相似文章
超越表面统计:通过内部表示实现LLM鲁棒共形预测
本论文提出了一个利用内部表示而非输出层统计的LLM共形预测框架,引入层级信息(LI)评分作为非一致性度量,在分布偏移下改进有效性-效率权衡。该方法在QA基准上相比文本级基线展现出更强的对校准-部署不匹配的鲁棒性。
面向视觉与语言模型的经验贝叶斯共形预测
本文介绍了一种经验贝叶斯共形预测框架,该框架使用 r 值将评分变异性纳入非一致性得分中,从而提升排序稳定性并缩减集合大小,同时保持对视觉与语言模型的覆盖。
含污染观测的保形变点定位与根因分析
本文提出加权保形方法,用于变点定位与根因分析,通过降低可能受污染数据的权重,利用不确定性信号与元学习,在污染观测下缩减置信集大小。
我在swe-verified基准测试子集上比较了本地模型的不同量化级别和配置
在SWE-verified基准测试的子集上,对具有不同量化级别和配置的本地AI模型进行比较,评估性能差异。
在线局部化共形预测
本文提出了在线局部化共形预测(OLCP),旨在解决在线学习和时间序列设置中的协变量异质性问题。文章引入了用于带宽选择的 OLCP-Hedge 算法,并证明与现有基线相比,该方法在获得更窄预测集的同时,仍能保持有效的长期覆盖率。