动态集成何时能带来收益?分布偏移下回归任务的区域增益诊断

arXiv cs.LG 论文

摘要

本文提出 D^CF5 诊断工具,用于预测分布偏移下回归任务动态集成中逐区域的增益变化,经多数据集验证其预测结果具有高度相关性。

arXiv:2608.18330v1 公告类型:新 摘要:输入依赖型(动态)回归模型池的组合策略能否超越最佳静态混合方案,取决于数据偏移情况,且在部署前通常难以预知。小规模有标签目标域探测样本能否指示何时在输入空间各区域重新分配信任度将产生效益?我们通过$\widehat{D}_{\mathrm{CF5}}$方法对此进行了验证——该方法利用探测样本估计分区域凸组合相对于最佳静态凸组合的交叉拟合增益:即逐区域决策"信任哪个模型"的可实现价值。在涵盖空间、时间、领域及特征聚类偏移的12组固定数据集偏移对测试中,$\widehat{D}_{\mathrm{CF5}}$预测的逐区域测试增益实现值呈现$+0.98$的斯皮尔曼相关系数(95%置信区间$[+0.83, +1.00]$;$p=5\times10^{-5}$),其中两个案例颠覆了预先注册的预期。该关联在16组偏移对的敏感性分析中依然成立(斯皮尔曼系数$+0.83$),而替代性探测诊断方法最高仅达$+0.66$。这种对比凸显了区域性信任重分配的特性:逐区域凸组合增益的相关系数为$+0.98$,但经仿射校正后的平滑协变量依赖堆叠相关系数仅为$+0.01$。受控生成实验表明:动态增益产生于偏移异质性与局部模型能力的交互作用,随偏移程度加剧而增大,并在测试网格中可在128至256个探测标签时达到可实现状态。探测验证集成选择器在静态仿射堆叠器与动态实现器间进行选择,仅当留出集的下置信界突破静态凸基线时才部署候选模型。在预先注册的前瞻性批量测试中,该方法在全部12次运行中均达到或超越基线;其中两次部署将测试风险降低11%和16%,而控制门机制拒绝了一个若直接部署将导致损失超过静态方案30倍的候选模型。我们开源了OpenRegShift——用于分布偏移下回归集成模型的可复现评估框架。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:24

# 动态集成何时奏效?诊断分布偏移下回归任务中的区域级增益  
来源:https://arxiv.org/html/2608.18330 2026年8月  
###### 摘要  
回归模型池的输入依赖性(“动态”)组合是否优于最佳静态混合方案,取决于偏移类型,且在部署前很少能预知。一个带标签的小规模目标域探测样本能否帮助我们判断,重新分配输入空间不同区域的模型信任权重何时会带来收益?我们使用 D^CF5 诊断指标来回答这一问题:该指标通过探测样本估计区域凸组合相对于最佳静态凸组合的交叉拟合增益——即逐区域决定信任哪个模型的可实现价值。在涵盖空间、时间、领域和特征聚类偏移的12组冻结数据集偏移对中(5组用于开发,7组分两批预注册保留测试),D^CF5 以数据集级别的斯皮尔曼相关系数 +0.98(自举法95%置信区间[+0.83, +1.00];排列检验 p=5×10^{-5};校准斜率0.94)预测了实现的区域级测试增益,其中包括两个推翻我们预注册预期的案例。在增加4组前瞻性选择器数据对的16组敏感性分析中,该相关性保持为 +0.83。替代性探测诊断指标最高仅达 +0.66。这种对比凸显了区域信任重新分配的作用:其与区域凸增益的相关性为 +0.98,而与仿射校正后平滑协变量依赖堆叠的增量价值相关性仅为 +0.01。受控生成器实验表明,动态增益源于偏移异质性与局部能力的交互作用,并随偏移严重程度增加;在测试网格中,转变发生在128至256个探测标签之间。作为诊断的补充,探测验证集成选择器在静态仿射堆叠器与动态实现器之间进行选择,仅当候选模型的保留集置信下限超过静态凸基线时才进行部署。在预注册的前瞻性批次中,该选择器在全部12次运行中均维持或超越基线;两次部署使测试风险降低11%和16%,而门控机制拒绝了一个无条件部署时损失超过静态基线30倍的候选模型。我们发布了OpenRegShift——一个可复现的分布偏移下回归集成评估工具。  

## 1 引言  
实践者拥有一组在源域数据上训练的回归模型,以及来自偏移目标域的小规模带标签样本。应该对模型进行平均、使用全局权重组合,还是在输入空间不同区域采用不同的信任权重?输入依赖性组合颇具吸引力:如果不同模型在不同区域保持准确,动态组合器可以利用其局部互补性。然而,当不存在此类结构时,同样的灵活性会放大探测噪声。因此,实际问题在于目标数据何时支持动态组合。这一问题至关重要,因为静态集成是强大的基线方法。均匀平均和深度集成具有准确性和鲁棒性(Lakshminarayanan 等,2017;Ovadia 等,2019),而堆叠法通过验证数据学习单一组合方案(Wolpert,1992)。动态替代方案如专家混合、动态回归器选择和协变量依赖堆叠具有更强的表达能力(Jacobs 等,1991;Moura 等,2019;Wakayama 和 Sugasawa,2025)。然而,它们的增益在不同偏移下差异显著,且偏移严重程度或模型分歧均无法揭示其所需的局部结构是否存在。我们将这一部署决策构建为一个可估计的比较问题。从带标签的探测样本中,我们学习输入空间的分区,并比较最佳静态凸组合与区域凸组合(两者均通过折外数据拟合和评估)。由此产生的交叉拟合风险差 D^CF5 估计了逐区域决定信任哪个模型的可实现价值。其符号为该区域机制提供了决策依据:正值表示局部信任重分配在有限探测样本的估计成本后仍能保持收益。在涵盖空间、时间、领域和特征聚类偏移的12组冻结数据集/偏移对中,D^CF5 以数据集级别斯皮尔曼相关系数 +0.98 预测了实现的区域级增益,包括两个推翻我们记录预期的预注册保留偏移。在增加4组前瞻性选择器数据对的敏感性分析中,该相关性保持为 +0.83。更简单的探测摘要指标最高仅达 +0.66。该诊断还具有机制特异性:与其测量的区域增益相关性为 +0.98,而与协变量依赖堆叠在仿射校正后的动态增量相关性仅为 +0.01。它识别了跨区域重分配信任的价值,而部署验证则决定了哪种可用机制应实现该增益。受控生成器解释了该价值存在的条件。增益源于偏移异质性与局部能力的交互作用;单独变化任一条件几乎不产生增益。增益随偏移严重程度增加,在测试网格中,转变发生在128至256个探测标签之间。我们用部署流程补充了诊断。探测验证集成选择器评估静态仿射堆叠器和多个动态实现器相对于静态凸基线的表现。仅当候选模型的保留集置信下限超过该基线时才进行部署。在预注册的前瞻性批次中,选择器在全部12次运行中均维持基线水平。两次动态部署均实现了其验证增益,分别较基线提升11%和16%,而门控机制拒绝了一个无条件损失超过静态基线30倍的候选模型。我们的贡献包括:  
- D^CF5,一种交叉拟合诊断指标,用于评估区域凸组合相对于静态凸混合的可实现增益,已在多样回归偏移中得到验证。  
- 探测验证集成选择器,可将带标签的目标探测转化为对静态基线与互补动态实现器之间的验证选择。  
- 受控阶乘与剂量反应实验,揭示了动态增益背后的联合机制,并测量了可实现性如何随偏移严重程度和探测预算变化。  
- OpenRegShift,一个可复现的评估工具,涵盖16组数据集/偏移对、广泛的基线方法、预注册保留评估以及一键结果验证。  

## 2 诊断方法  
设冻结的K个源训练回归模型产生预测向量 μ(x) = (μ₁(x), ..., μ_K(x))^⊤ ∈ ℝ^K。  
(1)  
部署时,我们观察到来自目标域的总规模n=512的带标签探测样本。该探测样本被划分为诊断样本、组合器样本和门控样本。诊断样本支持本节分析;另外两个样本为集成选择器保留(第6节)。一个不相交的目标测试集仅用于最终评估。我们使用标准化目标上的平方误差。图1总结了数据流,完整的访问和划分协议见表1。  
![数据流图](https://arxiv.org/html/2608.18330#S2.F1)  
源数据→冻结模型池 μ₁,...,μ_K→模型预测→目标探测(n=512,带标签)→  
├─诊断样本(蓝色)→D^CF5  
├─组合器样本(橙色)→候选模型  
└─门控样本(橙色)→验证选择:候选模型或基线  
目标测试集(仅用于评估)  
C1对比分析  
图1:数据流。模型池仅在源数据上训练,并在目标探测点评估。探测样本被划分为诊断样本(蓝色)、组合器样本和门控样本(橙色)。诊断分支生成D^CF5;选择器分支拟合候选模型并与静态凸基线进行验证。测试集不用于拟合或选择。两个分支是互补模块:选择器不以D^CF5作为输入。虚线蓝色箭头表示最终的C1表征分析;测试观测不进入诊断流程。  

#### 总体空间潜力  
设 Δ_K = {w ∈ ℝ^K : w_k ≥ 0, Σ_{k=1}^K w_k = 1} (2)  
表示概率单纯形,π: 𝒳 → {1, ..., J} 为目标输入空间的划分。所有主要实验中设定J=8,J的扫描结果见附录A.3。  
最优静态凸风险为:  
R_{static}^⋆ = min_{w ∈ Δ_K} 𝔼_T[(Y - w^⊤μ(X))²] (3)  
对应的区域凸风险为:  
R_{regional}^⋆(π) = min_{w₁,...,w_J ∈ Δ_K} 𝔼_T[(Y - w_{π(X)}^⊤μ(X))²] (4)  
由于区域类别包含所有静态凸混合,因此:  
D(π) = R_{static}^⋆ - R_{regional}^⋆(π) ≥ 0 (5)  
我们称D(π)为总体区域潜力,它衡量了基于π定义的区域重新分配模型信任的结构价值。  

#### 探测预算m下的可实现增益  
总体潜力未考虑有限样本估计。令π̂_n表示从所有n=512个目标探测观测的协变量中学习的划分;划分拟合不使用目标标签和目标测试观测。设S_m = 𝒫_D为诊断样本(m=205)。令𝒜_{static}(S_m)表示静态凸拟合,𝒜_{regional}(S_m, π̂_n)表示基于学习划分的区域凸拟合。设定最小区域样本量m_min=5。S_m中包含少于m_min观测值的区域将复用全局静态权重。我们定义:  
G_m(π̂_n) = 𝔼[R_T(𝒜_{static}(S_m)) - R_T(𝒜_{regional}(S_m, π̂_n)) | π̂_n] (6)  
该期望基于带标签诊断样本及其分配条件(条件于学习到的划分)。与总体潜力不同,G_m(π̂_n)可能为负值:区域优势必须足够大以抵消权重估计成本。因此其符号回答了区域机制的部署问题。π̂_n的质量通过条件增益引入,而学习划分的成本在第5节单独隔离。  

#### 交叉拟合估计  
我们使用诊断样本内区域分层五折交叉拟合的三次重复来估计有限预算增益。划分π̂_n从所有探测协变量中学习一次,并在整个过程中保持固定。划分拟合不使用目标标签。在每个重复和折中,静态和区域权重在不使用折标签的情况下拟合,并在该折上评估。对于重复r∈{1,2,3},设{ℐ_{rq}}_{q=1}^5为五折。令f̂_{static}^{(-r,q)}和f̂_{regional}^{(-r,q)}表示不使用折ℐ_{rq}拟合的两个组合器。诊断指标为:  
D̂_{CF5} = (1/15) Σ_{r=1}^3 Σ_{q=1}^5 (1/|ℐ_{rq}|) Σ_{i∈ℐ_{rq}} [ℓ(y_i, f̂_{static}^{(-r,q)}(x_i)) - ℓ(y_i, f̂_{regional}^{(-r,q)}(x_i))] (7)  
其中ℓ(y, ŷ) = (y - ŷ)²。正值支持区域组合,零或负值支持静态凸混合。每个折模型在约4m/5个诊断观测上训练。因此,D̂_{CF5}在略小于最终在所有m观测上重拟合的训练预算下估计相同的区域对比。  

#### 交叉拟合的重要性  
样本内对比会机械性地奖励额外的区域灵活性,即使该灵活性无法泛化。交叉验证将权重拟合与损失评估分离,限制了在训练标签上评估灵活组合器产生的乐观偏差(Arlot 和 Celisse,2010)。我们在第4节比较两种估计器。  

有效可估计区域数定义为:  
J_eff = Σ_{j=1}^J 𝟙{Σ_{i∈𝒫_D} 𝟙{π̂_n(x_i)=j} ≥ m_min} (8)  
当J_eff ≤ 1时,区域机制无法诊断,因此D̂_{CF5}报告为不可估计,而非赋予误导性的零值。当J_eff > 1时,诊断指标被计算。  

#### 诊断指标性质  
D̂_{CF5}估计探测预算下静态凸组合与区域凸组合的差异。正值表明区域机制的可实现价值超过估计成本,负值表明静态组合更优。该指标具有以下性质:  
1. 交叉拟合消除乐观偏差。  
2. 使用区域分层保持划分结构。  
3. 三次重复降低方差。  
4. 最小区域样本量防止过拟合。  

## 3 实验设置  

### 3.1 数据集偏移套件  
使用12组冻结的数据集/偏移对(5组用于开发,7组用于预注册保留测试)。偏移类型包括:  
- 空间偏移:图像数据中的地理变换  
- 时间偏移:时序数据中的时间漂移  
- 领域偏移:特征分布变化  
- 特征聚类偏移:子群特定偏移  

### 3.2 模型池  
每个模型池包含K=10个在源域训练的回归模型,架构和训练过程多样。  

### 3.3 基线方法  
- 均匀平均:简单平均所有模型预测  
- 最佳静态凸组合:在验证集上优化静态权重  
- 堆叠法:使用线性元学习器  
- 深度集成:同时训练多个独立模型  

### 3.4 动态方法  
- 区域凸组合:基于输入空间分区的凸权重  
- 专家混合:门控网络分配专家权重  
- 协变量依赖堆叠:特征相关的权重分配  

## 4 诊断有效性分析  

### 4.1 交叉拟合与样本内对比  
在12组偏移对上比较:  
- 交叉拟合D̂_{CF5}:斯皮尔曼相关系数 +0.98  
- 样本内对比:斯皮尔曼相关系数 +0.66  
交叉拟合显著减少了乐观偏差。  

### 4.2 区分能力  
D̂_{CF5}与区域凸增益的相关性为 +0.98,而与协变量依赖堆叠的增量相关性仅为 +0.01,表明其机制特异性。  

### 4.3 探测预算影响  
剂量反应实验显示:  
- 64个标签:J_eff常≤1,诊断不可靠  
- 128个标签:开始出现可靠诊断  
- 256个标签:诊断稳定性显著提升  
最佳诊断性能在256个标签时达到。  

## 5 部署决策框架  

### 5.1 探测验证集成选择器  
该选择器使用三个探测子样本:  
1. 诊断样本(𝒫_D):计算D̂_{CF5}  
2. 组合器样本(𝒫_C):拟合静态基线和6个候选模型  
3. 门控样本(𝒫_G):验证部署决策  

### 5.2 选择规则  
对于每个候选模型c,计算其相对于静态基线f₀在门控样本上的改进:  
d_ic = ℓ(y_i, f₀(x_i)) - ℓ(y_i, f_c(x_i)) (13)  
计算均值d̄_c和标准差s_c。选择c⋆ = argmax_{c∈{1,...,6}} d̄_c。  

部署条件:置信下限 LCB_c = d̄_c - t·s_c/√|𝒫_G| > 0  
其中t为学生t分位数。仅当LCB_c > 0时才部署候选模型。  

### 5.3 在线验证结果  
在预注册前瞻性批次(12组偏移对)中:  
- 选择器在所有运行中维持静态基线水平  
- 两次动态部署分别降低测试风险11%和16%  
- 门控拒绝了一个无条件损失超过基线30倍的候选模型  

## 6 讨论  

### 6.1 核心贡献  
1. D̂_{CF5}诊断指标:量化区域信任重分配的可实现价值  
2. 探测验证选择器:将诊断转化为可靠的部署决策  
3. 机制分析:揭示动态增益的边界条件  
4. OpenRegShift工具:可复现的评估框架  

### 6.2 局限性  
- 探测样本需具代表性  
- 对极端分布偏移的适应性有待验证  
- 计算开销高于纯静态方法  

### 6.3 未来方向  
- 扩展到分类任务  
- 自适应探测预算分配  
- 理论最优探测设计  

## 7 结论  
动态集成并非总是优于静态方法。我们提出了D̂_{CF5}诊断指标,可准确预测区域级动态增益的可实现价值。通过探测验证选择器,实践者可基于有限目标域数据做出可靠的部署决策。实验表明,该方法在多样偏移类型中均表现稳健,为动态集成提供了理论指导和实用工具。OpenRegShift代码库已开源,支持完整复现。

相似文章

学习分布偏移下预测模型的帕累托前沿

arXiv cs.LG

本文提出了前沿学习(Frontier Learning)框架,该框架结合多个黑盒和白盒预训练模型的表示与预测,构建统一的目标域表示,并保证在分布偏移下性能不劣于任何单一复用基线。在视觉域适应和临床死亡率预测上的评估显示,该方法相较强基线持续获得增益。

基于解析预测推断的高效贝叶斯深度集成

arXiv cs.LG

介绍了一种用于预测回归的高效贝叶斯深度集成方法,该方法结合了低维集成表示、闭式贝叶斯聚合和独立集成训练,以在保持计算效率的同时获得校准的不确定性估计。