NOMADD:适应数据漂移的模型数值优化
摘要
本文介绍了NOMADD,一种事后方法,通过在标记周期上拟合基础模型并外推压缩后的参数变化,来减少表格模型中的概念漂移。它以极低的训练和推理成本,实现了与Drift-Resilient TabPFN相当的性能。
arXiv:2608.02845v1 公告类型:新 \n摘要:当特征分布随时间变化,或特征与结果变量之间的关系随时间变化时,表格模型的性能会下降,这分别被称为数据漂移和概念漂移。由于标记数据可能无法立即获得,或重新训练模型可能不切实际,这些问题很难实时缓解。虽然已有工具可以减少漂移,但它们通常专门针对神经网络架构,并调整模型的训练方式。在本文中,我们提供了一种替代的事后方法来减少概念漂移,该方法适用于多种模型,从树模型到神经网络再到表格基础模型。当高模型精度、受限制的推理时间或模型大小等约束要求用户针对特定用例在不同模型之间进行选择时,这个新工具尤其有用。我们的算法在每个标记训练周期上分别拟合基础模型,衡量其参数相对于一个汇集了所有周期的单一锚模型如何演化,通过低秩分解压缩这些变化,并使用带阻尼的正则化预测对每个潜在因子进行外推。在18个数据集的Drift-Resilient TabPFN基准上,按照该基准自身的协议和指标进行评估,外推改进了它所应用的每个基础模型族,并以数秒的训练时间实现了与最先进的Drift-Resilient TabPFN相当的性能。相比之下,Drift-Resilient TabPFN需要在约1,300 GPU小时内在数百万个合成数据集上进行预训练,并且推理速度慢几个数量级(取决于模型)。在讨论中,我们探讨了将该工具扩展到其他模态的前景和挑战。
查看缓存全文
缓存时间: 2026/08/05 07:42
# NOMADD:适应数据漂移的模型的数值优化
来源:https://arxiv.org/html/2608.02845
###### 摘要
当特征分布随时间变化,或特征与结果变量之间的关系随时间变化时(分别称为数据漂移和概念漂移),表格模型的性能会下降。由于标注数据可能无法立即获得,或重新训练模型可能不切实际,这些问题难以实时缓解。虽然已有一些工具可以减少漂移,但它们通常专门针对神经网络架构,并且会调整模型的训练方式。在本文中,我们提出了一种替代性的事后(post-hoc)方法来减少概念漂移,适用于从树模型到神经网络再到表格基础模型的各种模型。当高模型精度、受限推理时间或模型大小等约束要求用户针对特定用例在不同模型之间做出选择时,这个新工具尤其有用。我们的算法在每个有标注的训练周期上分别拟合基础模型,测量其参数相对于一个跨越所有周期合并得到的单一锚定模型的演化,通过低秩分解压缩这些变化,并使用阻尼、正则化的预测方法对每个潜在因子进行外推。在 18 个数据集的 Drift-Resilient TabPFN 基准上,按照该基准自身的协议和指标进行评估,外推方法提升了其所应用的每个基础模型族的性能,并在数秒训练时间内达到了与最先进的 Drift-Resilient TabPFN 相当的性能。相比之下,Drift-Resilient TabPFN 需要在约 1,300 GPU 小时内在数百万个合成数据集上预训练,并且推理速度慢数个数量级(取决于模型)。在讨论中,我们探讨了将该工具扩展到其他模态的前景与挑战。
## 1引言
表格模型是许多应用的核心,从欺诈风险(Bao et al. 2020 (https://arxiv.org/html/2608.02845#bib.bib25))到信用评分(West 2000 (https://arxiv.org/html/2608.02845#bib.bib24)),再到产品定价(Chen et al. 2015 (https://arxiv.org/html/2608.02845#bib.bib29))。这些模型在流式表格数据上训练时常常会遇到问题,原因是数据漂移(Mallick et al. 2022 (https://arxiv.org/html/2608.02845#bib.bib23); Helli et al. 2024 (https://arxiv.org/html/2608.02845#bib.bib1)),即数据特征随时间变化;以及类似的概念漂移,即特征与结果变量之间的关系随时间演化(Lu et al. 2018 (https://arxiv.org/html/2608.02845#bib.bib12))。所有这些性质都会显著降低模型性能,这促使人们开发了一系列方法来检测数据漂移(Yurdakul 2018 (https://arxiv.org/html/2608.02845#bib.bib14))或适应数据漂移,例如周期性重新训练模型或在线学习(Orabona 2019 (https://arxiv.org/html/2608.02845#bib.bib15))。
然而,一个根本问题是,这些模型可能在重新训练之前就已经过时很久。例如,欺诈交易(Dal Pozzolo et al. 2015 (https://arxiv.org/html/2608.02845#bib.bib17))可能数周后才被知晓(Csaba et al. 2024 (https://arxiv.org/html/2608.02845#bib.bib22)),因此当标签存在时,最新数据已经发生漂移。其他常见情况是边缘设备,它们连接性有限,因此只能定期共享标签。一些方法有助于缓解这一问题,例如 Drift-Resilient TabPFN(DR-TabPFN)(Helli et al. 2024 (https://arxiv.org/html/2608.02845#bib.bib1)),但它们需要大量预训练,并且相对较慢。它们也无法扩展到在监管、速度或内存约束下最常部署的较小模型。银行出于监管原因需要简单可解释的模型(Demajo et al. 2020 (https://arxiv.org/html/2608.02845#bib.bib18)),而非接触式支付必须在边缘设备上远小于一秒内完成(Al-Maliki 2022 (https://arxiv.org/html/2608.02845#bib.bib16))。
为解决这一关键差距,我们提出了 NOMADD:适应数据漂移的模型的数值优化(Numerical Optimization of Models Adapting to Data Drift)。给定一个先前训练好的模型,我们创建一个独立的流水线来学习事后权重变化,并将其应用于该模型。我们在称为周期(periods)的短时间范围内训练探测模型,并测量模型参数(白盒模型)或对数概率场(基础模型)在周期之间的变化。然后,我们预测这些值的变化,以预估先前训练好的模型如果曾在较晚的(未标注)数据上训练*应该*变成什么样子。例如,对于树集成,我们改变叶阈值;对于神经网络,我们改变参数本身。与大型语言模型中使用的 LoRA(Hu et al. 2022 (https://arxiv.org/html/2608.02845#bib.bib28))类似,我们通过低秩奇异值分解压缩这些变化;但与 LoRA 不同,我们随后对每个潜在因子进行阻尼、岭正则化的线性趋势外推,并将预测结果以经过验证的收缩因子(允许为零)应用于锚定模型。将该方法应用于为 DR-TabPFN(Helli et al. 2024 (https://arxiv.org/html/2608.02845#bib.bib1))开发的基准数据集,我们发现外推方法相对于冻结版本提升了基础模型族的性能,并且提升在轻量级模型上最大、最可靠。最明显的例子是 XGBoost(Chen and Guestrin 2016 (https://arxiv.org/html/2608.02845#bib.bib21)),它在 18 个数据集中的 13 个上性能有所提升。所有模型更新只需少量额外内存,并能在比基础模型低数个数量级的推理时间内达到接近基础模型的性能。
我们总结贡献如下。
- •我们创建了一个单一的事后程序来减少数据和概念漂移,适用于神经网络、逻辑回归、树集成和基础模型。
- •我们在一个新基准上进行了评估,表明我们的方法平均提高了所研究每种模型的性能。
- •当我们将我们的方法(应用于小模型)与最先进的 DR-TabPFN 进行比较时,我们发现性能相当,但推理成本和内存仅为其一小部分(第5.5节 (https://arxiv.org/html/2608.02845#S5.SS5))。
## 2相关工作
数据漂移研究通常分为检测和适应两类(Lu et al. 2018 (https://arxiv.org/html/2608.02845#bib.bib12); Gama et al. 2014 (https://arxiv.org/html/2608.02845#bib.bib31); Greco and Cerquitelli 2021 (https://arxiv.org/html/2608.02845#bib.bib11))。我们将重点关注漂移适应方法,尤其是渐变性数据或概念漂移(He et al. 2021 (https://arxiv.org/html/2608.02845#bib.bib10))。
模型适应。对于每种类型的漂移,最简单的补救措施是重新训练模型,但确定最佳重新训练时间以及应向模型输入多少历史数据并非易事。朴素的重新训练调度包括按固定间隔重训,或一旦验证性能低于阈值就重训;更复杂的方法包括配对学习器(Bach and Maloof 2008 (https://arxiv.org/html/2608.02845#bib.bib3))以及学习最佳训练窗口的算法。周期性漂移(如季节性)更适合用集成方法处理(Sun et al. 2018 (https://arxiv.org/html/2608.02845#bib.bib9)),而持续演化的数据更适合用在线学习处理,例如 Very Fast Decision Tree Classifier(Domingos and Hulten 2000 (https://arxiv.org/html/2608.02845#bib.bib8))或 TabPFN(Lourenço et al. 2026 (https://arxiv.org/html/2608.02845#bib.bib4))。重要的是,这些方法都不容易适应标签延迟的情况,这正是 NOMADD 的动机。
连续域适应。使模型适应新数据是一种连续域适应(Wang et al. 2020 (https://arxiv.org/html/2608.02845#bib.bib35); Bai et al. 2023 (https://arxiv.org/html/2608.02845#bib.bib37))或增量域适应(Bitarafan et al. 2016 (https://arxiv.org/html/2608.02845#bib.bib34))。连续域适应可以通过对抗方法(Wang et al. 2020 (https://arxiv.org/html/2608.02845#bib.bib35); Bitarafan et al. 2016 (https://arxiv.org/html/2608.02845#bib.bib34))、调整域边界(Kumagai and Iwata 2016 (https://arxiv.org/html/2608.02845#bib.bib33))或最优传输(Ortiz-Jiménez et al. 2020 (https://arxiv.org/html/2608.02845#bib.bib32))来解决。该领域假设我们同时知道原始分布和新分布,而这在预测未知未来数据时是不可行的,NOMADD 正是如此。
时间域泛化。相比之下,时间域泛化方法预测(神经网络)模型在经历数据和概念漂移时如何变化。具体来说,梯度插值(Nasery et al. 2021 (https://arxiv.org/html/2608.02845#bib.bib36))使用时间敏感损失训练神经网络;DRAIN(Bai et al. 2023 (https://arxiv.org/html/2608.02845#bib.bib37))使用循环超网络生成未来网络权重;Koodos(Cai et al. 2024 (https://arxiv.org/html/2608.02845#bib.bib38))模型预测连续参数动态;时间专家平均(Liu et al. 2025 (https://arxiv.org/html/2608.02845#bib.bib39))使用预测权重对逐周期专家进行平均。所有这些都是在训练时进行的框架,且与可微模型绑定。与此同时,DR-TabPFN(Helli et al. 2024 (https://arxiv.org/html/2608.02845#bib.bib1))为表格基础模型 TabPFN(Hollmann et al. 2023 (https://arxiv.org/html/2608.02845#bib.bib30))提供了一种扩展,通过预训练二阶结构因果模型(其参数漂移)在上下文内统一数据和概念漂移。它是在我们所使用基准上已发表的最先进方法。与这些先前方法相比,NOMADD 是事后方法,而不是改变模型的训练方式。此外,它适用于多种模型,包括基于树的模型、神经网络和基础模型。
## 3方法
表1:参数和变量。最后四个 \(r\)、\(\phi\)、\(\lambda\) 和 \(\alpha\) 通过训练周期内的前向验证选择。下面我们解释 NOMADD 的构建方式,参数定义见表1 (https://arxiv.org/html/2608.02845#S3.T1)。
### 3.1设定
我们观察到来自 \(M\) 个有序时间周期的标注数据 \(\{ (X_m, y_m) \}_{m=0}^{M-1}\),并且必须对未标注的未来周期 \(m \ge M\) 进行预测。时间周期可以是预定义的,例如天或周,也可以创建任意数据分箱,以便在每个分箱内训练模型。在任何时候都没有未来标签可用,包括用于模型选择时。令 \(g\) 为基础学习器,\(\theta(g)\) 为表示其参数(如果是表格基础模型,则为对数概率场)的向量。NOMADD 是事后方法,因为它从不修改 \(g\) 的训练方式;它只观察一组普通拟合的序列,并为未来生成新的决策边界。
### 3.2数据恢复
为了解决数据漂移,我们受到先前关于数据偏移研究的启发(Tzen et al. 2017 (https://arxiv.org/html/2608.02845#bib.bib27)),重构数据如果在训练期间生成时会是什么样子。许多方法都可以使用;事实上,我们探索了基于扩散的方法以及受随机微分方程启发的方法。然而,我们发现最好的方法是最简单的方法之一。我们测量每个训练数据周期的均值和全协方差(在小的高维周期上使用 Ledoit-Wolf 收缩以保证稳定性),并绘制这些值随时间的变化。然后,我们用线性回归拟合这些变化,并将每个测试或验证周期回归到完整训练周期的均值和协方差上。这是我们流水线中的一个可选组件,验证只在有帮助的地方选择使用。我们发现它从未对验证周期内的基础模型有帮助。
### 3.3锚定模型与逐周期增量
我们在所有训练周期合并的数据上拟合一个*锚定模型* \(g_0\),并在每个训练周期 \(m\) 上分别拟合一个模型 \(g_m\)。锚定模型是对过去最省标签的总结,而逐周期模型单独来看噪声更大,但携带漂移信号。增量序列为
\[
d_m = \theta(g_m) - \theta(g_0), \qquad m=0,\dots,M-1,
\tag{1}
\]
其中 \(\theta\) 按模型族实例化,使增量在各个周期之间可比:
- •*参数化模型*(逻辑回归、MLP):展平的权重和偏置向量。逐周期模型从锚定模型热启动,因此 \(d_m\) 测量的是相对于锚定模型的位移,而不是优化路径的差异。
- •*树集成*(XGBoost):所有叶值组成的向量。树结构冻结为锚定模型的结构,每个周期只刷新叶值,因此分裂在所有时间都索引相同的叶,增量按构造对齐。
- •*上下文内模型*(TabPFN、DR-TabPFN):*logit 场*,即模型在一组固定查询点上的类别 log 概率,其中 \(g_m\) 以周期 \(m\) 的数据作为上下文。这不需要访问参数,使 NOMADD 适用于黑盒模型。
### 3.4低秩时间分解与阻尼预测
我们将增量堆叠为 \(D \in \mathbb{R}^{M \times P}\),其中 \(P\) 是边界维度。在短周期上的逐周期拟合是有噪声的,且噪声并不集中在边界实际移动的方向上。因此,我们使用截断奇异值分解 \(D \approx U_r \Sigma_r V_r^{\top}\) 进行压缩,得到 \(r\) 个潜在时间轨迹 \(z_{\cdot k} = (U_r \Sigma_r)_{\cdot k} \in \mathbb{R}^M\)。每个轨迹在最后一个训练周期之后外推 \(h\) 步,使用阻尼、正则化的线性趋势,
\[
\hat{z}_{M-1+h,\,k} = \ell_k + \frac{s_k}{1+\lambda}\bigl(\phi + \phi^2 + \dots + \phi^h\bigr),
\tag{2}
\]
其中 \(\ell_k\) 和 \(s_k\) 是对 \(z_{\cdot k}\) 进行最小二乘拟合得到的水平和斜率,阻尼 \(\phi \in (0,1]\) 防止短趋势被无限外推,\(\lambda \ge 0\) 收缩斜率。设置 \(\phi=1\) 且 \(\lambda=0\) 可恢复普通最小二乘,因此阻尼预测严格泛化了线性趋势。预测因子通过 \(\Sigma_r V_r^{\top}\) 解码回预测增量 \(\hat{d}_{M-1+h}\),并以收缩权重应用于锚定模型,
\[
\hat{\theta}_{M-1+h} = \theta(g_0) + \alpha\,\hat{d}_{M-1+h}, \quad \alpha \in \{0,\tfrac{1}{4},\tfrac{1}{2},\tfrac{3}{4},1\}.
\tag{3}
\]
因为 \(\alpha=0\) 会原样部署冻结的锚定模型,所以选择过程始终可以拒绝外推,方法永远不会被迫移动历史不足以证明其合理性的边界。
### 3.5配置选择
秩 \(r \in \{1,2,\text{full}\}\)、阻尼 \(\phi \in \{0.4,0.7,1.0\}\)、正则化 \(\lambda \in \{0,1\}\) 和收缩 \(\alpha\) 通过*训练周期内部*的前向验证选择。对于最后 \(V=3\) 个训练位置 \(m\) 中的每一个,整个流水线仅使用周期 \(0,\dots,m-1\) 重建,包括仅在这些周期上合并的新锚定模型,然后将所得预测对周期 \(m\) 的标签进行评分。这些是训练标签,因此任何阶段都不会引入未来信息。相似文章
基于LMO方法的零阶无参数优化:高效微调的新方法
本文介绍了AdaNAGED,一种结合零阶优化、无参数自适应和非欧几里得更新几何的方法,用于大型语言模型的内存高效微调,具有理论收敛保证,并在OPT-1.3B模型上进行了验证。
用于优化离散扩散语言模型的漂移目标
本文提出TokenDrift,一种漂移目标方法,通过将分类预测提升至连续语义空间进行反对称漂移,从而优化离散扩散语言模型。在固定去噪步数下,该方法显著提升了生成质量。
漂移感知时间图重连(DATGR)用于生物医学文本的自适应语义建模
引入了漂移感知时间图重连(DATGR),动态更新生物医学文本图中的共现边,捕获语义漂移而无需完整重新训练。在BIOMRC上的评估表明,与静态基线相比,平均AUROC提升了0.066,同时保持了精确度。
ADAPTOOD:面向分布外心电图时间序列模型的不确定性感知微调
ADAPTOOD 是一种新颖框架,利用数据不确定性量化分布偏移的严重程度,并指导心电图时间序列模型在分布外设置下的微调。它将不确定性估计与低秩模型更新和自适应超参数优化相结合,在现有OOD自适应方法基础上实现了高达7%的准确率提升和12.9%的精确度提升。
DRIFT:通过在线策略数据归因优化指令数据
DRIFT提出了一种方法,利用在线策略影响函数来优化大型语言模型监督微调的训练数据分布,持续提升现有基线的性能上限。