训练日志能否使模型比较更精确?

arXiv cs.LG 论文

摘要

本文研究来自随机运行的训练日志能否通过特定于臂的协变量调整来提高模型比较的精确度,发现简单的调整可以减少不确定性,但需要仔细选择协变量以避免噪声。

arXiv:2608.02705v1 公告类型:新 摘要:比较随机训练的模型需要从重复运行中估计性能差异及其不确定性。我们研究来自相同运行的训练日志是否能使这种比较更精确。由于训练日志协变量是在训练过程中产生的,而非事先测量,我们采用特定于臂的协变量调整:每个模型仅使用其自身运行的统计量进行调整,而原始均值差异仍作为报告的效果。在一项涵盖三种架构和三个数据集的视觉研究中,基于早期训练日志的简单调整通常能降低模型比较的不确定性。主要限制在于协变量选择。广泛搜索日志池中相关性最高的统计量往往增加的噪声多于其消除的噪声,即使事后存在有用的统计量也是如此。因此,训练日志似乎有助于进行更精确的模型比较,但前提是调整能避免较大的选择噪声。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:41

# 训练日志能否让模型比较更精确?
来源:https://arxiv.org/html/2608.02705
###### 摘要

比较随机训练的模型需要从重复运行中同时估计性能差异及其不确定性。我们研究来自这些相同运行的训练日志是否能使此类比较更精确。由于训练日志协变量是在训练过程中产生的,而非在训练前测量的,我们使用按组协变量调整:每个模型仅使用其自身运行的统计量进行调整,原始均值差仍作为报告的效应。在一项涵盖三种架构和三个数据集的视觉研究中,基于早期训练日志的简单调整通常能降低模型比较中的不确定性。主要限制在于协变量选择。广泛地在日志池中搜索与结果最相关的统计量往往会增加噪声而非减少噪声,即使事后看来存在有用的统计量也是如此。因此,训练日志似乎有助于更精确的模型比较,但前提是调整能避免较大的选择噪声。

方差缩减、协变量调整、假设检验、模型比较、随机训练

## 1 引言

对随机训练的模型进行任何比较都依赖于重复运行。由于每次运行取决于初始化、数据顺序以及非确定性的实现细节,两个模型之间的性能差异不是单一数值,而是带有不确定性的统计估计。运行间变异直接决定该估计的标准误差,并可能改变报告的置信区间和模型排名(Bouthillier 等人,2021 (https://arxiv.org/html/2608.02705#bib.bib1);Henderson 等人,2018 (https://arxiv.org/html/2608.02705#bib.bib10);Dehghani 等人,2021 (https://arxiv.org/html/2608.02705#bib.bib3))。标准的解决方法是增加重复次数,但这会在计算上线性扩展。

如果早期训练统计量与跨重复运行中的最终测试准确率相关,则减去其居中化贡献可以降低运行级别的变异。分别应用于每个模型,这种调整可以在不改变被比较模型的情况下收紧性能差异的置信区间。这一思想与在线 A/B 测试中的回归调整(CUPED)密切相关(Deng 等人,2013 (https://arxiv.org/html/2608.02705#bib.bib4)),其中实验前用户指标用于降低结果方差,从而收紧治疗效应的置信区间。

一个重要区别在于,A/B 测试中的协变量是在治疗分配之前测量的,而训练日志协变量(如早期验证准确率、梯度范数和批量损失摘要)是与结果共同产生的。由于这些协变量可能因科学原因在不同模型间存在差异,合并调整可能会移除模型差异本身的一部分。因此,我们使用*按组*调整:每个模型仅使用其自身的训练日志协变量进行调整,并将调整后的离散度合并到性能差异的标准误差中。

我们研究三个实证问题:训练日志是否包含关于最终性能的有用的运行级别信号;在典型的运行预算下,这种信号能否被可靠地选择;以及当用于调整的统计量预先固定时,按组调整是否会收紧模型性能差异的置信区间。实验设计是一个 \(3\times 3\) 因子研究(ResNet-18、ViT-Tiny、ConvNeXt-Tiny \(\times\) CIFAR-10、CIFAR-100、Tiny-ImageNet;每个单元 50 次运行,共 450 次运行)。我们的贡献如下:

1. 1\. 一个用于模型比较的按组调整框架。每个模型仅使用其自身训练日志协变量进行调整,并通过交叉拟合系数估计、覆盖率诊断和零假设校准检查(§3 (https://arxiv.org/html/2608.02705#S3)、§5.1 (https://arxiv.org/html/2608.02705#S5.SS1)、§5.2 (https://arxiv.org/html/2608.02705#S5.SS2))进行评估。
2. 2\. 模型特定的协变量信号与选择风险。固定的早期验证损失调整和训练日志族的 PCA 摘要可以在某些单元中显著降低单臂方差,但哪一种训练统计量有效取决于模型和训练方案,而且从大量候选池中选择最佳统计量常常适得其反(§5.4 (https://arxiv.org/html/2608.02705#S5.SS4)、§5.5 (https://arxiv.org/html/2608.02705#S5.SS5))。
3. 3\. 两两比较的证据。在足够的运行预算下,按组调整会收窄性能差异的置信区间,但在运行次数过少、无法稳定估计时会使其变宽(§5.3 (https://arxiv.org/html/2608.02705#S5.SS3)、§5.6 (https://arxiv.org/html/2608.02705#S5.SS6))。
4. 4\. 实践指导。训练日志统计量应在被用作模型比较的主要调整之前选定;否则,该调整应作为探索性结果报告。在有限运行预算下的可靠选择仍然是主要的开放问题(§6 (https://arxiv.org/html/2608.02705#S6))。

## 2 相关工作

#### 深度学习中的运行间变异。

深度学习结果对随机初始化的敏感性已在强化学习(Henderson 等人,2018 (https://arxiv.org/html/2608.02705#bib.bib10))、GAN(Lucic 等人,2018 (https://arxiv.org/html/2608.02705#bib.bib16))、NLP 微调(Dodge 等人,2020 (https://arxiv.org/html/2608.02705#bib.bib5);Sellam 等人,2022 (https://arxiv.org/html/2608.02705#bib.bib21))和监督视觉(Bouthillier 等人,2021 (https://arxiv.org/html/2608.02705#bib.bib1);Picard,2021 (https://arxiv.org/html/2608.02705#bib.bib18))中得到记录。Dehghani 等人(2021 (https://arxiv.org/html/2608.02705#bib.bib3))认为运行间变异和单划分评估创造了“基准抽奖”现象,使感知到的排名变得脆弱。这些研究促使我们增加重复次数或更仔细地报告方差。作为这些研究的补充,我们提问:训练日志能否在固定运行预算下降低不确定性?

#### 回归调整与方差缩减。

经典的方差缩减方法减去具有已知均值的相关信号以降低蒙特卡洛方差(Owen,2013 (https://arxiv.org/html/2608.02705#bib.bib17))。回归调整(Deng 等人,2013 (https://arxiv.org/html/2608.02705#bib.bib4))在 A/B 测试中使用实验前用户指标,并通过提升树进行非线性扩展(Poyarkov 等人,2016 (https://arxiv.org/html/2608.02705#bib.bib19))。在随机实验文献中,Freedman(2008 (https://arxiv.org/html/2608.02705#bib.bib7))表明回归调整可能提高或降低精度,可能引入有限样本偏差,并可能使通常的标准误差在随机化下产生误导。Lin(2013 (https://arxiv.org/html/2608.02705#bib.bib14))表明,当调整将处理与居中协变量交互并使用稳健标准误差时,这些问题在大量样本下是轻微或可修复的。我们的设置有两个不同点。首先,估计目标是模型在重复训练运行上的期望性能,而两两比较结合两个这样的按组估计量。其次,协变量是共同产生的,而非处理前的。折外估计减轻了直接过拟合,但共同产生的设置缺乏处理前独立性保证,因此我们通过对实际训练的 50 次运行进行重采样来检查区间校准(第 5.1 (https://arxiv.org/html/2608.02705#S5.SS1) 节)。Ridge 和 James-Stein 收缩可以进一步稳定多元情况下的系数估计;我们关注普通最小二乘(OLS)和主成分分析(PCA)以保持可解释性。贝叶斯部分合并(Gelman 等人,2013 (https://arxiv.org/html/2608.02705#bib.bib8))提供了一种替代方案;我们采用频率学派方法,因为它需要更少的分布假设,并能给出可在我们的诊断中经验性检查覆盖率的区间估计。

#### 学习曲线预测。

早期训练信号可以预测收敛后的性能(Domhan 等人,2015 (https://arxiv.org/html/2608.02705#bib.bib6)),这一结构常被用于提前停止和超参数搜索。我们将相同的相关性用于不同目标:不是预测最终准确率或决定何时停止,而是在训练完成后利用它们降低运行级别的变异性。我们实验中的固定验证损失协变量(第一个三分之一轮次时的验证损失)就是这种学习曲线结构在协变量调整中的直接应用。无需修改训练流程。

## 3 方法

### 3.1 按组协变量调整

设模型 \(m\in\{A,B\}\) 从运行 \(s\in\{1,\ldots,n_m\}\) 产生最终测试准确率 \(Y_{m,s}\),并设 \(X_{m,s}\in\mathbb{R}^{p_m}\) 为来自同一次运行的训练日志协变量。模型比较的估计目标为

\[
\Delta=\mu_{A}-\mu_{B},\quad \mu_{m}=\mathbb{E}[Y_{m,s}],
\]
(1)
其中期望针对同一模型和方案的重复随机训练运行。零假设为 \(H_{0}\colon\Delta=0\)。报告的 \(\Delta\) 点估计始终是原始均值差 \(\bar{Y}_{A}-\bar{Y}_{B}\);协变量调整只改变估计的标准误差和置信区间宽度,而不改变点估计本身。

对于 arm \(m\) 中固定的训练日志统计量或固定统计量向量,定义调整后的运行值

\[
Y^{\mathrm{adj}}_{m,s}=Y_{m,s}-\theta_{m}^{\top}(X_{m,s}-\mu_{X,m}),
\]
(2)
其中 \(\mu_{X,m}=\mathbb{E}[X_{m,s}]\)。如果 \(\mu_{X,m}\) 已知,则居中协变量的均值为零,且对于任意固定的 \(\theta_{m}\),有 \(\mathbb{E}[Y^{\mathrm{adj}}_{m,s}]=\mu_{m}\)。系数影响的是方差而非目标。对于单个协变量,使用总体最优系数时,方差缩减(VR)为

\[
\mathrm{VR}_{m}=1-\frac{\mathrm{Var}(Y^{\mathrm{adj}}_{m})}{\mathrm{Var}(Y_{m})}=\rho_{X_{m}Y_{m}}^{2}.
\]
(3)
在有限样本中,实际 VR 小于 \(\rho^2\),因为必须估计 \(\theta_{m}\);其代价大致随 \(1/n_{\mathrm{train}}\) 增长(第 3.2 (https://arxiv.org/html/2608.02705#S3.SS2) 节)。因此,能够解释运行级别变异的训练统计量可以降低 \(\mu_{m}\) 的标准误差,并且在两个组中独立应用时,可以降低 \(\Delta\) 的标准误差。

调整必须是按组的。将结果对模型身份和共同产生的训练统计量进行合并回归,可能会移除模型差异的一部分,因为早期验证损失或梯度范数恰恰可能因模型训练方式不同而在模型之间有所差异。因此,我们在每个模型内部单独拟合调整,并仅在调整后合并两个按组标准误差。

### 3.2 协变量选择风险

如果在筛选许多候选之后才选择协变量,表观相关性可能是乐观的,实际 VR 可能为负。直观地说,在小训练样本上看起来与结果最相关的协变量可能在保留运行上不再相关,导致调整增加噪声而非减少噪声。估计惩罚大约为 \(\sim p/n_{\mathrm{train}}\),其中 \(p\) 是协变量的有效数量。对于单个选定的协变量,名义 \(p=1\),但对数百个候选的隐式搜索会夸大有效自由度。这一风险促使我们使用折外估计(第 3.4 (https://arxiv.org/html/2608.02705#S3.SS4) 节),并在第 5.5 (https://arxiv.org/html/2608.02705#S5.SS5) 节中进行实证分析。

### 3.3 为什么需要谨慎处理共同产生的协变量

在 A/B 测试的标准回归调整中,协变量在治疗之前测量,从而将协变量测量与治疗分配分开。这种分离有助于防止协变量调整吸收治疗效应的一部分(Rosenbaum,1984 (https://arxiv.org/html/2608.02705#bib.bib20))。训练日志协变量则不同:它们由与最终准确率被评估的同一个随机运行产生。

两个设计选择使调整在我们的设置中具有科学可解释性。首先,我们仅在产生协变量的组内使用协变量。这使得每个组的目标保持为该模型的期望最终准确率,而不是在控制一个共同的后处理变量之后的性能对比。其次,我们通过折外方差缩减以及基于实际训练的 50 次运行进行重采样得到的覆盖率诊断来评估每个提议的训练日志调整,而不是假定降低的残差方差自动产生有效的假设检验。

如果训练日志统计量和总体协变量均值是预先固定的,那么方程 2 (https://arxiv.org/html/2608.02705#S3.E2) 中的居中化将保持组均值不变。在实践中,系数和协变量均值都从相同的有限运行预算中估计。交叉拟合减少了直接过拟合,但结果仍然报告方差缩减和区间覆盖率,以实证验证调整。

### 3.4 交叉拟合评估

上面的总体表达式假设 \(\theta_{m}\) 和 \(\mu_{X,m}\) 已知。实际上,两者都必须从用于评估的相同运行中估计。这产生一种风险:调整可能通过记住运行级别的噪声而非捕捉稳定结构来降低表观方差。我们使用 \(K\) 折交叉拟合(Chernozhukov 等人,2018 (https://arxiv.org/html/2608.02705#bib.bib2)),全文取 \(K=5\)。运行被划分为 \(K\) 折,对于折叠 \(f(s)\) 中的运行 \(s\),冗余参数从补集中估计:

\[
\tilde{Y}_{m,s}=Y_{m,s}-\hat{\theta}_{m,-f(s)}^{\top}\bigl(X_{m,s}-\hat{\mu}_{X,m,-f(s)}\bigr).
\]
(4)
对于单组诊断,我们将交叉拟合调整后结果的样本方差与原始结果方差进行比较。对于两两比较,我们在每个组内重新居中调整后的结果,以保持报告的性能差异等于原始差异,然后使用调整后的组内方差计算 Welch 式区间。这种保守的报告选择将模型排名与方差估计分开:协变量可以改变报告的不确定性,但不能改变报告的平均性能差异。

由于同一折叠内的调整结果共享拟合系数,并且我们为了保持原始点估计而重新居中,第 5.1 (https://arxiv.org/html/2608.02705#S5.SS1) 节通过对实际训练的 50 次运行进行重复重采样来检查调整后区间的覆盖率。

交叉拟合防止系数直接记住保留运行。然而,如果使用相同的运行从大型池中*选择*协变量,那么选择步骤也必须排除在折叠之外,以避免选择与评估运行中的噪声相关的统计量。正如我们在第 5.5 (https://arxiv.org/html/2608.02705#S5.SS5) 节中所示,这个选择问题是主要的实际瓶颈。

### 3.5 两两比较区间

对于两个模型 A 和 B,按组调整给出估计的组内标准差 \(s_{\mathrm{adj},A}\) 和 \(s_{\mathrm{adj},B}\)。

相似文章

LLM后训练中应比较哪些配对?

arXiv cs.AI

本文研究了LLM后训练中如何选择需要标注的完成对以供人类偏好反馈的问题。它将比较筛选问题形式化为采样设计问题,给出了DPO策略最优性差距的理论上界,并提出了实用的采样设计方案,在合成和真实基准测试上比常规启发式方法更有效地提高了样本效率。

不要让模型编写审计日志

Reddit r/AI_Agents

本文警告不要将模型生成的叙述作为AI代理的权威审计日志,主张改为持久化原始工具调用数据,并建议通过简单的差异检查来发现不一致之处。