@gp_pulipaka: 随机优化器。 #大数据 #分析 #数据科学 #AI #机器学习 #物联网 #工业物联网 #PyTorch #Python #RStats #Tensor…

X AI KOLs Timeline 论文

摘要

本文讨论了一篇研究论文,该论文表明,使用不同随机种子训练的两个深度网络之间的分歧率可以仅使用未标记数据准确估计泛化误差,揭示了一个名为泛化分歧等式的惊人联系。

随机优化器。 #大数据 #分析 #数据科学 #AI #机器学习 #物联网 #工业物联网 #PyTorch #Python #RStats #TensorFlow #Java #JavaScript #ReactJS #GoLang #云计算 #无服务器 #数据科学家 #Linux #编程 #编码 #100DaysofCode https://t.co/ZgNyCRWNmD https://t.co/tL2YyIqhDx
查看原文
查看缓存全文

缓存时间: 2026/07/28 14:28

Stochastic Optimizer. #BigData #Analytics #DataScience #AI #MachineLearning #IoT #IIoT #PyTorch #Python #RStats #TensorFlow #Java #JavaScript #ReactJS #GoLang #CloudComputing #Serverless #DataScientist #Linux #Programming #Coding #100DaysofCode https://t.co/ZgNyCRWNmD https://t.co/tL2YyIqhDx


通过不一致性评估SGD的泛化能力

来源:https://blog.ml.cmu.edu/2022/03/04/assessing-generalization-of-sgd-via-disagreement/ 想象一下,用两个不同的随机种子在同一数据上分别训练一个深度网络两次,然后测量它们在无标签测试点上产生不一致预测的频率。直观来看,它们之间不一致的概率可以介于0到两倍错误率之间的任何值。但令人惊讶的是,在实践中我们观察到深度神经网络的不一致性测试误差非常接近。变量 \(y\) 指的是两个模型的平均泛化误差,变量 \(x\) 指的是两个模型的不一致性。

估计模型的泛化误差(即模型在未见数据上的表现)是任何机器学习系统的核心组成部分。传统上,泛化性能是通过监督方式估计的,即将有标签数据划分为训练集和测试集。然而,高质量标签通常成本高昂,理想情况下我们希望将所有标签都用于训练模型。另一方面,在很多现实场景中,大量无标签数据是现成可用的。我们如何利用这些无标签数据中丰富的信息,在不依赖标签的情况下评估模型性能呢?

在这项工作(完整论文:https://arxiv.org/abs/2106.13799)中,我们证明了一个简单的过程可以仅用无标签数据准确估计泛化误差。这一结果揭示了一个关于神经网络如何犯错以及它们与校准之间联系的惊人事实,我们通过一个称为泛化-不一致相等性(GDE)的恒等式来阐述这一联系。

一个惊人的观察

随机梯度下降(SGD)可能是深度神经网络最流行的优化算法。由于深度神经网络优化景观的非凸性,不同的SGD运行会找到不同的解。因此,如果这些解不是完美的,它们会在一些未见数据上产生不一致。这种不一致性可以被用来无需标签地估计泛化误差:

  1. 给定一个模型,在训练数据上使用相同的超参数但不同的随机种子运行SGD,得到两个不同的解。
  2. 测量这些网络在新的无标签测试数据集上预测不一致的频率。

我们发现,不一致率大约等于两个模型平均测试误差。我们的观察基于 Nakkiran 和 Bansal(2020)[1] 报告的现象:给定两个相同架构的网络,分别在同一大小的两个独立抽取数据集上训练到零训练误差,它们在测试数据集上的不一致率几乎等于平均测试误差。我们的观察推广了先前的工作,表明同样的现象也适用于超参数的微小变化,更重要的是,也适用于相同数据集,这使得该过程对实际应用具有重要意义。

这个程序可以用无标签数据估计测试误差,但背后的机制并不明显。设 \(h(x)\) 为分类器 \(h\) 的预测,\(y\) 为真实标签。根据三角不等式,不一致率可以介于0到2倍测试误差之间:\( 0 \leq \mathbb{E}[h(x) \ne h’(x)] \leq \mathbb{E}[h(x) \ne y] + \mathbb{E}[h’(x) \ne y] \)。鉴于模型观察相同的数据,我们可能预期模型从数据中提取相似的知识,从而犯相似的错误,这将使不一致率低于测试误差。然而,在实践中我们发现,不一致率近似等于测试误差,没有任何比例常数。为什么会这样?

SGD最终找到的参数取决于许多随机性来源:1)随机初始化,2)固定训练数据集的随机顺序,和/或3)训练数据的随机抽样。为了理解这一现象,我们分析了哪些随机性导致了这一奇特性质。其他随机性来源(如dropout)也是可能的,但本文未进行研究。

我们通过观察当隔离不同随机性来源时不一致行为如何变化来研究这一现象。例如,在检查不同初始化的影响时,我们固定数据集和数据集呈现给模型的顺序,只改变随机初始化。我们观察到,在不同类型的随机性下,不一致性始终与测试误差保持接近。这种方法特别有用,因为我们可以使用相同的训练数据来训练模型的两个副本。此外,我们通过实验在广泛的模型架构(ResNet、VGG和全连接网络)以及几个流行的图像识别基准(MNIST、SVHN、Cifar10和Cifar100)上观察到了这一现象。

CIFAR-10上的GDE: 在CIFAR10上训练的不同ResNet18的成对模型不一致性(x轴)与测试误差(y轴)的散点图。虚线是不一致性等于测试误差的对角线。橙色点代表使用数据增强的模型。前两个图对应在独立数据集上训练的网络对,后两个图对应在同一数据集上训练的网络对。

此外,当测试分布与训练分布不同时,估计泛化误差尤其重要。在这方面,我们在PACS数据集 [2] 上看到了一些有希望的观察。该数据集包含4个不同环境(Photo 照片、Art 艺术画、Cartoon 卡通、Sketch 素描),每个环境有不同的物体。对于每个环境,我们在该环境上训练了两个ResNet18模型,使用不同的初始化和数据顺序,并测量它们在其余环境上的不一致率。我们观察到类似的现象在许多(但不是所有)环境对中成立,这表明该技术可能适用于估计分布漂移下的泛化误差。

分布漂移下的GDE: 在PACS上训练的不同ResNet50的成对模型不一致性(x轴)与测试误差(y轴)的散点图。每个图对应在标题指定的领域上评估的模型。源/训练领域用不同的标记形状表示。

泛化-不一致相等性

现在我们将在理论上研究不一致率等于泛化误差的充分条件。

在深度学习文献中,众所周知,SGD训练的深度网络的集成在训练分布上是良好校准的 [3]。如果一个集成为类别 \(k\) 输出的置信度 \( \tilde{h}k(x) = \mathbb{E}{h_k \sim H_A}[h(x)] \) 匹配期望准确率,即 \( P(y \mid \tilde{h}k(x) = p) = p \),则称该集成是良好校准的。*存在多种校准形式化方法。在本文中,我们证明如果集成对分布 D 满足类别级校准(论文中讨论了更一般形式的校准),那么严格等式 *\(\mathbb{E}{h, h’}[\mathbb{E}_D[h(x) \neq h’(x)]] = \mathbb{E}_h[\mathbb{E}_D[h(x) \neq y]]\)* 成立。我们称这个等式为泛化-不一致相等性(GDE)。

证明概要

这里给出的证明概要侧重于一个特例,即类别级校准成立。考虑二分类问题。假设我们有一个由SGD算法 \(A\) 给出的假设分布 \(H_A\),我们从该分布中采样两个假设 \(h, h’\)。现在给定一些测试数据 \(D\),我们根据集成的置信度输出将其划分,即 \(D_q = P(X \ | \ \tilde{h}_0(x) = q)\)。对于 \(D_q\) 支撑集中的任意固定 \(x\),在 \(h, h’\) 期望下的不一致率为

\mathbb{E}_{h,h’}[h(x) \ne h'(x)] \\ = P(\tilde{h}(x) = 1)P(\tilde{h}(x) = 0) + P(\tilde{h}(x) = 0)P(\tilde{h}(x) = 1) \\ = q(1-q) + (1-q)q = 2q(1-q)。

此外,注意对于任意 \(x \in D\),期望误差等于 \(\tilde{h}_{1 – y}(x)\)。由于集成也是类别级校准的,对于任意 \(x \in D_q\),在 \(h \in H_A\) 上的期望误差为

\mathbb{E}_h[h(x) \ne y] \\ = \tilde{h}_0(x)P(y = 1 | \tilde{h}(x) = 1) + \tilde{h}_1(x)P(y = 0 | \tilde{h}(x) = 0) \\ = q(1-q) + (1-q)q = 2q(1-q)

我们证明了对于每个校准水平集,GDE 成立。由于不一致率 \(2q(1-q)\) 等于期望误差 \(2q(1-q)\),我们得出结论:期望误差等于不一致率。由于不一致率 \(2q(1-q)\) 等于期望误差 \(2q(1-q)\),我们得出结论:期望误差等于不一致率。因此,在 \(D\) 的期望下,GDE 成立。


请注意,该定理仅表明测试误差和期望不一致性在SGD学习的所有模型的期望上相等,但并未解释为什么对于少至一对训练运行,该等式似乎也成立。它抓住了观察的本质,但解释为何一对模型就足够仍然是一个开放问题。直观上,如果不一致性的分布具有异常小的方差,这可能成立。在我们的实验中,我们确实观察到了不一致性非常小的方差,但对方差为何小的严格理论讨论仍未解决。

此外,在实践中,没有模型是完美校准的,但我们仍然可以刻画校准偏差如何影响GDE。我们表明,校准误差上界限制了期望不一致性与期望校准误差之间的绝对差。这个不等式推广了GDE,意味着只要集成是合理校准的,我们就可以期望从不一致性得到泛化误差的良好估计。最后,我们通过实验验证了这一假设在实践中经常成立:我们训练了同一模型的100个副本,得到忠实于真实集成的集成,并测量其校准误差。结果表明,这些集成确实是良好校准的。

结论

我们提出了一种仅用无标签数据估计黑盒深度神经网络泛化误差的方法,并提供了该方法为何有效的理论动机。具体来说,我们证明如果SGD训练的模型集成是良好校准的,则期望不一致性等于期望测试误差。然而在实践中,仅一对模型就足以准确估计泛化误差。从更广阔的视角来看,这一结果标志着对传统泛化研究方法的背离,并指出了利用无标签数据估计泛化误差的诱人可能性。我们对论文中呈现的结果感到兴奋,但对论文中未解答的问题更加兴奋。我们希望这项工作能鼓励未来研究探索理解深度学习泛化的更多非常规方式。

参考文献

[1] Nakkiran and Bansal. Distributional Generalization: A New Kind of Generalization. 2020. [2] Li et al. Deeper, Broader and Artier Domain Generalization. IEEE Intl. Conf. on Computer Vision (ICCV), 2017. [3] Lakshminarayanan et al. Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles. Conference on Neural Information Processing Systems (NeurIPS), 2017.

相似文章

当标签稀缺时优化如何发挥作用 [R]

Reddit r/MachineLearning

Gnosys Labs 推出了一种自主模型工程方法,在标签稀缺的情况下改进分类器,在 ToxicChat 基准测试中优于 GEPA 等标准优化器。

关于固定点参数下GD和SGD的一致稳定性与泛化误差

arXiv cs.LG

本文分析了离散参数空间中采用确定性或随机舍入的梯度下降(GD)和随机梯度下降(SGD)的泛化误差、一致稳定性和一致参数稳定性,表明舍入会降低GD的泛化性能,并为随机舍入引入了维度相关的误差。

深度强化学习中的性能变异

arXiv cs.LG

本文指出了深度强化学习中传统不确定性估计的局限性,并提出基于百分位数的统计量和可视化方法,以更好地评估运行间性能变异。案例研究展示了该方法在PPO、SAC、TD-MPC、DQN和Rainbow算法上的应用。