表格数据上经典机器学习的缩放定律:一项基准研究

arXiv cs.LG 论文

摘要

本文对表格数据上经典机器学习模型的缩放定律进行了一项分布式基准研究,结果表明幂律拟合适用于大多数模型家族,并量化了127名学生运行中复制者实现的差异。

arXiv:2607.21866v1 公告类型:新 摘要:先前的经典机器学习学习曲线研究对树模型、线性模型和核模型在表格数据上拟合幂律,但规模较小:通常是一条曲线、一个团队、少量单元。我们提出了一项分布式课堂规模复制研究:127名学生各自在3个指定数据集上运行固定协议,这些数据集来自18个表格分类和回归数据集以及6个模型家族(Boosting、随机森林、SVM、线性/逻辑回归、Ridge、Lasso),共产生11,536次训练运行和1,648条拟合的误差(N) = a N^(-b) + c 形式的幂律曲线。三项发现。(1) 幂律拟合良好:77.7%的单元R^2 > 0.8,其中树集成在全数据上占优(Boosting在50%的数据集上,RandomForest在33%上;线性模型在分类中表现不佳)。(2) 模型家族内近似共享指数:对于6个家族中的5个,单个家族水平的指数预测每个家族跨数据集的曲线几乎与每个数据集指数一样好(R^2差距<0.011),尽管AIC偏向无约束拟合且曲线折叠部分(32-58%的点在+/-0.5 dex内)。我们将其视为近似预测可压缩性,而非数据集无关的普遍性;Lasso完全失败(阴性对照),Ridge在留一数据集测试中脆弱。(3) 复制者实现差异:固定random_state=42时,同一协议的独立重新实现拟合指数平均CV(b)=0.144——不是种子方差,而是协议未约束部分(预处理、编码、缺失值处理)引起的扩散。我们发布了聚合曲线、每个单元的拟合结果以及达到目标误差0.15所需的N*实用数据需求表。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:42

# 表格数据上经典机器学习的缩放定律:一项基准研究
来源:https://arxiv.org/html/2607.21866
###### 摘要

先前的经典机器学习学习曲线研究将幂律拟合应用于表格数据上的树模型、线性模型和核模型(Perlichet al., 2003 (https://arxiv.org/html/2607.21866#bib.bib11);Mukherjeeet al., 2003 (https://arxiv.org/html/2607.21866#bib.bib12);Figueroaet al., 2012 (https://arxiv.org/html/2607.21866#bib.bib14);Domhanet al., 2015 (https://arxiv.org/html/2607.21866#bib.bib13)),但规模较小:通常是一条曲线、一个团队、少量数据点。我们展示了一项分布式课堂规模的复现研究:127名学生各自对3个分配的数据集运行固定协议,这些数据集来自18个表格分类和回归数据集以及6个模型族(Boosting、随机森林、SVM、线性/逻辑回归、Ridge回归、Lasso回归),产生了11,536次训练运行和1,648条拟合的幂律曲线,形式为 \(\mathrm{error}(N)=aN^{-b}+c\)。三项发现。(1) 幂律拟合良好:77.7%的数据单元 \(R^2>0.8\),树集成模型在全量数据上占据主导(Boosting在50%的数据集上最佳,RandomForest在33%上最佳;线性模型在分类任务上表现不佳)。(2) 模型族内的近似共享指数:对于6个族中的5个,单个家族级指数预测该族跨数据集曲线的效果几乎与每个数据集单独拟合指数一样好(\(R^2\) 差距 <0.011),尽管AIC支持无约束拟合,且曲线坍塌是部分的(32–58%的点在 \(\pm0.5\) 倍标准差范围内)。我们将其视为近似的预测可压缩性,而非数据集无关的普适性;Lasso完全失败(阴性对照),Ridge在留一数据集交叉验证中表现脆弱。(3) 复制者实现差异:在固定 `random_state=42` 的情况下,同一协议的独立重新实现之间,拟合指数 \(b\) 的变异系数均值 \(\mathrm{CV}(b)=0.144\)——这不是种子方差,而是由协议中未约束部分(预处理、编码、缺失值处理)引起的散布。我们发布了汇总曲线、每个数据单元的拟合结果,以及一个实用的数据需求量表,用于达到目标误差0.15所需的 \(N^\star\)。

## 1 引言

经验缩放定律已成为大型神经网络设计、训练和预算的核心:测试损失随模型大小、数据集大小和计算量的可预测幂律衰减,如今指导着每次训练运行耗资数千万美元的决策(Kaplanet al., 2020 (https://arxiv.org/html/2607.21866#bib.bib1);Hoffmannet al., 2022 (https://arxiv.org/html/2607.21866#bib.bib2);Hestnesset al., 2017 (https://arxiv.org/html/2607.21866#bib.bib3);Rosenfeldet al., 2020 (https://arxiv.org/html/2607.21866#bib.bib4))。然而,工业界绝大多数应用机器学习并非针对文本或图像的大型神经网络,而是应用于表格商业数据的梯度提升树、随机森林和线性模型——如客户流失预测、违约风险、销售预测、广告点击预测和因果市场细分(Dinget al., 2024 (https://arxiv.org/html/2607.21866#bib.bib17))。正是在这些场景下,树集成模型持续超越深度学习(Grinsztajnet al., 2022 (https://arxiv.org/html/2607.21866#bib.bib5);Shwartz-Ziv and Armon, 2022 (https://arxiv.org/html/2607.21866#bib.bib6))。尽管存在经典机器学习学习曲线的文献(Perlichet al., 2003 (https://arxiv.org/html/2607.21866#bib.bib11);Mukherjeeet al., 2003 (https://arxiv.org/html/2607.21866#bib.bib12);Figueroaet al., 2012 (https://arxiv.org/html/2607.21866#bib.bib14);Domhanet al., 2015 (https://arxiv.org/html/2607.21866#bib.bib13)),但据我们所知,之前没有研究能像Kaplan等人针对单个研究团队内的transformer所做的那样,在跨复制者规模上刻画其泛化误差随训练集大小的缩放特征。

我们的贡献并非将幂律拟合到树或线性模型学习曲线这一想法本身,而是**复现的规模**:我们将一个固定协议运行了127次,每次由一名研究生机器学习课程的学生执行(每个学生随机分配18个数据集中的3个),产生了11,536个模型拟合和1,648条成功的缩放曲线。这使我们能够测量指数及其在名义上合规的重新实现之间的方差。

我们的贡献包括:

- • **模型族内近似的共享指数**:我们区分三个层次的声明。 (a) **拟合**:加性幂律很好地描述了单个曲线(77.7% 的曲线 \(R^2>0.8\))。 (b) **压缩**:一个单一的家族级指数 \(b_m\) 替代每个数据集的指数 \(b_{m,d}\),预测损失很小(对于5/6的模型族,\(R^2\) 差距 <0.011;对于Boosting、RandomForest、LinearModel,留一数据集交叉验证差距 \(\leq 0.012\))。 (c) **普适性**(\(b_{m,d}=b_m\)):**不支持**——AIC支持每个数据集单独拟合,曲线坍塌是部分的,且置换检验零假设表明样本内差距缺乏特异性。Lasso作为阴性对照完全失败;Ridge表现脆弱(留一数据集交叉验证 CV 0.96)。核心贡献是压缩结果,而非普适性。
- • **经验基准**:18个数据集 × 6个模型族 × 7个嵌套训练比例,从127名学生汇总的11,536次运行;树集成在全量数据上获胜(Boosting在50%的数据集上最佳,RandomForest在33%上最佳)。
- • **复制者实现差异**:在固定 `random_state=42` 的情况下,学生间的 \(\mathrm{CV}(b)=0.144\) 衡量了未约束协议部分(预处理、编码、缺失值处理)引起的散布,而非种子方差。
- • **实用数据需求量曲线**:达到0.15目标误差的合并拟合 \(N^\star\),其中地板 \(c \geq 0.15\) 的数据单元被标记为该模型无法达到。

## 2 相关工作

#### 神经缩放定律。

一系列工作始于Hestness等人 (2017 (https://arxiv.org/html/2607.21866#bib.bib3)),并由Kaplan等人 (2020 (https://arxiv.org/html/2607.21866#bib.bib1)) 定型,确立了神经语言模型测试损失在模型大小、数据集大小和计算量方面遵循清晰的幂律。Chinchilla论文 (Hoffmannet al., 2022 (https://arxiv.org/html/2607.21866#bib.bib2)) 完善了联合参数-数据权衡,并表明先前的大型模型系统性地训练不足。Rosenfeld等人 (2020 (https://arxiv.org/html/2607.21866#bib.bib4)) 将形式主义扩展到图像分类,并提出了我们直接采用的加性不可约误差参数化形式 \(aN^{-b}+c\)。这些结果均基于神经模型——transformer、ResNet、循环网络——且数据规模适中偏大。同样的函数形式是否适用于仅有几千行表格数据的梯度提升树,迄今为止尚未在大规模实证中得到解决。

#### 经典机器学习学习曲线。

将幂律拟合到经典机器学习学习曲线本身是一个研究历史悠久的主题,早于神经缩放定律文献。Perlich等人 (2003 (https://arxiv.org/html/2607.21866#bib.bib11)) 在一组UCI风格的数据集上拟合了树归纳与逻辑回归的学习曲线。Mukherjee等人 (2003 (https://arxiv.org/html/2607.21866#bib.bib12)) 使用学习曲线外推来估计DNA微阵列分类所需的样本量。Figueroa等人 (2012 (https://arxiv.org/html/2607.21866#bib.bib14)) 拟合并反转学习曲线以预测达到目标分类性能所需的样本量。Domhan等人 (2015 (https://arxiv.org/html/2607.21866#bib.bib13)) 外推学习曲线以加速超参数优化。更广泛的原则——将误差视为资源预算的光滑、可外推函数,并利用由此产生的估计来规划花费多少预算——与数值分析中基于输出的误差估计共享,其中伴随加权的误差估计指示在哪里增加网格分辨率以最有效地减少目标输出的误差 (Dinget al., 2016 (https://arxiv.org/html/2607.21866#bib.bib18));拟合的 \(aN^{-b}+c\) 对标记数据扮演类似角色,告诉从业者需要多少额外行才能实现给定的误差降低。我们并不声称将 \(aN^{-b}+c\) 定律拟合到表格数据上的经典模型这一想法具有新颖性。我们的贡献在于**规模**(127个复制者 × 18个数据集 × 6个模型族)、**协议级可重复性视角**(测量名义合规重新实现之间的散布)以及**公开发布**汇总曲线和合并拟合,作为基准资源。

#### 表格ML基准测试。

一系列并行研究反复表明,在大多数表格任务上,梯度提升和随机森林仍然胜过深度架构 (Grinsztajnet al., 2022 (https://arxiv.org/html/2607.21866#bib.bib5);Shwartz-Ziv and Armon, 2022 (https://arxiv.org/html/2607.21866#bib.bib6);Chen and Guestrin, 2016 (https://arxiv.org/html/2607.21866#bib.bib9);Breiman, 2001 (https://arxiv.org/html/2607.21866#bib.bib10))。然而,该文献中的标准方法是在**全量数据**上评估模型,而不是追踪误差随 \(N\) 的变化。我们的工作通过增加样本量维度来补充这一点:通过了解每个模型族接近其不可约误差地板的快慢,丰富了全量数据下的排名图景。

#### 可重复性与复现。

Pineau等人 (2021 (https://arxiv.org/html/2607.21866#bib.bib7)) 记录了机器学习中的可重复性危机,并报告了NeurIPS可重复性项目。Bouthillier等人 (2019 (https://arxiv.org/html/2607.21866#bib.bib8)) 认为单次运行报告系统性地低估了不确定性:来自种子、数据划分和实现细节的差异是真实存在的且很大。当没有黄金标准标签可用时,量化可靠性更加困难:Ding (2025 (https://arxiv.org/html/2607.21866#bib.bib16)) 通过一个方差有界的评估框架来解决这个问题,该框架根据模型在合理解释下的预期成功进行评分,并对方差进行惩罚。我们的复制者散布估计是缩放定律的类似物——它将报告指数在名义合规重新实现之间的方差视为一级量而非干扰项。我们的127名学生设计,实际上是一个受控的多复制者实验,其主要产物——除了缩放定律本身——是对单个研究小组报告的缩放指数应被信任程度的定量估计。

## 3 方法论

### 3.1 数据集

我们精选了18个公开可用的表格数据集,涵盖商业相关的分类和回归任务,总结于表1 (https://arxiv.org/html/2607.21866#S3.T1)。其中10个是分类任务(二分类,类别不平衡范围从54%/46%到88%/12%),8个是回归任务。样本量从303(heart_disease)到53,940(diamonds)不等。特征数量从4到74,混合了数值型和类别型列。所有数据集广泛用于本科和应用机器学习课程,选择因为它们允许直接预处理(对类别型特征进行独热编码,对少量缺失值进行中位数插补),并且任务定义明确。

表1:本研究使用的18个精选数据集。
### 3.2 模型与协议

我们评估了六个经典模型族,均来自 `scikit-learn`,使用固定的默认风格超参数: (i) **Boosting**(`GradientBoostingClassifier/Regressor`);(ii) **随机森林**;(iii) **SVM**(RBF核);(iv) **线性/逻辑回归**;(v) **Ridge回归**(仅回归);(vi) **Lasso回归**(仅回归)。所有超参数在所有 \(N\) 上固定——不进行逐 \(N\) 重新调整——以保持学生结果的可比性,并隔离数据大小的影响。

对于每个(数据集,模型)对,学生使用种子42进行单次80/20训练/测试划分,然后在训练折的**嵌套子集**上训练,七个比例为 \(\{0.01, 0.05, 0.10, 0.25, 0.50, 0.75, 1.00\}\)(相对于80%训练池)。子集是嵌套的(较小的子集是较大子集的子集),以减少不同比例之间的采样噪声。使用相同的保留20%测试集评估每个比例。

对于分类,我们报告 \(1-\mathrm{AUROC}\) 作为误差指标;对于回归,我们报告 \(\mathrm{RMSE}/\mathrm{std}(y_{\text{test}})\),即RMSE除以测试集目标的标准差。为了限制SVM训练时间,分类SVM的训练比例上限设置为10,000行子样本。

### 3.3 幂律拟合

对于每个(学生,数据集,模型)三元组,我们拟合一个三参数幂律:

\[
\mathrm{error}(N) = a\,N^{-b} + c,\qquad a,b \geq 0,
\]
到七个 \((N,\mathrm{error})\) 点,使用非线性最小二乘法。不可约误差地板的界限为:分类任务 \(c \in [0,1]\)(因为 \(1-\mathrm{AUROC} \in [0,1]\)),回归任务 \(c \in [0,5]\)。指数 \(b\) 有界于 \([0,3]\)。当 \(b\) 处于上界或 \(a\) 坍缩为零时,拟合被标记但保留在分布报告中。我们使用阈值 \(R^2 > 0.7\) 报告每个模型族的指数统计量(以排除明显失败的拟合而不过度修剪),并在主要声明中使用 \(R^2 > 0.8\) 计数“成功”的拟合。

### 3.4 课堂规模聚合

第3.2节 (https://arxiv.org/html/2607.21866#S3.SS2) 中的协议由127名研究生机器学习课程的学生独立执行。每个学生分配三个数据集,分布在分类和回归中。根据随机分配,每个(数据集,模型)的覆盖率从11到30名学生不等(由于少数学生在最大的分类数据集上超时,SVM的覆盖率略低)。总共产生了11,536次个体模型训练运行和1,648条收敛的学生级幂律拟合(学生级拟合收敛率:100%;合并方法失败:0/80)。

我们以两种方式将学生级拟合聚合到总体级摘要。**合并方法**将给定(数据集,模型)的所有学生的所有 \((N,\mathrm{error})\) 点连接起来,并对并集拟合单个幂律;这是我们为数据需求量曲线报告的方法。**逐比例均值方法**首先在每种比例上对学生之间的误差取平均值,然后对这七个均值拟合幂律;我们将其用于稳健性检查。跨学生方差报告为每个(数据集,模型)单元内至少包含5名学生的拟合 \(b\) 的变异系数 \(\mathrm{CV}(b) = \sigma_b / \mu_b\)。

由于每个学生只被分配了18个数据集中的3个,每个单元上的 \(\mathrm{CV}(b)\) 是在每个(数据集,模型)单元的不同复制者子集上计算的,因此设计是部分区组而非完全交叉。因此,我们将所得方差视为观测性的,而头条 \(\mathrm{CV}(b)=0.144\) 视为异质单元上的边际平均值。

### 3.5 跨数据集组合

为了检验单个指数是否可以描述一个模型族在多个数据集上的表现,我们以三种方式组合每个单元的证据。 (i) **逐单元合并拟合**:对每个(数据集,模型)单元,在学生点的并集上拟合一次公式(1) (https://arxiv.org/html/2607.21866#S3.E1)。 (ii) **共享指数联合拟合**:对于每个模型族,我们拟合 \(\mathrm{error}_{d,i}(N)=a_d N^{-b_{\text{model}}}+c_d\),在其数据集上联合进行,共享 \(b_{\text{model}}\),同时

相似文章

大型语言模型为何在表格预测上失败

Hacker News Top

一篇新的arXiv论文系统性地测试了关于大型语言模型为何在表格预测上失败的五个假设,发现维度是决定性因素:随着输入维度增加,LLM的准确率下降,而经典基线模型的准确率则保持平稳或有所提升。

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。

数据受限训练的规定性缩放定律

Hugging Face Daily Papers

一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。

TabularMath:用大语言模型理解表格上的数学推理

arXiv cs.CL

TabularMath 引入了一个基准和 AutoT2T 框架来评估 LLM 对表格数据的数学推理能力,揭示表格复杂性、数据质量和模态对模型性能的重大影响。该研究通过系统地评估模型对真实场景中不完整或不一致表格信息的鲁棒性,填补了 LLM 评估中的空白。