TabFM:一种用于表格数据的零样本基础模型

Hacker News Top 模型

摘要

Google Research 推出了 TabFM,这是一种用于表格数据的零样本基础模型,利用上下文学习来执行分类和回归任务,无需手动训练模型或调整超参数。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/01 01:55

# 介绍 TabFM:一个用于表格数据的零样本基础模型 来源:https://research.google/blog/introducing-tabfm-a-zero-shot-foundation-model-for-tabular-data/ 自我们推出 TimesFM 以来,人们处理时间序列预测的方式发生了巨大变化。现在,我们将同样的“零样本”逻辑引入表格数据。 我们推出了 TabFM,一个用于简化分类和回归工作流程的表格数据基础模型。 表格数据是企业数据基础设施的支柱,为大量关键的预测性机器学习应用(https://arxiv.org/pdf/2110.01889)提供动力。从预测客户流失到识别金融欺诈,表格回归和分类任务无处不在。多年来,像 AdaBoost(https://en.wikipedia.org/wiki/AdaBoost)、XGBoost(https://en.wikipedia.org/wiki/XGBoost)和随机森林(https://en.wikipedia.org/wiki/Random_forest)等基于树的监督学习算法主导了这一领域,在结构化数据上提供了稳健的性能。 然而,部署这些传统模型的生命周期存在一个显著瓶颈。将 XGBoost 模型拟合到新数据集不仅仅是调用一个 `.fit()` 步骤,它不可避免地需要繁琐的手动工作。数据科学家必须投入大量时间进行广泛的超参数优化和特定领域的特征工程,才能从原始数据中提取出可靠的信号。 另一方面,更广泛机器学习领域的最新进展——特别是大型语言模型(LLM)的演进——已经改变了我们处理新任务的方式。LLM 通过上下文学习(https://arxiv.org/abs/2005.14165)(ICL)展示了零样本预测的强大能力。这项技术允许预训练模型通过在输入上下文中提供示例和指令来学习新任务,而无需更新任何底层模型权重。 今天,我们推出 TabFM,这是一个专为表格数据分类和回归设计的基础模型。通过将表格预测重构为 ICL 问题,TabFM 消除了手动模型训练、超参数调优(https://en.wikipedia.org/wiki/Hyperparameter_optimization)和复杂特征工程的需求。我们很高兴分享这种方法如何让用户通过单次前向传播,在未见过的表格上生成高质量预测。TabFM 现已在我们 Hugging Face(https://huggingface.co/google/tabfm-1.0.0-pytorch)和 GitHub(https://github.com/google-research/tabfm)仓库中可供使用。 ## 工作原理 传统的机器学习范式依赖于更新特定于给定数据集分布的模型参数。相比之下,ICL 范式完全绕过了这一点。TabFM 无需针对每个新任务进行传统训练阶段,而是将整个数据集——包括历史训练示例和目标测试行——作为单个统一的提示。模型在推理时直接从该上下文中学习解释列与行之间的关系。 然而,将 ICL 应用于表格数据并不像将自然语言进行标记化那样简单。标准语言模型处理一维有序序列,但表格本质上是二维且无序的:交换两行或两列不会改变数据的底层含义。为了有效处理这些多样的表格结构,同时实现可扩展的零样本预测,TabFM 将 TabPFN(https://arxiv.org/abs/2207.01848)和 TabICL(https://arxiv.org/abs/2502.05564)等架构的优势融合为一种新颖的混合设计。这种架构如下所示,依赖于三种关键机制: - *交替行和列注意力*:首先,原始表格通过一个多层注意力模块处理。类似于 TabPFN,此步骤在列(特征)和行(示例)之间交替应用注意力。通过持续在这两个维度上执行注意力,模型学习到丰富的表示,原生地捕捉复杂的特征交互和依赖关系。这种深度上下文化有效地完成了数据科学家原本需要繁琐手动特征构建的繁重工作。 - *行压缩*:在此上下文化之后,每个单行的丰富交叉注意力信息被压缩成一个密集的向量表示。 - *上下文学习(ICL)*:最后,一个专用的 Transformer 操作在这些压缩嵌入序列上。采用 TabICL 的高效方法,对压缩后的行向量——而不是原始未压缩的网格——执行注意力,大大降低了计算成本。这确保了即使在更大的数据集上,预测步骤仍然保持极高的计算效率。 ## 大规模合成数据训练 构建基础模型的典型方法是使用高容量神经网络,在大量多样化数据上训练。然而,表格机器学习的一个主要障碍是,高质量、多样化的表格数据集——尤其是反映真实工业数据分析所需的大规模表格——在开源领域中极为稀缺。工业表格通常包含专有模式(schema)和敏感信息,使得它们无法用于广泛的预训练。 由于合成表格可以生成任意大小,它们实际上是这种规模下预训练基础模型的唯一可行选择。因此,TabFM 完全在数亿个合成数据集上进行训练。这些数据集使用结构因果模型(SCM)动态生成,其中包含各种随机函数。这种大规模的合成生成捕捉了现实世界表格数据中广泛存在的分布和复杂特征关系。因此,该模型能够很好地泛化到未见过的真实表格,如下面的基准测试所示。 ## 性能与基准测试 为了严格测试 TabFM 与现有最先进方法的对比,我们在 TabArena(https://huggingface.co/spaces/TabArena/leaderboard)上进行了评估,这是一个根据直接对战胜率计算 Elo 分数(https://arxiv.org/pdf/2506.16791)的实时基准系统。该综合评估涵盖 38 个分类数据集和 13 个回归数据集,样本量从 700 到 150,000 不等。 如下面的性能图所示,我们对模型的两个不同配置进行了基准测试: - *TabFM*:代表模型的即开即用能力。预测通过单次前向传播生成,无需调优或交叉验证。 - *TabFM-Ensemble*:此配置通过引入交叉特征和 SVD(https://en.wikipedia.org/wiki/Singular_value_decomposition)(奇异值分解)特征进一步提升性能。我们使用非负最小二乘求解器计算 32 路集成的最佳权重。对于分类任务,此变体还结合了 Platt 缩放(https://en.wikipedia.org/wiki/Platt_scaling)作为额外的校准步骤。 如需获取全面的 TabArena 基准结果——包括详细的逐折指标和针对特定基线模型的直接对战胜率——请访问我们的 GitHub 页面(https://github.com/google-research/tabfm)。 ## 结论 通过将表格预测重构为上下文学习问题,TabFM 利用混合注意力架构和大规模合成训练数据,原生地捕捉复杂的特征交互。这种方法成功消除了手动特征工程、超参数优化和重复模型训练的传统瓶颈,并且始终优于经过高度调优的行业标准监督学习算法。TabFM 将现代基础模型的即开即用便利性直接带入表格机器学习工作流程,使从业者能够通过单次前向传播生成高度准确的预测。 为了使其更易访问,TabFM 正被直接集成到 Google BigQuery 中。在未来几周内,用户将能够使用简单的 `AI.PREDICT` SQL 命令在 BigQuery 中执行高级回归和分类——无需机器学习专业知识。 ## 致谢 *本项目是与 Erez Louidor Ilan、Taman Narayan、Shuxin Nie、Rajat Sen、Yichen Zhou、Joe Toth、Deqing Fu 和 Samet Oymak 的联合工作。我们感谢 Kimberly Schwede 设计图形。*

相似文章

google/tabfm-1.0.0-pytorch

Hugging Face Models Trending

Google Research发布TabFM,这是一个使用PyTorch的零样本表格基础模型,用于分类和回归,无需微调。

训练公平表格基础模型

arXiv cs.LG

本文提出FairTFM,一种将公平性约束融入表格基础模型的训练策略,通过上下文学习实现公平预测,无需针对特定任务的重新训练。