超越IID:表格基础模型到底有多通用?
摘要
本文介绍了BeyondArena,一个统一的表格数据整体基准,并发现现有的表格基础模型仅在小到中等规模的IID数据上表现优异,而传统的基于树和深度学习模型仍然在非IID、大规模和高维数据集上占据主导地位。
查看缓存全文
缓存时间: 2026/06/30 11:35
论文页面 - 超越IID:表格基础模型到底有多通用?
来源:https://huggingface.co/papers/2606.30410
摘要
表格基础模型在不同数据条件下的表现存在显著差异,传统方法在复杂、大规模数据集上仍优于较新方法。
用于表格数据预测机器学习(https://huggingface.co/papers?q=predictive%20machine%20learning)的基础模型近期在学术界和工业界获得了广泛关注。跨学科的研究社区越来越多地在不同数据集和任务上评估表格基础模型(https://huggingface.co/papers?q=tabular%20foundation%20models)。然而,由于基准软件和评估协议碎片化,这些针对特定任务和学科的评价结果对模型研究人员来说仍然难以获取。因此,模型研究者依赖的标准基准大多局限于表格基础模型已经擅长的任务。最具挑战性的场景被排除在外,导致该领域的实质性进展受限——人们只关注IID数据(https://huggingface.co/papers?q=IID%20data)上的边际改进,而忽视了更广泛、更严苛的挑战。为解决这一问题,我们推出了BeyondArena,这是首个统一的表格数据整体基准,支持多种任务类型(IID、时序、分组),覆盖不同样本规模和特征维度,包含来自广泛学科领域的多样化特征类型(含文本、高基数特征)。为了实现超越标准基准的统一基准测试(https://huggingface.co/papers?q=benchmarking),我们引入了Data Foundry(https://huggingface.co/papers?q=Data%20Foundry),这是一个用于为预测机器学习(https://huggingface.co/papers?q=predictive%20machine%20learning)策划表格数据集的Python框架和元数据模式。我们对11个模型和142个策划数据集的实验结果表明:现有的表格基础模型(https://huggingface.co/papers?q=tabular%20foundation%20models)在小型到中型的IID数据(https://huggingface.co/papers?q=IID%20data)上表现出色,而传统的基于树的方法和深度学习模型(https://huggingface.co/papers?q=deep%20learning%20models)在非IID、大规模和高维数据集(https://huggingface.co/papers?q=high-dimensional%20datasets)上仍占主导地位。BeyondArena为表格数据领域最艰巨的挑战指引模型研究方向,助力迈向真正基础性的表格模型。
查看 arXiv 页面(https://arxiv.org/abs/2606.30410)查看 PDF(https://arxiv.org/pdf/2606.30410)项目页面(https://tabarena.ai/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.30410)
引用本论文的模型0
暂无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.30410 以在本页面建立链接。
引用本论文的数据集1
TabArena/BeyondArena 查看器• 更新于约4小时前 • 19.7M • 2.16k • 2 (https://huggingface.co/datasets/TabArena/BeyondArena)
引用本论文的 Spaces0
暂无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.30410 以在本页面建立链接。
包含本论文的收藏1
相似文章
WildTableBench:在真实场景中评估多模态基础模型的表格理解能力
WildTableBench 提出了首个针对真实世界表格图像的问答应答基准,揭示了现有多模态基础模型在结构感知和数值推理方面存在显著困难,仅有1个模型准确率超过50%。
当表格基础模型遇到策略性表格数据:一种先验对齐方法
本文研究了基于预训练先验数据拟合网络的表格基础模型是否能够泛化到个体在部署后修改特征的策略性表格数据。提出了策略性先验数据拟合网络(SPN),这是一个无需重新训练即可将PFN预测与操纵后分布对齐的推理时框架。
TabPFN-3:技术报告
TabPFN-3 是一个新的表格数据基础模型,在合成数据上预训练,可扩展到 100 万训练行,同时减少训练和推理时间,在表格预测、时间序列和关系数据上实现了最先进的性能。
TabPFN-3刚刚发布:一款支持高达100万行的预训练表格基础模型 [R][N]
TabPFN-3,一款预训练的表格基础模型已发布。该模型在单个GPU上支持高达100万行数据,推理速度提升10倍至1000倍,在基准测试中对比经典机器学习方法胜率高达93%。
GOTabPFN:从特征排序到紧凑标记化——面向高维数据的表格基础模型
本文介绍了GOTabPFN,一种结合了图引导排序与局部精炼(GO-LR)及神经启发子单元压缩(NSC)的方法,使得小型表格基础模型能够在无需重新训练大型骨干网络的情况下,有效进行高维低样本量预测。