何时、何地、如何:面向表格自监督学习的自适应分箱方法
摘要
本文提出自适应分箱(Adaptive Binning),一种针对表格自监督学习的、与学习过程耦合的特征级粗到细课程,能够自适应地离散化特征,在医学数据集上提升表示质量,并建立了统一的基准测试。
查看缓存全文
缓存时间: 2026/06/23 01:39
论文页面 - When, Where, and How: Adaptive Binning for Tabular Self-Supervised Learning
Source: https://huggingface.co/papers/2606.19827 main_figure (https://cdn-uploads.huggingface.co/production/uploads/67039e7443929668458d3618/G3-DkG1OiDnT0qHQkNWrE.png)
本文针对医学表格自监督学习提出了自适应分箱方法。其核心思想是用一种学习耦合、特征层面的由粗到细课程方案来替代固定的全局分位数分箱,该方案能够确定何时细化每个特征、在何处分割其分箱,以及如何通过类型感知的有序重构来监督混合分类–数值模式。
我们展示了自适应离散化在多种公开的医学表格数据集上,无论是在线性探测还是微调评估中,都能产生更强的表示。此外,我们还建立了统一的基准,用于可重复的医学表格自监督学习。
相似文章
基于无监督深度学习集成的不平衡表格数据聚类
本文研究了不平衡表格数据上的深度聚类方法,提出了两种新颖的集成方法,分别通过跨嵌入维度聚合聚类分配或通过多数投票进行集成,在16个数据集上优于单个方法。
自监督预训练何时有助于表格模型?标签稀缺与缺失数据研究
本文评估了在标签稀缺和缺失数据条件下表格模型的自监督预训练,发现效果混合但在测试时缺失情况下有可靠改进。
CuBAS:基于信息几何曲率的监督分类自适应采样方法
介绍CuBAS,一种用于监督分类中自适应数据选择的信息几何框架,利用数据流形的局部曲率识别信息丰富的样本,在30个基准数据集上实现了更高的准确率。
TabEmbed:用于表格理解的通用嵌入的基准测试与学习
本文介绍了 TabEmbed,这是一种用于表格数据的通用嵌入模型,统一了分类和检索任务,并介绍了 TabBench,这是一个用于评估表格理解能力的新基准。
MulTaBench:基于文本与图像的多模态表格学习基准测试
介绍了 MulTaBench,一个包含40个数据集的基准测试,用于文本和图像模态的多模态表格学习。实验表明,任务特定的嵌入调优优于冻结的预训练嵌入,特别是在模态提供互补预测信号时。