TabEmbed:用于表格理解的通用嵌入的基准测试与学习
摘要
本文介绍了 TabEmbed,这是一种用于表格数据的通用嵌入模型,统一了分类和检索任务,并介绍了 TabBench,这是一个用于评估表格理解能力的新基准。
查看缓存全文
缓存时间: 2026/05/08 07:13
论文页面 - TabEmbed:表格理解通用嵌入的基准测试与学习
来源:https://huggingface.co/papers/2605.04962
摘要
我们提出了一种名为 TabEmbed 的新型通用嵌入模型,该模型利用结合正样本感知困难负样本挖掘的大规模对比学习,在共享嵌入空间中统一了表格分类与检索任务。
基础模型已为自然语言处理建立了统一的表示,但这一范式在表格数据领域仍未得到充分探索。现有方法面临根本性限制:基于大型语言模型(LLM)的方法缺乏与检索 (https://huggingface.co/papers?q=retrieval) 兼容的向量输出,而文本嵌入模型往往难以捕捉表格结构和数值语义。为了弥合这一差距,我们首先介绍了表格嵌入基准 (https://huggingface.co/papers?q=Tabular%20Embedding%20Benchmark)(TabBench),这是一个旨在评估嵌入模型表格理解能力的综合测试套件。随后,我们提出了 TabEmbed,这是第一个在共享嵌入空间 (https://https://huggingface.co/papers?q=embedding%20space) 中统一表格分类 (https://huggingface.co/papers?q=tabular%20classification) 和检索 (https://huggingface.co/papers?q=retrieval) 的通用嵌入模型。通过将多样化的表格任务重构为语义匹配问题 (https://huggingface.co/papers?q=semantic%20matching%20problems),TabEmbed 利用结合正样本感知困难负样本挖掘 (https://huggingface.co/papers?q=positive-aware%20hard%20negative%20mining) 的大规模对比学习 (https://huggingface.co/papers?q=large-scale%20contrastive%20learning),以识别细微的结构和数值差异。在 TabBench 上的实验结果表明,TabEmbed 显著优于最先进的文本嵌入模型,为通用表格表示学习 (https://huggingface.co/papers?q=universal%20tabular%20representation%20learning) 建立了新的基准。代码和数据集已公开,分别位于 https://github.com/qiangminjie27/TabEmbed 和 https://huggingface.co/datasets/qiangminjie27/TabBench。
查看 arXiv 页面 (https://arxiv.org/abs/2605.04962) 查看 PDF (https://arxiv.org/pdf/2605.04962) GitHub1 (https://github.com/qiangminjie27/TabEmbed) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.04962)
在您的 agent 中获取此论文:
hf papers read 2605.04962
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有链接此论文的模型
在模型的 README.md 中引用 arxiv.org/abs/2605.04962 即可从此页面建立链接。
引用此论文的数据集 1
qiangminjie27/TabBench 预览 • 更新于约 4 小时前 • 934 (https://huggingface.co/datasets/qiangminjie27/TabBench)
引用此论文的 Spaces 0
没有链接此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2605.04962 即可从此页面建立链接。
包含此论文的合集 0
没有包含此论文的合集
将此论文添加到合集 (https://huggingface.co/new-collection) 即可从此页面建立链接。
相似文章
MulTaBench:基于文本与图像的多模态表格学习基准测试
介绍了 MulTaBench,一个包含40个数据集的基准测试,用于文本和图像模态的多模态表格学习。实验表明,任务特定的嵌入调优优于冻结的预训练嵌入,特别是在模态提供互补预测信号时。
编码器选择的重要性:一项表格与图像研究
本文评估了最先进的表格模型作为编码器在图像-表格多模态学习中的表现,解决了使用需要标签来嵌入训练和测试实例的上下文学习模型所面临的挑战。
TRL-Bench: 跨范式表格编码器表示级别评估的标准化
TRL-Bench 是一个统一的框架和库,用于标准化对20个编码器、16个任务和87个数据集的表格表示学习模型的评估。它提供了一个通用接口来比较异构表格模型,并揭示了没有一个编码器在所有任务中都是最佳的。
超越IID:表格基础模型到底有多通用?
本文介绍了BeyondArena,一个统一的表格数据整体基准,并发现现有的表格基础模型仅在小到中等规模的IID数据上表现优异,而传统的基于树和深度学习模型仍然在非IID、大规模和高维数据集上占据主导地位。
基于无监督深度学习集成的不平衡表格数据聚类
本文研究了不平衡表格数据上的深度聚类方法,提出了两种新颖的集成方法,分别通过跨嵌入维度聚合聚类分配或通过多数投票进行集成,在16个数据集上优于单个方法。