TabEmbed:用于表格理解的通用嵌入的基准测试与学习

Hugging Face Daily Papers 论文

摘要

本文介绍了 TabEmbed,这是一种用于表格数据的通用嵌入模型,统一了分类和检索任务,并介绍了 TabBench,这是一个用于评估表格理解能力的新基准。

基础模型已经为自然语言处理建立了统一的表示,但这一范式在表格数据领域仍 largely 未被探索。现有方法面临根本性局限:基于大语言模型(LLM)的方法缺乏兼容检索的向量输出,而文本嵌入模型往往无法捕捉表格结构和数值语义。为了弥合这一差距,我们首先引入了表格嵌入基准(TabBench),这是一个旨在评估嵌入模型表格理解能力的综合测试套件。随后,我们提出了 TabEmbed,这是首个在共享嵌入空间内统一表格分类和检索的通用嵌入模型。通过将多样化的表格任务重构为语义匹配问题,TabEmbed 利用大规模对比学习并结合正样本感知的困难负样本挖掘,以辨别细微的结构和数值差异。在 TabBench 上的实验结果表明,TabEmbed 显著优于最先进的文本嵌入模型,为通用表格表示学习确立了新的基线。代码和数据集已公开,可在 https://github.com/qiangminjie27/TabEmbed 和 https://huggingface.co/datasets/qiangminjie27/TabBench 获取。
查看原文
查看缓存全文

缓存时间: 2026/05/08 07:13

论文页面 - TabEmbed:表格理解通用嵌入的基准测试与学习

来源:https://huggingface.co/papers/2605.04962

摘要

我们提出了一种名为 TabEmbed 的新型通用嵌入模型,该模型利用结合正样本感知困难负样本挖掘的大规模对比学习,在共享嵌入空间中统一了表格分类与检索任务。

基础模型已为自然语言处理建立了统一的表示,但这一范式在表格数据领域仍未得到充分探索。现有方法面临根本性限制:基于大型语言模型(LLM)的方法缺乏与检索 (https://huggingface.co/papers?q=retrieval) 兼容的向量输出,而文本嵌入模型往往难以捕捉表格结构和数值语义。为了弥合这一差距,我们首先介绍了表格嵌入基准 (https://huggingface.co/papers?q=Tabular%20Embedding%20Benchmark)(TabBench),这是一个旨在评估嵌入模型表格理解能力的综合测试套件。随后,我们提出了 TabEmbed,这是第一个在共享嵌入空间 (https://https://huggingface.co/papers?q=embedding%20space) 中统一表格分类 (https://huggingface.co/papers?q=tabular%20classification) 和检索 (https://huggingface.co/papers?q=retrieval) 的通用嵌入模型。通过将多样化的表格任务重构为语义匹配问题 (https://huggingface.co/papers?q=semantic%20matching%20problems),TabEmbed 利用结合正样本感知困难负样本挖掘 (https://huggingface.co/papers?q=positive-aware%20hard%20negative%20mining) 的大规模对比学习 (https://huggingface.co/papers?q=large-scale%20contrastive%20learning),以识别细微的结构和数值差异。在 TabBench 上的实验结果表明,TabEmbed 显著优于最先进的文本嵌入模型,为通用表格表示学习 (https://huggingface.co/papers?q=universal%20tabular%20representation%20learning) 建立了新的基准。代码和数据集已公开,分别位于 https://github.com/qiangminjie27/TabEmbed 和 https://huggingface.co/datasets/qiangminjie27/TabBench。

查看 arXiv 页面 (https://arxiv.org/abs/2605.04962) 查看 PDF (https://arxiv.org/pdf/2605.04962) GitHub1 (https://github.com/qiangminjie27/TabEmbed) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.04962)

在您的 agent 中获取此论文:

hf papers read 2605.04962

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有链接此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2605.04962 即可从此页面建立链接。

引用此论文的数据集 1

qiangminjie27/TabBench 预览 • 更新于约 4 小时前 • 934 (https://huggingface.co/datasets/qiangminjie27/TabBench)

引用此论文的 Spaces 0

没有链接此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2605.04962 即可从此页面建立链接。

包含此论文的合集 0

没有包含此论文的合集

将此论文添加到合集 (https://huggingface.co/new-collection) 即可从此页面建立链接。

相似文章

TRL-Bench: 跨范式表格编码器表示级别评估的标准化

Hugging Face Daily Papers

TRL-Bench 是一个统一的框架和库,用于标准化对20个编码器、16个任务和87个数据集的表格表示学习模型的评估。它提供了一个通用接口来比较异构表格模型,并揭示了没有一个编码器在所有任务中都是最佳的。

超越IID:表格基础模型到底有多通用?

Hugging Face Daily Papers

本文介绍了BeyondArena,一个统一的表格数据整体基准,并发现现有的表格基础模型仅在小到中等规模的IID数据上表现优异,而传统的基于树和深度学习模型仍然在非IID、大规模和高维数据集上占据主导地位。