TRL-Bench: 跨范式表格编码器表示级别评估的标准化
摘要
TRL-Bench 是一个统一的框架和库,用于标准化对20个编码器、16个任务和87个数据集的表格表示学习模型的评估。它提供了一个通用接口来比较异构表格模型,并揭示了没有一个编码器在所有任务中都是最佳的。
查看缓存全文
缓存时间: 2026/06/11 13:39
论文页面 - TRL-Bench: 标准化跨范式表格编码器的表示层级评估
来源:https://huggingface.co/papers/2606.09323
📊 发布 TRL-Bench——一个统一的框架 + 库,用于表格表示学习,表格表示学习的一站式解决方案。
🧩 20 个编码器 · 16 个任务 · 3 个套件下的 87 个数据集
🔍 旨在让异构表格模型可以直接比较,并可复用为嵌入模型
pipeline (https://cdn-uploads.huggingface.co/production/uploads/65164444bc0631719873af81/_v27hrO7JemUP6WICmlJh.png)
表格编码器形态各异:不同的输入格式、训练目标和输出头部。因此,即便是为同一任务构建的两个模型也难以直接进行比较。我们构建了 TRL-Bench 来使它们具有可比性。
它在表示层级上统一了一切:每个模型都被封装在一个共享接口之后,该接口可导出行嵌入、列嵌入和表嵌入,共享的轻量级头部在通用任务定义下探测这些嵌入,因此来自不同范式的 20 个编码器终于可以放在同一尺度上比较。
它也是一个库:20 种不同类型的表格模型被适配为嵌入模型,可导出行、列和表嵌入供社区复用。它涵盖三个套件:
🧩 TRL-CTbench——13 个列/表任务:模式、可连接性、可合并性、基础对齐
🔗 TRL-Rbench——多目标行预测(50 个子任务,123 个目标)+ 记录链接(16 个数据集)
🌊 TRL-DLTE ——一个包含 47,772 个表的数据湖增强管道,覆盖全部三种粒度
主要结论很明确:不存在单一的最佳表格编码器,优势分布在不同的表格任务上。表格模型的选择应基于具体任务。
我们还发现:
📌 当信号存在于表面文本(列名和单元格值)中时,现成的文本编码器出人意料地强大;跨表对齐和匹配则反而奖励结构感知型专业编码器
📌 预测表内的值和在表间匹配同一记录需要不同的编码器:前者奖励适应单表的编码器,后者奖励嵌入在表间保持可比性的编码器
📌 堆叠每个阶段的最佳编码器并不能得到最佳的组合式管道,从头到尾复用一个编码器也不行;获胜的方案是为每个步骤匹配不同的专业编码器(查找相关表 → 对齐列 → 匹配行)
TRL-Bench 旨在同时作为诊断基准和用于构建表格表示的实用库。
📄 论文:https://arxiv.org/abs/2606.09323
🌐 网站:https://logo-cuhksz.github.io/trl-bench.github.io/
🤗 数据集:https://huggingface.co/collections/logo-lab/trl-bench
💻 代码:https://github.com/LOGO-CUHKSZ/TRL-Bench
相似文章
编码器选择的重要性:一项表格与图像研究
本文评估了最先进的表格模型作为编码器在图像-表格多模态学习中的表现,解决了使用需要标签来嵌入训练和测试实例的上下文学习模型所面临的挑战。
MulTaBench:基于文本与图像的多模态表格学习基准测试
介绍了 MulTaBench,一个包含40个数据集的基准测试,用于文本和图像模态的多模态表格学习。实验表明,任务特定的嵌入调优优于冻结的预训练嵌入,特别是在模态提供互补预测信号时。
TabEmbed:用于表格理解的通用嵌入的基准测试与学习
本文介绍了 TabEmbed,这是一种用于表格数据的通用嵌入模型,统一了分类和检索任务,并介绍了 TabBench,这是一个用于评估表格理解能力的新基准。
M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准
本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。
ModelEquivBench:LLM生成优化模型的认证式多关系评估
ModelEquivBench 是一个面向 LLM 生成优化模型的认证式多关系评估系统,报告逐对语义概况(涵盖七种等价关系),而非单一的准确率分数。它在固定基准上评估了 GPT-5.4、Claude Sonnet 4.6 和 Qwen3.5-397B-A17B,揭示了粗粒度基线无法发现的阶段式失败。