编码器选择的重要性:一项表格与图像研究

arXiv cs.LG 论文

摘要

本文评估了最先进的表格模型作为编码器在图像-表格多模态学习中的表现,解决了使用需要标签来嵌入训练和测试实例的上下文学习模型所面临的挑战。

arXiv:2607.07756v1 公告类型:新 摘要:多模态学习通常需要每个模态有专门的编码器。当涉及表格模态时,以往的工作大多使用\emph{普通MLP}作为编码器。然而,如果它真是个强大的编码器,表格领域就不会是“深度学习尚未征服的最后堡垒”。本研究首次评估了最先进的表格模型在图像-表格场景中作为编码器的表现。一个障碍凸显出来:上下文学习模型是表格领域中表现最佳的方法之一,但需要标签来处理实例,这使得以相同方式嵌入训练和测试实例变得不简单。我们针对该系列中的多个模型解决了这一问题。通过这项研究,我们希望强调编码器因素在多模态学习中的重要性。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:14

# 编码器选择的重要性:一项表格图像研究
来源:https://arxiv.org/abs/2607.07756
查看 PDF (https://arxiv.org/pdf/2607.07756)

> **摘要:** 多模态学习通常需要为每种模态配备专门的编码器。当涉及表格模态时,以往研究大多使用 *普通 MLP* 作为编码器。然而,如果这个编码器足够强大,表格领域就不会成为“深度学习尚未攻克的最后堡垒”。本研究首次在图像-表格场景下评估了最先进的表格模型作为编码器的表现。其中存在一个显著障碍:上下文学习模型(In-Context Learning models)——表格领域中表现最佳的方法之一——在处理实例时需要标签,这使得以相同方式嵌入训练和测试实例变得颇具挑战。我们针对该系列的多个模型解决了这一问题。通过这项研究,我们希望强调编码器因素在多模态学习中的重要性。

## 提交历史

来自:Ilia Koloiarov [查看邮箱 (https://arxiv.org/show-email/f67b19e0/2607.07756)]  
**[v1]** 2026年7月8日星期三 14:01:16 UTC(2,746 KB)

相似文章

Stateful Visual Encoders for Vision-Language Models

Hugging Face Daily Papers

本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。

TRL-Bench: 跨范式表格编码器表示级别评估的标准化

Hugging Face Daily Papers

TRL-Bench 是一个统一的框架和库,用于标准化对20个编码器、16个任务和87个数据集的表格表示学习模型的评估。它提供了一个通用接口来比较异构表格模型,并揭示了没有一个编码器在所有任务中都是最佳的。

探析表格上下文学习的记忆机制

arXiv cs.LG

本文研究了使用上下文学习的表格基础模型中的参数化记忆现象,提出了一种探测框架(IclMem)来分离基于上下文的预测与记忆。发现在特定条件下存在适度的记忆信号,但在现实训练场景下基本消失。