EdgeLM:语言模型表格理解的边缘演示

arXiv cs.CL 论文

摘要

EdgeLM是一篇研究论文,提出了一种检索框架,选择边缘演示——即决策边界附近的相关示例——以提高LLM在表格理解与数据整理任务上的表现。

arXiv:2608.04390v1 公告类型:新 摘要:大型语言模型(LLM)通过上下文学习执行以表格为中心的预测,因此演示选择对性能至关重要。现有的检索方法优先考虑与查询的相似性,但相似的演示往往强化模型可能的预测,而非揭示困难决策所需的区别。我们提出EdgeLM,一种检索框架,转而选择边缘证据,即既与查询相关又对决策边界有信息量的演示。EdgeLM通过选择数据边缘(邻近但具有不同真实标签的示例)和模型边缘(部署模型先前错误分类的相似示例)来检索两种互补形式的边缘证据。EdgeLM既不需要模型重新训练,也不需要特定任务工程。在五项数据整理任务、十五个数据集以及五个开放权重和专有LLM上,EdgeLM在每种设置中始终达到最佳或接近最佳的性能,而消融实验表明,两种形式的边缘证据提供了互补的收益。我们的代码和数据集公开于 https://github.com/soroushomidvar/EdgeLM。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:47

# EdgeLM:面向语言模型表格理解的语言模型边缘示范

来源:https://arxiv.org/html/2608.04390

Soroush Omidvartehrani  
University of Alberta, Canada  
[email protected]

&

Mohammadamin Habibollah  
University of Alberta, Canada  
[email protected]

Mohammadreza Daviran  
University of Alberta, Canada  
[email protected]

&

Davood Rafiei  
University of Alberta, Canada  
[email protected]

###### 摘要

大型语言模型(LLMs)通过上下文学习(in-context learning)执行以表格为中心的预测任务,因此示范(demonstration)的选择对性能至关重要。现有的检索方法优先考虑与查询的相似性,但相似的示范往往强化模型可能的预测,而非揭示做出困难决策所需的区分信息。我们提出EdgeLM,一种检索框架,其转而选择边缘证据(edge evidence),即既与查询相关又对决策边界具有信息量的示范。EdgeLM通过选择两类互补的边缘证据来实例化该方法:数据边缘(data edge),即具有不同真实标签的邻近样本;以及模型边缘(model edge),即被部署模型先前错误分类的相似样本。EdgeLM既不需要重新训练模型,也不需要针对特定任务的工程改造。在五个数据整理任务、十五个数据集和五个开放权重及专有LLM上的实验表明,EdgeLM在几乎所有设置中都取得了最佳或接近最佳的性能,而消融实验则表明这两种边缘证据形式提供了互补的收益。我们的代码和数据集可在https://github.com/soroushomidvar/EdgeLM公开发布。

EdgeLM:面向语言模型表格理解的语言模型边缘示范

Soroush Omidvartehrani  
University of Alberta, Canada  
[email protected]

Mohammadamin Habibollah  
University of Alberta, Canada  
[email protected]

Mohammadreza Daviran  
University of Alberta, Canada  
[email protected]

Davood Rafiei  
University of Alberta, Canada  
[email protected]

## 1 引言

表格被广泛用于分析、决策和机器学习,但现实世界中的表格数据很少能够直接使用。数值可能缺失,指向同一实体的记录可能无法匹配,跨表格的相关列可能使用不同的名称或格式。在数据能够被可靠使用之前,实践者必须检测错误单元格、识别重复实体、对齐模式(schema)、填充缺失值并标记异常记录。这些操作统称为*数据整理(data wrangling)*,是确保数据质量的基础,并直接影响下游分析、机器学习模型和AI系统的可靠性。

自动化数据整理仍然具有挑战性,因为不同任务需要对异构表格进行不同形式的推理。判断某个单元格是否错误、两条记录是否指向同一实体、或两个属性是否应对齐,通常需要推理单元格、行和列之间的关系,而不是孤立地看单个值。因此,现有系统通常依赖特定任务的规则、手工设计的特征、弱监督或分别训练的模型Mahdavi等人 (2019);Mahdavi and Abedjan (2020);Li等人 (2020)。虽然这些方法在专门场景中有效,但需要大量的工程投入,并且在新任务、新模式和新领域上往往泛化能力较差。

LLMs提供了一种有前景的替代方案,利用预训练知识以单一模型处理多种数据整理任务Narayan等人 (2022);Li等人 (2024b);Zhang等人 (2024a)。然而,其性能关键取决于在上下文学习期间提供的示范或在微调期间看到的样本Min等人 (2022);Zhao等人 (2021);Liu等人 (2022a)。这就引出了一个根本性问题:*什么使得一个示范在多样化的以表格为中心的预测任务中有效?*

选择示范远非易事。包含太多行可能超出上下文预算,同时稀释相关证据,而手工策划的示例无法扩展到未见过的表格和查询。随机采样和基于多样性的选择往往忽略查询Su等人 (2023),而基于相似性的检索倾向于选择与查询相似的示例Liu等人 (2022a);Rubin等人 (2022),但常常无法揭示区分竞争预测的证据。例如,两个实体对可能看起来几乎相同,除了一个微妙的错配改变了标签;或者一个候选单元格值看起来合理,却违反了行中其他位置的依赖关系。如果所有检索到的示范都支持同一个预测,它们会强化可能的答案,却不揭示决策边界所在。因此,有效的示范不仅应当相关,还应当*对局部决策边界具有区分性*。

我们假设,接近决策边界的示范提供了缺失的判别信号。相似示例建立了局部上下文,而边界示例揭示了区分竞争预测的证据。受这一观察启发,我们提出EdgeLM,一个用于在表格数据上进行结构化预测的任务无关示范选择框架。EdgeLM在基于相似性的检索基础上增加了*边缘证据*:既与查询相关又对局部决策边界具有信息量的示范。我们通过两个互补的视角实例化边缘证据:*数据边缘*,它检索来自不同真实标签的邻近示例;以及*模型边缘*,它检索被部署的LLM预测错误的邻近示例,并将其用作纠正性证据。所选示范适合固定的提示词预算,且既不需要模型重新训练,也不需要针对特定任务的工程改造。

我们在五个代表性数据整理任务、十五个数据集和五个开放权重及专有LLM上评估了EdgeLM。在几乎所有任务-模型组合中,EdgeLM都取得了最佳性能或与最佳结果在一个标准差以内。消融研究进一步表明,在不同的示范预算分配下,数据边缘和模型边缘提供了互补的收益。

## 2 相关工作

### 2.1 用于表格理解和数据整理的LLMs

大型语言模型已显著拓宽了可以用单一底层模型解决的表格推理任务范围。早期工作通过表格感知的预训练将语言模型适应到表格 (Yin等人,2020;Herzig等人,2020;Liu等人,2022b;Borisov等人,2023),而最近的方法则利用指令微调和通用LLMs (Li等人,2024b;Zhang等人,2024b,a)。其他方法通过多步推理和检索改进表格理解,例如Chain-of-Table (Wang等人,2024)和TableRAG (Chen等人,2024)。同时,关于序列化和行列顺序的研究表明,LLM性能对提示词中呈现的上下文高度敏感 (Sui等人,2024;Liu等人,2024;Habibollah and Rafiei,2026;Yang等人,2022;Fang等人,2024)。LLMs也被应用于各个数据整理任务,包括数据清洗 (Naeem等人,2024)、实体解析 (Peeters and Bizer,2023;Peeters等人,2024)、异常检测 (Li等人,2024a)和缺失值填补 (Wang等人,2025)。在这些以及相关的表格和数据库问题中,现有方法通常依赖任务或模式特定的提示词、检索策略或适配技术 (Nan等人,2023;He等人,2025;Daviran等人,2026)。相比之下,我们将示范选择本身作为一个任务无关的问题来研究,使用统一的公式跨越多个数据整理任务,同时保持模型、提示词结构和推理过程固定。

### 2.2 用于上下文学习的示范选择

示范的选择对上下文学习有重大影响 (Min等人,2022;Zhao等人,2021)。现有方法主要针对相关性、覆盖度或不确定性来优化示范选择。基于相似性的检索选择与输入查询相似的示例 (Liu等人,2022a;Rubin等人,2022),而基于多样性的方法寻求对输入或输出空间的更广覆盖 (Su等人,2023;Levy等人,2023)。其他方法结合相关性和多样性,迭代优化所选集合,或显式平衡标签分布 (Qin等人,2024;Omidvartehrani and Rafiei,2026;Tran等人,2025)。不确定性引导的方法则识别全局信息量大的示例用于标注或提示 (Diao等人,2024;Mavromatis等人,2024)。我们的工作解决一个互补的问题:*哪些邻近示范对于区分竞争预测最具信息量?* 现有检索方法倾向于选择代表查询的示例,但不会显式检索位于局部决策边界附近或揭示部署模型系统性错误的示范。EdgeLM通过互补的*数据边缘*和*模型边缘*证据,检索既相关又具有判别性的示范,从而填补了这一空白。

## 3 预备知识

在介绍EdgeLM之前,我们引入一个统一的预测公式,用于对结构化表格数据进行预测,其抽象了各个具体任务。虽然我们的评估集中在数据整理任务上,但该公式自然扩展到更广泛的以表格为中心的预测问题类别。

**统一预测公式。** 我们考虑定义在一个或多个关系表上的预测问题。给定从表中提取的查询实例,目标是预测其未知标签。这种抽象涵盖了广泛的以表格为中心的预测问题,包括数据整理、表格理解以及相关的结构化预测任务。形式上,令τ表示一个预测任务,其实例空间为\(\mathcal{X}_{\tau}\),有限标签空间为\(\mathcal{Y}_{\tau}\)。给定查询实例\(x \in \mathcal{X}_{\tau}\),目标是预测\(y = f_{\tau}^{*}(x) \in \mathcal{Y}_{\tau}\),其中\(f_{\tau}^{*}: \mathcal{X}_{\tau} \rightarrow \mathcal{Y}_{\tau}\)是未知的任务特定决策函数。查询实例的形式取决于具体应用。它可能对应一个单元格、一个元组、一对元组、一对属性、整个表格,或任何其他从关系表中派生的结构化对象。

令\(\mathcal{D}\)表示一个表,其模式为\(\mathcal{R} = \{A_{1}, \ldots, A_{m}\}\),其中每个元组\(t_{i} \in \mathcal{D}\)包含属性值\(t_{i}[A_{j}]\)。涉及多个表的任务还假设存在第二个表\(\mathcal{D}^{\prime}\),其模式为\(\mathcal{R}^{\prime}\)。表1 (https://arxiv.org/html/2608.04390#S3.T1) 展示了实例化该公式的五个代表性数据整理任务。这些任务贯穿全文作为评估基准,但该公式本身要通用得多。

表 1:统一预测公式下的代表性以表格为中心的预测任务。†每个任务的确切表述见附录A (https://arxiv.org/html/2608.04390#A1)。

**检索增强预测。** 我们不对每个任务适配语言模型,而是通过上下文学习使用冻结的LLM\(\mathcal{M}\)进行预测。因此,核心设计选择不是语言模型本身,而是检索哪些标注实例并将其渲染为示范。对于每个任务,我们假设可以访问一个带标签的参考池\(\mathcal{P}_{\tau} \subseteq \mathcal{X}_{\tau} \times \mathcal{Y}_{\tau}\),其元素是来自与查询相同应用域的标注实例。根据应用不同,它们可能对应标注的单元格、元组、元组对、属性对、完整元组或其他结构化对象。给定查询实例\(x\),检索函数\(\sigma(x, \mathcal{P}_{\tau})\)选择\(k\)个实例的集合\(\mathcal{S} \subseteq \mathcal{P}_{\tau}\)。每个检索到的实例被渲染为上下文示范,并与\(x\)一起包含在提供给\(\mathcal{M}\)的提示词中。模型预测\(\hat{y} = \arg\max_{y \in \mathcal{Y}_{\tau}} p_{\mathcal{M}}(y \mid x, \mathcal{S})\),当\(\hat{y} = f_{\tau}^{*}(x)\)时预测被视为正确。

**目标。** 我们不修改底层语言模型\(\mathcal{M}\),而是专注于选择示范集\(\mathcal{S}\)。我们的目标是仅通过示范选择提高预测准确性,同时保持语言模型、提示词和任务公式固定。具体来说,我们寻求一个检索函数\(\sigma\),其选择的示范既与查询相关,又对未知决策函数\(f_{\tau}^{*}\)的局部决策边界具有信息量。尽管我们的实验集中在数据整理上,所提出的检索策略适用于任何可以通过从标注示例中进行上下文学习来解决的以表格为中心的预测问题。

## 4 边缘感知示范选择

第3节 (https://arxiv.org/html/2608.04390#S3) 将示范选择表述为一个问题:检索既与查询相关、又对未知决策函数\(f_{\tau}^{*}\)的局部决策边界具有信息量的示例。由于这个边界不可直接观测,EdgeLM使用两个互补信号来近似它:局部数据邻域中的标签变化,以及模型错误——

相似文章

当LLM粗心读取表格:衡量并减少数据引用错误

Hugging Face Daily Papers

本文系统评估了LLM在处理表格时的数据引用错误(DRE),并提出基于批评者的过滤和拒绝采样方法来提高答案准确性。一个轻量级的4B参数批评者模型在检测DRE方面达到了高准确率。