从教训中进化:面向操作级表格问答的技能增强表格图推理

arXiv cs.AI 论文

摘要

本文提出了一种新的任务——操作级表格问答(Operation-wise TableQA),具有细粒度的问题分类,并提出了SkillTGR,一种技能增强的表格图推理框架,该框架利用图遍历和分层技能库实现自进化推理,取得了优越的性能和效率。

arXiv:2607.22633v1 公告类型: 新论文 摘要:表格问答(TableQA)旨在对表格进行推理以回答用户查询。现有研究将所有问题统一对待,并仅通过整体准确率进行评估,这掩盖了一个关键事实:大型语言模型擅长简单查找,但在聚合和算术等复杂操作上表现不佳。为了揭示这种差异,我们引入了一种新的\emph{操作级表格问答}任务,具有细粒度的问题分类,并发布了两个数据集WikiTQ-ow和TabFact-ow用于评估。关于建模瓶颈,现有方法将表格展平为线性化文本,破坏了固有结构并引发了"中间丢失"问题,这对复杂的跨行推理构成了主要障碍。此外,它们通常从头开始推理,忽略了类似操作中共享的可重用模式。为了解决这些局限性,我们提出了一种技能增强的表格图推理(SkillTGR)框架,用于自进化的结构化推理。具体来说,SkillTGR将表格表示为具有显式行-列-单元格结构的属性图,其中大型语言模型规划并执行动态链以检索证据子图进行图遍历推理。基于此,SkillTGR构建了一个分层技能库,在认知启发下将推理轨迹提炼为抽象技能,然后混合检索成功和失败的技能进行对比增强的表格图推理,从而实现持续的自我进化。大量实验表明,SkillTGR取得了优越的性能,平均整体提升5.91%,操作级提升6.03%,同时减少了19.76%的令牌消耗和27.64%的推理延迟。我们的代码和数据将在发表后发布。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:26

# 从经验中进化:技能增强的表格图推理用于操作维度表格问答
来源:https://arxiv.org/html/2607.22633
Guixin Su, Qiankun Pi, Mayi Xu, Wenli Li, Ming Zhong, Yuanyuan Zhu, Jiawei Jiang, Tieyun Qian\*

###### 摘要

表格问答旨在对表格进行推理以回答用户查询。现有研究将所有问题统一对待,仅通过整体准确率进行评估,掩盖了一个关键现实:大型语言模型(LLM)擅长简单查找,却在聚合、算术等复杂操作上表现挣扎。为揭示这一差异,我们引入了一个新的*Operation-wise TableQA*任务,包含细粒度的问题分类,并发布了两个评估数据集WikiTQ-ow和TabFact-ow。在建模瓶颈方面,现有方法将表格展平为线性化文本,破坏了其固有结构并引发“中间失忆”问题,这对复杂的跨行推理构成了主要障碍。此外,它们通常从零开始推理,忽略了相似操作之间可复用的模式。为应对这些局限,我们提出了一种技能增强的表格图推理(SkillTGR)框架,用于自进化的结构化推理。具体而言,SkillTGR将表格表示为带有显式行-列-单元结构的属性图,由LLM规划并执行动态链以检索用于图遍历推理的证据子图。基于此,SkillTGR构建了分层技能库,在认知启发下将推理轨迹提炼为抽象技能,然后混合检索成功和失败的技能以进行对比增强的表格图推理,从而实现持续的自我进化。大量实验表明,SkillTGR取得了优越性能,整体平均提升5.91%,操作维度平均提升6.03%,同时减少了19.76%的标记消耗和27.64%的推理延迟。我们的代码和数据将在发表后发布。

## I. 引言

作为表格推理中的基础任务,表格问答(TableQA)专注于通过对给定表格进行证据检索和推理来解决自然语言查询,要求模型理解表格结构、精确定位相关条目并执行多步数值计算。该任务广泛应用于数据工程[21](https://arxiv.org/html/2607.22633#bib.bib49)、[36](https://arxiv.org/html/2607.22633#bib.bib50)、[30](https://arxiv.org/html/2607.22633#bib.bib51)、财务审计[9](https://arxiv.org/html/2607.22633#bib.bib33)和医疗记录分析[24](https://arxiv.org/html/2607.22633#bib.bib34)。

早期研究主要涉及训练或微调专门的TableQA模型[11](https://arxiv.org/html/2607.22633#bib.bib38)、[20](https://arxiv.org/html/2607.22633#bib.bib39)、[27](https://arxiv.org/html/2607.22633#bib.bib40)。TAPAS[14](https://arxiv.org/html/2607.22633#bib.bib29)引入了弱监督预训练,以在无需逻辑形式的情况下学习文本-表格相关性;TAPEX[23](https://arxiv.org/html/2607.22633#bib.bib15)通过模仿神经SQL执行器缓解数据稀缺问题;TACUBE[51](https://arxiv.org/html/2607.22633#bib.bib16)通过预计算问题感知的数据立方体进一步增强了数值推理。然而,由于小规模预训练模型推理能力有限,这些方法在处理复杂问题时表现不佳。

参照图注 图1:现有研究中的操作维度盲点和建模瓶颈,以及TableQA的可行方案。
近年来,大型语言模型(LLM)在各种任务中展示了其在语义理解和知识推理方面的卓越能力[37](https://arxiv.org/html/2607.22633#bib.bib30)、[49](https://arxiv.org/html/2607.22633#bib.bib31)、[8](https://arxiv.org/html/2607.22633#bib.bib32)。因此,最近的研究借助LLM来解决TableQA中的复杂推理瓶颈。

一种直观的解决方案是采用分解策略,逐步将表格或问题分解为中间推理步骤,以渐进式解决问题。例如,Binder[10](https://arxiv.org/html/2607.22633#bib.bib5)利用LLM将复杂问题分解为可执行的子程序(如SQL或Python),并迭代优化后再执行。在此基础上,Dater[40](https://arxiv.org/html/2607.22633#bib.bib6)采用解析-执行-填充策略进行问题分解,并进一步利用LLM作为通用分解器来检索子表格。此外,Chain-of-Table[34](https://arxiv.org/html/2607.22633#bib.bib7)通过推理链逐步动态演化表格,以促进上下文感知的推理。然而,基于分解的方法常常遭受错误传播和推理步骤间交互不足的问题。因此,一些研究引入了多智能体框架来协同优化推理过程。例如,ReAcTable[46](https://arxiv.org/html/2607.22633#bib.bib10)遵循先推理后行动[39](https://arxiv.org/html/2607.22633#bib.bib20)范式,迭代推理并执行外部代码工具;而Table-Critic[42](https://arxiv.org/html/2607.22633#bib.bib11)则分配LLM作为评审员、批评家和优化器智能体,逐步改进推理直至收敛到正确答案。此外,一些工作[44](https://arxiv.org/html/2607.22633#bib.bib8)、[38](https://arxiv.org/html/2607.22633#bib.bib9)利用表格或问题的结构化语义来增强证据检索和推理的可靠性。

尽管取得了显著进展,现有研究在评估粒度和建模范式方面仍存在重大局限,这自然引出了下面讨论的两个关键研究问题。

*RQ1:粗粒度的整体评估如何掩盖LLM在操作维度上的推理差异?*
现有研究将所有问题统一对待,仅通过粗粒度的整体准确率评估TableQA性能,掩盖了一个关键现实:LLM在不同操作上表现出显著差异。如图1(I)所示,先前方法在处理涉及条件查找的简单问题时往往表现出色,这要求模型通过单元级检索定位相关条目。相比之下,它们仍然难以解决需要跨多行推理的复杂问题,如比较、极值和聚合操作,以及需要多步数值计算的算术问题。因此,粗粒度评估掩盖了LLM在操作维度上的推理差异,无法准确定位推理瓶颈以改进模型,凸显了使用操作维度问题分类进行细粒度评估的必要性。

*RQ2:现有方法在操作维度上推理差异背后的建模瓶颈是什么?*
如图1(II)所示,现有方法在表格表示和推理范式两方面都存在固有缺陷。在表格表示方面,这些方法通常将表格线性化为扁平序列作为长上下文输入,不可避免地破坏了行-列-单元的结构语义,并损害了跨行关系推理。此外,这种线性化进一步引发了“中间失忆”问题,即LLM过度关注边界标记而忽略关键的中间证据,从而阻碍了复杂操作所需的多行信息检索。在推理方面,主流方法统一遵循从零推理的范式,独立推理每个问题而不利用任何历史经验。因此,结构相似的操作维度问题的推理模式既不能有效地跨实例复用也不能迁移,对推理效率和答案准确性都施加了限制。

针对*RQ1*,我们引入了一个新的*Operation-wise TableQA*任务,以研究LLM在包含五种核心操作的细粒度问题分类上的表现,而不仅仅是有限的整体评估。具体而言,*条件查找*通过单元级匹配检索目标条目;*比较*和*极值*需要跨行关系推理以识别差异或边界值;*聚合*涉及联合处理多个条目进行统计汇总;而*算术*则进一步需要在检索到的证据上进行多步数值计算。为支持系统评估,我们构建了两个精炼的数据集WikiTQ-ow和TabFact-ow,通过为问题标注操作类型以进行细粒度的操作维度分析。

针对*RQ2*,我们提出了一个技能增强的表格图推理(SkillTGR)框架,用于自进化的结构化推理。SkillTGR将表格转换为带有显式行-列-单元结构的属性图,使LLM能够使用预定义操作符规划和执行动态链,以检索证据子图并进行图遍历推理,从而缓解表格线性化带来的结构语义丢失和“中间失忆”问题。此外,SkillTGR构建了分层的技能库,在认知启发下将历史轨迹提炼为可复用的技能,并混合检索成功和失败的技能以进行对比增强推理,有效打破了从零推理的限制,并支持跨不同实例的持续自我进化。

我们的贡献总结如下:

- •据我们所知,我们是第一个从细粒度视角研究TableQA任务,并采用操作维度问题分类而非有限的整体评估的工作,探讨了LLM在五种核心表格推理类型上的表现。为此,我们发布了两个精炼的基准数据集WikiTQ-ow和TableFact-ow用于评估,并复现和构建了包含多种建模范式的基线系统以进行操作维度的比较。
- •我们提出了一个新的技能增强的表格图推理(SkillTGR)框架,用于自进化的结构化推理。SkillTGR将表格表示为属性图,实现了结构感知的证据检索和图遍历推理。此外,SkillTGR构建了分层的技能库,将历史轨迹提炼为可复用的技能以用于后续推理,从而逐步提升跨不同操作维度问题的推理能力。
- •在两个LLM上对WikiTQ-ow和TabFact-ow进行的大量实验表明,SkillTGR始终实现了最先进的性能,与竞争基线相比,整体准确率平均提升5.91%,操作维度准确率平均提升6.03%,同时减少了19.76%的标记消耗和27.64%的推理延迟,验证了我们提出的框架的有效性和效率。

## II. 相关工作

本节从两个相关方向回顾相关工作:*表格问答*和*大型语言模型的自我进化*。以下简要讨论两个领域的代表性研究。

### II-A 表格问答

作为表格推理的核心任务,表格问答要求模型共同理解表格结构和内容,同时解析复杂的问题意图,已经经历了多种范式的发展。

早期工作主要集中在通过微调预训练语言模型[41](https://arxiv.org/html/2607.22633#bib.bib14)、[23](https://arxiv.org/html/2607.22633#bib.bib15)、[13](https://arxiv.org/html/2607.22633#bib.bib17)来开发专门模型。得益于大型语言模型(LLM)出色的指令跟随能力[2](https://arxiv.org/html/2607.22633#bib.bib3)、[16](https://arxiv.org/html/2607.22633#bib.bib42)、[33](https://arxiv.org/html/2607.22633#bib.bib41),近期研究转向了上下文学习范式[4](https://arxiv.org/html/2607.22633#bib.bib18)、[48](https://arxiv.org/html/2607.22633#bib.bib19)、[45](https://arxiv.org/html/2607.22633#bib.bib45)、[19](https://arxiv.org/html/2607.22633#bib.bib44)。受渐进式推理的逐步分解策略[50](https://arxiv.org/html/2607.22633#bib.bib12)、[15](https://arxiv.org/html/2607.22633#bib.bib13)、[31](https://arxiv.org/html/2607.22633#bib.bib37)、[47](https://arxiv.org/html/2607.22633#bib.bib43)启发,基于分解的方法迭代地生成可执行程序[10](https://arxiv.org/html/2607.22633#bib.bib5)、符号操作[34](https://arxiv.org/html/2607.22633#bib.bib7)或上下文感知的表格分区[40](https://arxiv.org/html/2607.22633#bib.bib6),将复杂表格推理分解为可管理的步骤,如中间表格或子问题。此外,一些工作利用统一的知识表示[44](https://arxiv.org/html/2607.22633#bib.bib8)或显式的实体依赖[38](https://arxiv.org/html/2607.22633#bib.bib9)来增强LLM对表格结构和问题模式的理解。为利用LLM的协同作用[28](https://arxiv.org/html/2607.22633#bib.bib22)、[1](https://arxiv.org/html/2607.22633#bib.bib21)、[5](https://arxiv.org/html/2607.22633#bib.bib47)、[12](https://arxiv.org/html/2607.22633#bib.bib46)、[43](https://arxiv.org/html/2607.22633#bib.bib48),最近的多智能体框架集成了迭代推理-执行策略[46](https://arxiv.org/html/2607.22633#bib.bib10)和批评-优化循环[42](https://arxiv.org/html/2607.22633#bib.bib11)以实现智能体协作,显著提高了表格推理的鲁棒性和准确性。

尽管先前的方法取得了令人鼓舞的成果,但它们通常专注于整体评估,并将表格线性化为长上下文输入,这不仅破坏了行-列-单元结构,还引发了“中间失忆”问题[22](https://arxiv.org/html/2607.22633#bib.bib23)。此外,这些方法主要依赖从零推理,未能利用历史经验来促进后续推理。为解决这些问题,我们引入了*Operation-wise TableQA*任务以实现细粒度评估,所提出的框架将表格转换为属性图进行结构化推理,并进一步将历史经验抽象为可复用的技能,以通过自我进化持续增强表格图推理。

### II-B 大型语言模型的自我进化

自我进化方法[3](https://arxiv.org/html/2607.22633#bib.bib52)通过融入自我反思、迭代修订或反馈驱动的精炼来增强LLM行为。代表性工作从不同角度探索了这一方向:递归内省[26](https://arxiv.org/html/2607.22633#bib.bib24)使LLM能够通过重复的自我评估迭代地重新审视和优化先前的推理尝试;自我进化课程[7](https://arxiv.org/html/2607.22633#bib.bib25)专注于自动构建课程以逐步增强推理能力;此外,不确定性增强的偏好优化[32](https://arxiv.org/html/2607.22633#bib.bib26)通过利用不确定性感知的反馈采样来改进LLM策略,从而产生更可靠的学习信号。

与通过模型训练来改进LLM行为的先前自我进化方法不同,我们的SkillTGR

相似文章

SABET-QA:时序知识图谱问答

arXiv cs.CL

SABET-QA 提出了一个用于时序知识图谱问答的迭代框架,通过双向实体-时序评分和上下文化增强了多跳推理,并在 CronQuestions 和 TimeQuestions 等基准测试中显示出相对于基线的一致改进。

面向高效视觉推理的特定问题知识图谱

arXiv cs.CL

该论文提出了 VisKG,这是一个强化学习框架,用于训练视觉-语言模型将图像转化为特定问题的知识图谱表示,在提升视觉问答推理效率的同时减少 token 使用量。论文提出的 GDPO 目标函数在科学、数学和通用视觉推理基准测试上的平均准确率较基于 GRPO 训练的模型高出约 2%。

Stratagem:通过轨迹调制博弈自博弈学习可迁移推理

Hugging Face Daily Papers

# 论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理 来源:[https://huggingface.co/papers/2604.17696](https://huggingface.co/papers/2604.17696) 作者:,,,,,,,,,, ## 摘要 STRATAGEM 通过引入推理可迁移性系数与演化奖励,鼓励抽象、跨领域模式而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。博弈为开发通用推理能力提供了极具吸引力的范式。