TabScope:表格问答中的问题自适应范围选择
摘要
TabScope是一个用于表格问答的问题自适应框架,它根据问题类型动态选择局部推理或全表推理,通过操作感知分解和新基准测试提高了在长表格上的性能。
arXiv:2609.03395v1 公告类型:新
摘要:大型语言模型(LLMs)在表格问答上表现出色,但其准确性常随表格大小增加而下降。我们发现这种下降在不同问题类型间并不均匀。定位敏感问题尤其受无关表格内容的影响,而需要更广泛证据的问题仍可能受益于全表推理。基于此观察,我们提出一个自适应框架,动态选择局部推理或全表推理。该框架通过操作感知表格分解构建问题特定子表,并使用预测的问题类型来确定适当的推理模式。我们进一步引入银参考子表用于评估证据选择,并构建了基于真实世界长表格的基准测试SLQA。在WikiTQ和SLQA上的实验表明,定位对于查找和局部推理问题特别有效,而自适应选择局部和全表推理实现了最佳整体性能。这些结果突显了长表格问答不仅需要决定如何定位,还需要决定何时定位。我们的代码和数据集将在论文发表后公开。
查看缓存全文
缓存时间: 2026/09/04 05:59
# TabScope:面向表格问答的问答自适应作用域选择 来源:https://arxiv.org/html/2609.03395 作者:Yuxiang Wang, Junhao Gan, Jianzhong Qi 所属机构:墨尔本大学 邮箱:[[email protected]](mailto:) 、\{junhao.gan, jianzhong.qi\}@unimelb.edu.au #### 摘要 大语言模型(LLMs)在表格问答任务中表现出色,但随着表格规模增大,其准确率往往会下降。我们发现这种性能下降在不同问题类型上并不均匀:局部敏感问题尤其受到无关表格内容的影响,而需要更广泛证据的问题仍可从全表推理中受益。基于这一观察,我们提出一个问答自适应框架,动态选择局部推理或全表推理。该框架通过操作感知的表格分解构建问题特定的子表,并利用预测的问题类型确定合适的推理模式。我们进一步引入用于评估证据选择的银标准参考子表,并构建了基于真实长表格的基准测试SLQA。在WikiTQ和SLQA上的实验表明,局部化对查找类和局部推理问题特别有效,而在局部与全表推理间自适应选择能取得最佳整体性能。这些结果凸显了长表格问答不仅需要决定如何局部化,更需明确何时局部化。论文发表后将开源代码和数据集。 ## 1 引言 大语言模型(LLMs)在表格问答(TableQA)中展现出强大的推理能力,尤其在结合思维链(CoT)提示时效果显著(Wei et al., 2022; Chen, 2023)。然而,其性能仍对表格规模敏感:随着表格行数增加,LLMs难以从嘈杂输入中识别支持答案所需的关键行列,导致准确率下降(Ye et al., 2023; Liu et al., 2024)。我们的分析表明,这种性能下降因问题类型而异:当答案依赖于小范围的表格区域时,局部化特别有效;而对于需要广泛比较集合、完整聚合领域或多行分布信息的问题,保留全表可能更有益,因为分解可能移除必要上下文或引入检索误差。图1总结了这些发现:全表推理在大型表格上表现较差,而局部化的收益随问题类型和表格规模变化。这引出了本文的核心问题:*表格问答模型应在何时局部化表格?又应在何时基于全表上下文推理?* 图1:使用GPT-5-mini作为基础模型,展示问答自适应表格作用域选择的动机。(a)全表问答在大型表格上表现下降。(b)局部化有助于需要紧凑区域的问题,而涉及多行或实体的问题更倾向于全表推理。小/中型表格对应WikiTQ,大型表格对应SLQA。 我们将表格问答视为问答自适应推理问题,而非固定的分解流程,尤其针对长表格场景。我们提出TabScope框架,首先判定问题是更适合全表推理还是紧凑子表推理。当预期局部化有益时,TabScope使用带细化机制的操作感知分解器,在推理前选取相关行列;否则直接基于全表推理。该设计能在有益时利用紧凑表格区域,在必要时保留完整上下文。 现有表格问答基准测试在证据定位研究方面存在两个局限:首先,WikiTableQuestions等数据集仅提供表格、问题和最终答案,未明确标注支撑子表,难以评估中间证据选择质量;其次,大多数基准测试(如Pasupat & Liang 2015; Chen et al. 2020; Wu et al. 2025)的表格较小,对长表格场景覆盖有限。我们通过构建用于评估分解质量的银标准参考子表解决第一个局限;针对第二个局限,我们开发自动流程从真实表格生成问答对,构建了长表格问答基准测试SLQA。本文主要贡献包括: - 构建银标准参考子表以直接评估分解质量,提出操作感知分解方法以提升证据选择效果。 - 分析局部化适用条件,引入问答自适应框架以在局部与全表推理间动态选择。 - 开发从真实表格自动生成验证问答对的流程,构建长表格问答基准测试SLQA。 ## 2 相关工作 近期基于LLM的表格问答方法通过生成答案前的相关行列缩减、检索或转换来应对大表格推理难题。我们首先回顾两类主流定位方法:*语义证据选择*与*操作感知表格缩减*;随后综述现有表格问答基准测试与证据标注,为银标准子表构建和长表格基准测试提供背景。 ##### 证据定位与检索 一类工作在推理前选取包含相关证据的子表。DATER(Ye et al., 2023)使用LLMs分解表格和问题,选取相关行列用于下游推理;H-STAR(Abhyankar et al., 2025)在混合符号-文本框架内提取相关表格区域。其他研究采用检索增强方法:TableRAG(Chen et al., 2024)检索相关模式与单元信息以理解大规模表格;T-RAG(Pan et al., 2022)结合密集表格检索与生成用于开放域表格问答;GTR(Zou et al., 2025)基于图结构进行层级检索以实现跨表格问答。这些方法主要改进证据检索或选择方式,而我们的方法使证据选择具备操作感知特性,并将局部化视为问题相关的决策。 ##### 程序引导的表格分解 另一类方向通过显式操作或可执行程序获取中间表格。Chain-of-Table(Wang et al., 2024)在推理过程中迭代变换表格,将中间表格视为演化推理状态;Table-Critic(Yu et al., 2025)在生成答案前迭代评估并优化中间表格;ReAcTable(Zhang et al., 2024)结合LLM推理与SQL、Python执行器等工具逐步处理表格数据;TabSQLify(Nahid & Rafiei, 2024)通过SQL查询构建问题相关子表;Plan-of-SQLs(Nguyen et al., 2025)执行一系列SQL步骤以提供可解释的中间推理轨迹。相比之下,TabScope无需完整操作链或可执行程序,仅在局部推理有益时应用分解。 ##### 证据监督与长表格评估 大多数表格问答基准测试(如WikiTableQuestions)提供表格、问题和最终答案,但未明确标注支撑行列(Pasupat & Liang, 2015),这限制了对中间子表的直接评估。此外,许多常用基准测试的表格较小(通常少于4K表格令牌),不利于评估长表格推理(Chen et al., 2020; Wu et al., 2025; Cheng et al., 2022)。我们通过构建银标准参考子表以评估分解质量,并引入基于真实长表格的基准测试SLQA来填补这些空白。 ## 3 方法 ### 3.1 问题形式化 给定表格$T$、问题$q$和参考答案$a$,表格问答的目标是预测匹配$a$的答案$\hat{a}$。我们将表格表示为$T=(H,R)$,其中$H=\{h_1,...,h_m\}$为列头,$R=\{r_1,...,r_n\}$为表格行。对于每个问题,模型可基于全表$T$推理,或将其缩减为问题特定的子表$T'$。我们定义子表为$T'=T[R',C']$,其中$R'⊆R$和$C'⊆H$为选定的行与列。我们的目标并非总是最小化表格,而是为每个问题选择合适的作用域。 ### 3.2 TabScope框架概述 我们提出TabScope问答自适应框架,在生成答案前选择合适的作用域。如图2所示,TabScope包含三个组件:(i)基于LLM的作用域选择器预测问题类型,并采用固定策略选择局部推理或全表推理;(ii)当选择局部化时,操作感知分解器检索所需行列,并将其细化为问题特定的子表;(iii)答案模型基于选定输入(细化子表或原始全表)生成答案。 ### 3.3 问答自适应作用域选择 TabScope旨在判定每个问题是否适用局部化。作用域选择器包含基于LLM的问题类型分类器$C_θ$和固定类型-作用域策略$π$。给定问题$q$和表格$T$,分类器预测预定义的问题类型$\hat{τ}$。策略根据预测类型和表格规模区间选择推理模式: $$\hat{τ}=C_θ(q,T)$$ $$z=π(\hat{τ},s(T)),\quad z∈\{\text{local},\text{full}\}$$ 其中$s(T)$表示表格规模区间。若$z=\text{local}$,TabScope在生成答案前构建问题特定子表;否则绕过分解,直接基于原始表格推理。我们通过在验证集上离线分析确定策略$π$:对每种问题类型,比较局部推理与全表推理性能,并分配更优模式。当偏好模式在大型表格上改变时,我们额外考虑表格规模。推理时,LLM仅预测$\hat{τ}$,固定策略决定最终作用域。分类提示见附录C.4,用于定义$π$的类型分析见附录B。 ### 3.4 操作感知表格分解 当作用域选择器选择局部推理时,TabScope通过操作感知分解构建问题特定子表。目标是检索问题推理过程所需的行列,而非仅依赖问题与表格内容的词汇重叠。分解包含三个步骤:操作感知检索、证据聚合与子表细化。所有使用的提示见附录C。 ##### 操作感知检索 分解器首先识别问题所需的操作(如查找、过滤、比较或计数),该操作决定需检索的行列。例如,对于问题“多少支澳大利亚球队得分超过10?”,分解器应检索国家为澳大利亚且得分大于10的行,以及国家、得分和球队标识符等列。尽管最终答案仅为计数,子表必须保留验证过滤操作所需的证据。这表明分解应由操作而非仅词汇重叠引导。 ##### 证据聚合 单次LLM检索可能不稳定,因生成结果可能跨样本变化,可能遗漏必要证据或包含弱相关行列。为使检索更稳健,我们对同一问题采样$K$次检索输出(默认$K=4$),分别聚合行检索与列检索结果。每次检索输出视为候选$c$,包含选定行集或列集。每个候选分配可靠性分数$s(c)$:若LLM提供生成置信度,则从候选平均令牌对数概率计算$s(c)$;否则设$s(c)=0$,此时权重$w(g)$退化为基于频率的投票。选择相同归一化行集或列集的候选合并为候选组$g$,每组计算支持权重: $$w(g)=\sum_{c∈g}\exp(s(c))$$ $w(g)$衡量检索样本对组$g$的支持强度,$\exp(s(c))$将候选分数转换为正投票权重。因此,当相同证据集多次出现或其候选可靠性较高时,组获得更高支持度。聚合后,检索样本返回的每个独立行集形成行组,独立列集形成列组。返回频率高或置信度高的组获得更大权重。例如,若四个样本中三个检索相同行,包含这些行的候选子表应获得更强支持。为构建候选子表,我们首先按支持权重对行组和列组排序,逐步合并高排名组以形成候选行集$R'$和列集$C'$,移除重复候选。随后枚举行列组合,为每个候选子表$T[R',C']$评分。
相似文章
从教训中进化:面向操作级表格问答的技能增强表格图推理
本文提出了一种新的任务——操作级表格问答(Operation-wise TableQA),具有细粒度的问题分类,并提出了SkillTGR,一种技能增强的表格图推理框架,该框架利用图遍历和分层技能库实现自进化推理,取得了优越的性能和效率。
DocScope:用于值得信赖的长文档理解的可靠推理基准测试
DocScope 是一个新的基准测试,旨在评估多模态大语言模型在长文档上的可靠推理能力和可信度,引入了包含页面定位、区域定位、事实提取和答案验证四个阶段的评估协议。
SPADER:多答案问答中的逐步同行优势与多样性感知探索奖励
本文介绍了SPADER,一个用于多答案问答的强化学习框架,它使用逐步同行优势进行信用分配,并采用多样性感知探索奖励来提高长尾实体的召回率,在多个基准测试上取得了更好的性能。
SABET-QA:时序知识图谱问答
SABET-QA 提出了一个用于时序知识图谱问答的迭代框架,通过双向实体-时序评分和上下文化增强了多跳推理,并在 CronQuestions 和 TimeQuestions 等基准测试中显示出相对于基线的一致改进。
AB-RAG:自适应预算检索增强生成用于可靠问答
AB-RAG是一种无需训练、骨干无关的框架,通过估计答案置信度自适应地检索段落以进行问答,在多个骨干和数据集上提高了效率和准确性。