CRAFT:面向表格问答与事实验证的统一反事实推理框架

arXiv cs.CL 论文

摘要

CRAFT是一个统一的反事实推理框架,通过构建原始陈述和反事实变体,从双向推理路径中提取证据,并通过加权机制进行整合,从而提升了表格问答和事实验证的效果。在WikiTQ和TabFact数据集上的实验表明,该框架持续优于基线方法。

arXiv:2606.06842v1 Announce Type: new 摘要:表格推理对大型语言模型(LLMs)来说仍然具有挑战性,尤其是在需要对长而结构化的表格进行多步推理的任务中。现有方法主要依赖单向推理,这限制了它们跨任务探索替代假设的能力。本文提出CRAFT,一个统一的反事实推理框架,将表格问答和事实验证转化为通用的双向验证过程。我们的方法明确构建声明性陈述及其反事实变体。然后从原始和反事实两条推理路径中提取证据,并通过加权机制整合得出最终答案。实验结果表明,我们的方法在WikiTQ和TabFact等表格推理数据集上持续优于代表性基线,尤其是在复杂问答上取得了较大改进。我们的框架还显著缩小了不同骨干LLM之间的性能差距。这表明反事实推理有效克服了单向推理的局限,引导LLM进行更具辨别力的推理,并为结构化推理任务建立了更规范化的范式。我们的代码将在论文被接收后公开。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:21

# CRAFT:面向表格问答与事实验证的统一反事实推理框架
来源:https://arxiv.org/html/2606.06842
Chenshuo Pan1, Yu Zhao1, Jie Zhang1, Changzai Pan1, Zhenhe Wu1, Jiayi Liang1, Yujie Mao1, Shuangyong Song1, Yongxiang Li1, Zhongjiang He1
1Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.

###### 摘要
表格推理对大型语言模型(LLMs)仍然具有挑战性,尤其是在需要跨长且结构化的表格进行多步推理的任务中。现有方法主要依赖单向推理,这限制了其跨任务探索替代假设的能力。在这项工作中,我们提出CRAFT,一个统一的反事实推理框架,它将表格问答和事实验证重新组织为通用的双向验证过程。我们的方法显式地构建陈述性语句及其反事实变体。然后,从原始路径和反事实路径的推理中提取证据,并通过加权机制整合以得出最终答案。实验结果表明,我们的方法在WikiTQ和TabFact等表格推理数据集上持续超越代表性基线,尤其在复杂问答任务上取得了显著提升。我们的框架还显著缩小了不同骨干LLMs之间的性能差距。这表明反事实推理有效克服了单向推理的局限性,引导LLMs进行更具辨别力的推理,并为结构化推理任务建立了更原则性的范式。我们的代码将在接收后公开。

CRAFT:面向表格问答与事实验证的统一反事实推理框架
Chenshuo Pan1, Yu Zhao1, Jie Zhang1, Changzai Pan1, Zhenhe Wu1, Jiayi Liang1, Yujie Mao1, Shuangyong Song1, Yongxiang Li1, Zhongjiang He1
1Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.

## 1 引言
表格是结构化数据的代表性形式,广泛存在于财务报告、统计年鉴以及各类领域知识库中(Liu等,2023a (https://arxiv.org/html/2606.06842#bib.bib20); Chen等,2021b (https://arxiv.org/html/2606.06842#bib.bib7))。与自然语言文本相比,表格通过行列结构显式地组织信息,这给数据定位、符号计算和实体链接带来了挑战(Fang等,2024 (https://arxiv.org/html/2606.06842#bib.bib1); DU, 2025 (https://arxiv.org/html/2606.06842#bib.bib25))。理解和推理表格已成为自然语言处理中的重要研究课题,表格问答(QA)和表格事实验证(FV)是其中两个代表性任务。为了对表格信息进行推理,大型语言模型(LLMs)不仅需要理解自然语言问题,还必须理解跨行和跨列的结构关系(Liu等,2023b (https://arxiv.org/html/2606.06842#bib.bib22); Ruan等,2024 (https://arxiv.org/html/2606.06842#bib.bib35))。这要求模型具备跨单元格比较和数值推理等操作能力,以产生可靠的推理结果(Badaro等,2023 (https://arxiv.org/html/2606.06842#bib.bib2))。

参见图注图1:CRAFT概览,一个用于表格推理的多智能体框架,Rewriter从问题形成初始陈述,Reverser推导出反事实启发的反向陈述以创建互补推理路径,Extractor从两条路径收集证据和预测,Rethink共同评估并生成最终答案。

近期工作通过两种主要策略应对表格推理挑战。一类研究通过预训练或微调LLMs(Herzig等,2020 (https://arxiv.org/html/2606.06842#bib.bib12); Su等,2024 (https://arxiv.org/html/2606.06842#bib.bib36); Zhang等,2025b (https://arxiv.org/html/2606.06842#bib.bib55))在参数层面引入表格特定的归纳偏置来改进表格理解,但通常计算成本高昂。另一类研究则推动显式推理和提示工程,用于子表格提取(Ye等,2023 (https://arxiv.org/html/2606.06842#bib.bib49); Sui等,2024 (https://arxiv.org/html/2606.06842#bib.bib37); Nahid和Rafiei,2024 (https://arxiv.org/html/2606.06842#bib.bib27); Wang等,2024 (https://arxiv.org/html/2606.06842#bib.bib43)),将问题分解为可验证的陈述,而无需更新模型参数(Wei等,2022 (https://arxiv.org/html/2606.06842#bib.bib46); Chen等,2023 (https://arxiv.org/html/2606.06842#bib.bib8); Xiong等,2025 (https://arxiv.org/html/2606.06842#bib.bib65))。基于批评的方法,如后验自我批评(Yu等,2025 (https://arxiv.org/html/2606.06842#bib.bib51))和基于一致性的聚合(Ji等,2024 (https://arxiv.org/html/2606.06842#bib.bib14); Wang等,2023 (https://arxiv.org/html/2606.06842#bib.bib42); Liu等,2024b (https://arxiv.org/html/2606.06842#bib.bib23)),近年来通过检测和纠正错误在TableQA中被证明有效。然而,重复单向推理的性能提升往往会随着迭代次数增加而迅速降低。这表明单向推理不足以实现稳健的表格理解。为了有效质疑初始前提,在推理过程中显式地整合反事实分析至关重要,而这在先前研究中很少受到关注。为弥补这一差距,我们提出CRAFT,一种新颖的用于表格数据的反事实推理框架。CRAFT联合构建支持性证据链和反事实证据链,以系统性地探索替代场景。在每个假设下,由LLMs执行不同的推理链,然后将得到的证据聚合以综合出最终答案。这消除了对繁琐的任务特定流水线工程的需求,为基于表格的问答和事实验证提供了通用解决方案。通过解决单向推理的脆弱性,CRAFT提供了一种原则性方法,推动向更结构化、更可靠的表格理解迈进。具体地,我们整合了四个协作模块:1) Rewriter将原始问题重新表述为陈述性假设,并将问题转化为可验证的声明。2) Reverser对该假设应用有针对性的变换规则,生成信息丰富的反事实语句,为推理创建互补场景。3) Extractor从LLMs的中间推理步骤中提炼关键支持证据,在事实和反事实假设下提出候选答案。4) Rethinker聚合提取的证据和候选答案,进行深思熟虑并得出最终的、经过验证的决策。整体框架如图1 (https://arxiv.org/html/2606.06842#S1.F1)所示。总之,我们的贡献有三个方面:
• 我们提出CRAFT,一个反事实推理框架,它不依赖于特定任务形式,并统一适用于结构化数据推理。
• 进行了大量实验和分析,验证了CRAFT的有效性和鲁棒性,其在准确性和稳定性上显著优于现有方法和基于一致性的策略。
• 我们的结果表明,反事实推理有助于引导LLMs摆脱固定模式,走向更具启发性的推理,为可信推理系统的发展提供了新视角。

## 2 相关工作
#### 表格推理
表格推理已引起广泛关注,许多研究集中于修改模型参数以更好地适应表格数据的结构特征。在早期尝试中,TAPAS(Herzig等,2020 (https://arxiv.org/html/2606.06842#bib.bib12))通过结构化嵌入对行列关系进行建模。另一类研究通过在大量表格相关语料库上进行预训练、指令调优或结构化微调来训练模型,例如RePanda(Chegini等,2025 (https://arxiv.org/html/2606.06842#bib.bib63)),使模型获得表格语义模式、对齐行为和执行能力(Liu等,2022 (https://arxiv.org/html/2606.06842#bib.bib21); Zhang等,2025b (https://arxiv.org/html/2606.06842#bib.bib55); Su等,2024 (https://arxiv.org/html/2606.06842#bib.bib36))。研究还结合了强化学习,利用反馈信号进一步提升模型性能(Aly等,2023 (https://arxiv.org/html/2606.06842#bib.bib40); Wu等,2025 (https://arxiv.org/html/2606.06842#bib.bib60); Pan等,2026 (https://arxiv.org/html/2606.06842#bib.bib30))。另一方面,大型语言模型表现出强大的固有推理能力,无需修改参数即可在表格任务上取得有竞争力的性能(Brown等,2020 (https://arxiv.org/html/2606.06842#bib.bib5))。因此,基于提示的策略被广泛探索,以激发这种潜在的推理能力(Zhou等,2023a (https://arxiv.org/html/2606.06842#bib.bib57); Chen等,2023 (https://arxiv.org/html/2606.06842#bib.bib8); Brown等,2020 (https://arxiv.org/html/2606.06842#bib.bib5))。Chain-of-Thought(Wei等,2022 (https://arxiv.org/html/2606.06842#bib.bib46))显式地鼓励模型阐述中间推理步骤。后续工作通过利用表格的结构特性,将这一范式扩展到表格上。Chain-of-Table(Wang等,2024 (https://arxiv.org/html/2606.06842#bib.bib43))通过将推理分解为可执行的子步骤来实现这一点,其中每个步骤都建立在上一个步骤产生的子表格之上。其他方法在推理之前对表格输入进行压缩或重组,以确保模型操作在紧凑、任务相关的数据上(Sui等,2024 (https://arxiv.org/html/2606.06842#bib.bib37); Nahid和Rafiei,2024 (https://arxiv.org/html/2606.06842#bib.bib27)),或结合外部符号执行框架,将计算和验证卸载给SQL或Python引擎(Cheng等,2023 (https://arxiv.org/html/2606.06842#bib.bib9); Zhang等,2024 (https://arxiv.org/html/2606.06842#bib.bib52); Ni等,2023 (https://arxiv.org/html/2606.06842#bib.bib29); Mao等,2025 (https://arxiv.org/html/2606.06842#bib.bib26)),使LLMs能够专注于规划而非计算。进一步地,其他研究强调多轮和结构化的推理机制,以增强鲁棒性和纠错能力。例如,自一致性(Wang等,2023 (https://arxiv.org/html/2606.06842#bib.bib42); Li等,2025 (https://arxiv.org/html/2606.06842#bib.bib18))、树结构(Ji等,2024 (https://arxiv.org/html/2606.06842#bib.bib14))和图结构推理(Li等,2025 (https://arxiv.org/html/2606.06842#bib.bib18))通过多分支逻辑推理增强稳定性。MIX-SC(Liu等,2024b (https://arxiv.org/html/2606.06842#bib.bib23))结合了文本和符号推理,而Table-Critic(Yu等,2025 (https://arxiv.org/html/2606.06842#bib.bib51))引入了关键评估以允许中间步骤的自我纠正。然而,现有的表格推理方法通常围绕原始问题强化推理,并未探索使用反事实推理路径进行显式证据比对。

#### 反事实推理
许多研究通过构建输入的反事实变体来增强因果稳定性(Feng等,2021 (https://arxiv.org/html/2606.06842#bib.bib11)),通过关系驱动的反事实对比加强分布外泛化(Yang等,2023 (https://arxiv.org/html/2606.06842#bib.bib48)),并测试在非典型推理条件下的判别能力(Webb等,2025 (https://arxiv.org/html/2606.06842#bib.bib45))。它也被用于语义界定和自我校准,例如区分假设知识与事实知识(Li等,2023 (https://arxiv.org/html/2606.06842#bib.bib17))以及通过提示中的反事实示例改进上下文忠实性(Zhou等,2023b (https://arxiv.org/html/2606.06842#bib.bib58))。Direct–Indirect Reasoning(Zhang等,2025c (https://arxiv.org/html/2606.06842#bib.bib56))框架通过联合前向验证和反向验证,为解决数学问题提供了更通用的范式。Kim引入了Counterfactual-Consistency Prompting(Kim和Hwang,2025 (https://arxiv.org/html/2606.06842#bib.bib15)),它构建时间反事实问题以强制执行一致性,在相对时间推理中表现出色。然而,该方法完全依赖于反事实,并且主要对时间相关的验证任务有效。据我们所知,反事实推理尚未在表格推理中得到探索,尽管表格数据的结构化性质使其天然地适用于反事实验证。

## 3 方法
符号和定义。CRAFT的整体框架由四个模块组成——Rewriter、Reverser、Extractor和Rethinker。为了形式化问题设置,我们将表格表示为TT,真实答案为AA,自然语言问题为QQ,从QQ导出的陈述性语句为SS。在表格事实验证(FV)中,输入已经是一个陈述性声明,因此S=QS=Q。

### 3.1 Rewriter
Rewriter模块旨在将开放式的表格QA任务转化为信息丰富且可验证的陈述性语句,以促进后续反事实语句的生成。形式上,Rewriter过程可以写为:
a∼ΩT,Q:=\{v∣τ(v)=τAQ\}. (1a)
S=M(Q,a). (1b)
我们首先仅从QQ的语义推断期望的答案类型τAQ,在推理时不参考任何真实答案。这里,τAQ表示QQ期望的语义类型(例如,时间、数字或布尔值),而τ(v)表示候选值vv的语义类型。相应地,ΩT,Q表示由TT和QQ诱导的类型一致的候选值空间。从该空间中采样一个原子值aa,并用它来实例化QQ中的语义槽,从而得到陈述性语句SS。在实践中,LLM被提示从TT的单元格中推断aa。当没有显式单元格可用时,它可能会随机实例化一个基于TT和QQ的、类型一致的值aa。与先前主要使用QA对来改进事实验证的工作(Aly等,2023 (https://arxiv.org/html/2606.06842#bib.bib40))不同,我们的Rewriter通过类型一致的实例化,将问题转化为陈述性语句SS,从而显式地桥接QA和FV。通过这种方式,QA被重新表述为与FV相同的基于语句的形式,使得下游模块能够在两项任务上统一运行。

### 3.2 Reverser
Reverser模块以陈述性语句SS为输入,旨在构建最优的反事实语句R∗。反事实推理不是简单的二元翻转;相反,一个语句SS可能有多个反事实方向。特别地,当QQ可用时,SS可能承载超越其表面形式的潜在语义,因此可接受的反事实方向应相对于(Q,S)的联合语义来定义。为清晰起见,我们将沿着不同方向实例化的反事实记为...

相似文章

Evidence-RL:迈向证据密集型视觉推理

Hugging Face Daily Papers

本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。