DS@GT ARC 在 CheckThat! 2026:基于 LLM 的推理轨迹排序与分组奖励建模用于多语言数值声明验证

arXiv cs.CL 论文

摘要

本文介绍了面向 CLEF 2026 CheckThat! 任务2 的系统,该系统利用基于 LLM 的推理轨迹排序和分组奖励建模来验证英语和阿拉伯语的数值声明,并比较了微调验证器与轻量级奖励模型。

arXiv:2607.25069v1 公告类型:新论文 摘要:数值声明的自动化验证是一项具有挑战性的问题,因为它同时需要语言理解和定量推理。本文描述了我们在 CLEF 2026 CheckThat! 任务2 中的系统,该任务专注于对大型语言模型(LLM)生成的推理轨迹进行排序,并预测英语和阿拉伯语数值声明的最终裁决。我们探索了两种方法。第一种方法使用 LoRA 微调基于 LLM 的验证器,将每条推理轨迹独立地作为二分类问题评分,并通过 Best-of-N 选择确定最终裁决。我们进一步尝试了自适应子声明分解,以在验证前将复杂声明拆分为更简单的部分。第二种方法使用轻量级的 TF-IDF 奖励模型,配合手工设计的数值和时间重叠特征对轨迹进行评分,并按裁决组聚合分数以确定最终预测。对于阿拉伯语,我们将通用多语言模型与 AraBERT(一种预训练于阿拉伯文本的语言专用模型)进行了比较。我们的结果表明,基于 LLM 的方法在大多数指标上优于轻量级奖励模型,尤其是在 Recall@5 上,而基于奖励的方法在“冲突”类别上表现更强。子声明分解并未提升性能,这表明声明拆分引入了噪声而非辅助推理。对于阿拉伯语,AraBERT 在大多数指标上优于多语言基线。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:54

# CLEF 2026上的CheckThat!
来源:https://arxiv.org/html/2607.25069
\\copyrightclause

本文版权归作者所有。根据知识共享署名4.0国际许可协议(CC BY 4.0)允许使用。

\\conference

CLEF 2026 工作笔记,2026年9月21日至24日,德国耶拿

[orcid=0009-0002-7290-7317, [email protected], url=https://github.com/sagniksinha, ]\\cormark[1]\\fnmark[1]

[orcid=0009-0005-2061-3546, [email protected], url=https://github.com/shreyas-shrestha, ]\\fnmark[1]

\\cortext

[1]通讯作者。\\fntext[1]这些作者贡献相同。

Shreyas Shrestha
佐治亚理工学院,美国佐治亚州亚特兰大市北大街30332号

(2026年)

###### 摘要

数值声明的自动验证是一个具有挑战性的问题,因为它同时需要语言理解和定量推理。本文描述了我们为CLEF 2026 CheckThat! 任务2开发的系统,该任务专注于对大型语言模型(LLM)生成的推理轨迹进行排序,并预测英语和阿拉伯语数值声明的最终判定。我们探索了两种方法。第一种方法使用LoRA微调一个基于LLM的验证器,将每条推理轨迹作为独立的二分类问题进行评分,并通过最佳N选择选出最终判定。我们进一步尝试了自适应子声明分解,将复杂声明分解为更简单的部分后再进行验证。第二种方法使用轻量级TF-IDF奖励模型,结合手工设计的数值和时间重叠特征来对轨迹评分,并按判定组聚合评分以确定最终预测。对于阿拉伯语,我们比较了通用多语言模型与AraBERT(一种基于阿拉伯语文本预训练的语言专用模型)的效果。结果显示,基于LLM的方法在大多数指标上优于轻量级奖励模型,尤其在Recall@5方面表现突出,而基于奖励的方法在冲突类别上表现更强。子声明分解并未提高性能,这表明声明拆分引入了噪声而非有助于推理。对于阿拉伯语,AraBERT在大多数指标上优于多语言基线。

###### 关键词:

数值声明验证\\sep推理轨迹排序\\sep奖励建模\\sep大型语言模型\\sepLoRA微调\\sep子声明分解\\sep多语言事实核查\\sep阿拉伯语NLP\\sepCLEF 2026 CheckThat!

## 1 引言

错误信息的快速传播已成为当前数字时代最紧迫的挑战之一。由于数十亿人通过社交媒体平台获取新闻,虚假或误导性信息可在几分钟内触达广大受众,远远超过任何手动纠正的速度 [aimeur2023fake]。由于许多成年人都依赖社交媒体作为主要新闻来源 [pewresearch2023],错误信息进一步传播的风险比以往任何时候都大。传统的事实核查组织,如PolitiFact和Snopes,依赖经过培训的记者手动核实声明,这一过程既耗时又无法扩展以应对网络上大量流传的内容 [shaar2021assisting]。因此,开发自动事实核查系统已成为一项关键的研究重点。

随着大型语言模型(LLM)和人工智能生成在线内容的兴起,这一问题在规模和复杂性上进一步加剧。尽管这些工具能力强大,但它们也更容易大规模生成具有说服力但事实不正确的文本。因此,开发稳健可靠的自动事实验证系统对于维护公开信息的信任至关重要。

这个问题中特别具有挑战性的部分是验证数值声明。数值声明是包含特定数量、统计数据、日期或其他时间表达式的陈述。由于有充分记录的数值真实效应——一种认知偏差,即数字的存在使陈述看起来更可信,而不管其准确性如何 [sagara2009numeric]——这类声明在错误信息语境中尤其危险。验证数值声明不仅涉及理解语言,还需要进行细粒度的定量推理,这是当前自动系统仍然难以做到的能力 [runewicz2025fraunhofer, heil2025dsgt]。

CLEF的CheckThat! 实验室通过其年度共享任务和竞赛长期致力于应对这一挑战。这些竞赛对事实核查流程不同组成部分的系统进行基准测试 [nakov2018checkthat, barron2020checkthat, barron2024checkthat]。在2025年版中,任务3专门关注数值和时间声明的自动验证 [alam2025checkthat]。使用QuanTemp数据集——一个大规模基准,来源于全球45个事实核查组织,包含超过15,000个带注释的声明和一个超过423,000个摘要的证据库 [venktesh2024quantemp]——参与者需要根据检索到的证据将每个声明分类为真、假或冲突。该任务代表了向数值事实核查专门基准测试迈出的重要第一步,但主要根据分类准确率评估系统,而未检查得出每个判定所依据的推理质量。

在CLEF 2025的基础上,CLEF 2026 CheckThat! 任务2引入了该问题的一个全新且更具雄心的子集。与简单预测判定不同,今年的任务引入了一个测试时扩展框架,该框架评估推理轨迹本身的排序 [clef-checkthat:2026:task2]。给定一个声明、相关证据以及由LLM在不同温度设置下生成的多条推理轨迹(以鼓励多样性),参与者必须训练一个验证器模型,根据这些推理轨迹在得出正确判定方面的效用对其进行排序,然后从排名靠前的轨迹中推导出最终判定 [liang2026gr2]。

CLEF 2026的设置既评估系统判定的正确性,也评估其底层推理的质量。这是一个重要的进步,因为它评估自动系统是否能评估判定背后的推理,而不仅仅是分类。2026任务的另一个重要方面是其多语言数据集。虽然2025任务仅限英语,但今年的任务扩展到西班牙语和阿拉伯语,利用了上一版中的2,808个西班牙语和3,260个阿拉伯语声明,以及英语QuanTemp数据。本文的范围仅限于英语和阿拉伯语。系统通过宏平均F1(用于判定准确率)和Recall@k与MRR@k(用于推理轨迹排序质量)进行评估,最终分数综合两个维度的表现。

在本文中,我们描述了为CLEF 2026 CheckThat! 任务2开发的系统。我们解决以下三个研究问题(RQ):

- • RQ1:单一多语言模型能否处理所有语言,即英语和阿拉伯语?还是使用语言专用模型会提高性能?
- • RQ2:将声明分解为更小的子声明是否有助于提高推理轨迹排序性能?
- • RQ3:一种基于分组奖励、以轨迹级分析为中心的排序模型能否改善最终判定预测?

本文的其余部分安排如下:第2节回顾相关工作;第3节描述我们的方法;第4节呈现结果;第5节讨论未来工作;第6节总结全文。

竞赛使用Recall@k和MRR@k(k=5)来衡量推理轨迹排序质量。对于声明验证,我们报告宏平均F1和各类别F1分数。最终分数通过宏平均F1和Recall@5分数的平均值获得。

## 2 相关工作

数值声明验证是自然语言处理中的一个独特问题,因为它需要准确的语义解释以及明确的时间和数值基础。因此,先前的CheckThat! 提交通常使用多阶段架构,将证据选择、证据评分、推理和最终判定预测分开。Fraunhofer SIT使用了三阶段架构,包括密集证据检索、对比重排序和最终判定的证据池化 [runewicz2025fraunhofer]。SINAI-UGPLN使用了一个多阶段元集成框架,将数值和词汇特征与其基于transformer的分类器相结合。早期的DS@GT团队在产生最终判定之前研究了检索、上下文构建以及分词等方面的架构差异 [heil2025dsgt]。

我们的工作在这些架构的基础上,将监督转移到推理轨迹级别。我们不仅评估声明级输入,还为每条轨迹分配一个二元效用标签,指示其判定是否与黄金声明匹配。在方法一中,我们将这种轨迹级监督与子声明分解相结合,受先前工作的启发,类似的声明分解方法和自适应声明分解方法 [wanner2024closer] 已被证明可以提升LLM解决方案在涉及推理任务上的性能。

此外,先前的CheckThat! 团队已经表明,通过实现分词和数值/词汇特征,数值声明验证可以受益 [heil2025dsgt]。在方法二中,我们构建了一个特征驱动的模型,使用词级和字符级TF-IDF表示,并同时跟踪数值和时间上的重叠与不匹配。我们还受到Fraunhofer SIT方法的启发,使用多实例证据池化,将许多更小评分单元的支持积累起来,而不是仅仅依赖单个排名靠前的项目 [runewicz2025fraunhofer]。这启发了我们的分组轨迹排序架构,该架构在决定最终判定之前,测量分配给每种判定类型(真、假、冲突)的多条轨迹的支持度。

对于声明分解方法,我们采用了Wanner等人(2024)引入的框架 [wanner2024closer],他们研究了基于LLM的声明分解。他们的研究表明,将复杂声明分解为原子子声明可以提高下游事实验证的可靠性。重要的是,他们表明验证的有效性强烈依赖于分解的质量,从而激励在声明验证之前使用基于提示的分解作为预处理步骤。

## 3 方法

我们为CheckThat! 任务2探索了两种互补的方法。两种方法共享相同的核心监督原则,即每条推理轨迹被分配一个二元效用标签,指示其判定是否与黄金声明标签匹配。然而,两种方法在轨迹的采样和表示方式,以及最终声明级判定的构建方式上有所不同。方法一专注于使用LoRA微调LLM模型,集成子声明分解,并针对阿拉伯语文本纳入AraBERT编码器流。方法二使用轻量级基于TF-IDF的奖励模型来估计轨迹效用,然后通过对真、假、冲突三种判定组进行分组的轨迹效用排序来获得最终判定。

### 3.1 方法一:基于LLM的架构

方法一将推理轨迹排序视为一个二分类问题。我们还实验了声明分解和焦点损失。由于焦点损失降低了性能,我们在主要比较中省略了它。

#### 3.1.1 设计分类问题

训练数据经过一个数据管道,其中每个训练示例将一个声明与其一条推理轨迹结合起来。对于每个声明,最多采样六条轨迹,即大致两条与标签匹配,其余来自相反的判定类型(真、假或冲突),并允许少量未知判定以避免分布偏斜。训练目标变量设置为二元变量。如果推理轨迹的判定与声明的黄金标签匹配,则该轨迹被标记为1,否则为0。模型输入将声明文本和轨迹判定拼接起来。这种公式化创建了一个将建模转化为二分类任务的设置。模型微调使用LoRA在训练数据集上进行。

#### 3.1.2 子声明分解

我们还实验了子声明分解,即每个声明被分解为更小的子声明。一个常见的初始步骤,特别是在现实世界场景中给定的声明通常是自然出现的、往往较长的句子时,是将声明分解为更小的子声明,从而更容易单独验证每个子声明 [min-etal-2023-factscore, kamoi-etal-2023-wice, mitra-etal-2025-factlens]。

见图说明图1:声明分解:该架构包括以下步骤 – (i) 分解:原始声明被拆分为单个子声明。(ii) 蕴涵:每个子声明被单独分类。(iii) 聚合:通过投票进行。为了更好地处理包含多个事实断言的复杂声明,我们引入了一个基于LLM的声明分解步骤。在验证之前,每个声明被传递给一个指令微调的Llama-3.2-3B-Instruct模型,该模型被提示将原始声明分解为最多两个独立且简洁的子声明。如果一个声明不能有意义地拆分,模型返回原始声明不变。在训练期间,每个生成的子声明被视为一个额外的训练实例,同时保留原始的判定和理由。在推理期间,验证器对原始声明及其分解的子声明都进行评分,最终验证分数通过对这些分数进行平均(或加权平均)获得。这种分解使验证器能够单独评估每个事实组件,提高了对多方面声明的鲁棒性。

声明分解的LLM提示将以下声明分解为最多两个独立、简洁的子声明。仅返回一个编号列表(1. ..., 2. ...)。如果声明无法有意义地拆分,则将其作为第1项原样返回。声明:{声明文本}子声明:

#### 3.1.3 语言专用方法

为了处理任务的多语言性质,我们实验了单一的跨语言模型和针对阿拉伯语数据集的专用语言模型。对于跨语言设置,直接在英语数据上训练的模型被应用于阿拉伯语声明,无需任何语言特定的适配。对于语言专用设置,我们使用AraBERT [antoun2020arabert] 作为阿拉伯语声明的骨干编码器,AraBERT是一个基于BERT的模型,在大型阿拉伯语语料库上预训练。AraBERT在多项阿拉伯语NLP基准测试中展示了最先进的性能,在阿拉伯语特定任务上优于多语言BERT。我们比较了这两种设置,以检验专用的阿拉伯语编码器是否能为轨迹排序和判定预测子任务带来优于通用跨语言模型的显著收益。

### 3.2 方法二:基于分组奖励的轨迹排序

方法二使用分组的奖励轨迹排序架构,旨在检验一个可解释的轻量级验证器是否能在无需微调神经网络重排序器的情况下提供轨迹效用的信号。该流水线包括四个主要阶段。首先,每个声明被重构为轨迹级的训练行。其次,每条轨迹被分配一个二元效用标签,取决于其判定是否与黄金声明标签匹配。第三,使用轻量级基于TF-IDF的奖励模型来估

相似文章

LLM-as-a-Verifier:通用验证框架

Hugging Face Daily Papers

LLM-as-a-Verifier引入了一种概率验证框架,该框架从LLM的对数几率计算连续分数,并在粒度、重复评估和标准分解方面进行缩放。它在多个智能体基准测试上取得了最先进的结果,并为强化学习提供了密集反馈。