R2VC: 基于检索、验证和置信校准的模块化事实核查
摘要
本文介绍了R2VC,一个模块化事实核查系统,结合了检索、验证和置信校准,以提高自动化事实核查的准确性和可靠性,在FEVER基准测试中实现了13.74%的准确率提升。
arXiv:2609.11955v1 公告类型:新
摘要:大型语言模型越来越多地用于自动化事实核查,但端到端的提示方法往往将证据检索、推理和不确定性估计纠缠在一起,使得故障难以诊断,置信度难以信任。我们提出了R2VC,一个模块化的检索、推理、验证、校准架构,用于基于证据的事实核查,支持引用和弃权。R2VC结合了基于Wikipedia的混合稀疏+密集检索、一个经过监督微调和DPO对齐的生成器以产生多样化的结构化判决候选、一个外部的NLI交叉编码器用于基于证据的候选选择,以及一个轻量级的序列级校准器用于置信度估计和选择性弃权。在FEVER上,使用8B骨干网络的R2VC比基线提高了13.74%的准确率。消融研究表明,基于验证器的候选选择和置信度校准是性能提升的最大贡献者。移除候选选择使FEVER准确率降至76.24%,而移除校准则使Brier分数几乎翻倍至0.161。对250个错误的手动分析进一步表明,检索失败,特别是错误实体的证据,仍然是主要瓶颈。总的来说,这些结果表明,模块化事实核查流程可以显著提高开放领域验证的预测准确性和置信度可靠性。
查看缓存全文
缓存时间: 2026/09/14 08:26
# R2VC:融合检索、验证与置信度校准的模块化事实核查系统
来源:https://arxiv.org/html/2609.11955
Dhruv Dixit(美国新泽西州霍博肯市史蒂文斯理工学院电气与计算机工程系)& Paritosh Pandey¹(美国北卡罗来纳州教堂山市北卡罗来纳大学计算机科学系)
###### 摘要
大语言模型正越来越多地应用于自动化事实核查,但端到端提示方法往往将证据检索、推理和不确定性估计交织在一起,导致故障难以诊断且置信度难以信任。本文提出R2VC——一种模块化的检索-推理-验证-校准架构,用于基于证据的事实核查,支持引用标注和选择性弃答。该系统结合了针对维基百科的混合稀疏+密集检索、经过有监督微调和DPO对齐的多样化结构化判决生成器、基于证据的NLI交叉编码器验证器,以及用于置信度估计和选择性弃答的轻量级序列级校准器。在FEVER基准测试中,采用8B参数模型作为骨干的R2VC实现了比基线系统高13.74%的准确率。消融实验表明,基于验证器的候选选择和置信度校准是性能提升的关键因素:移除候选选择使FEVER准确率降至76.24%,而移除校准则使布里尔分数近乎翻倍至0.161。对250个错误样本的深入分析进一步揭示,检索失败(尤其是错误实体证据)仍是主要瓶颈。这些结果共同表明,模块化事实核查流程能显著提升开放域验证的预测准确性和置信度可靠性。
## 1 引言
大语言模型(LLMs)正逐渐被用作端到端事实核查工具,但在证据不完整、嘈杂或具有对抗性时仍表现脆弱。单一前向传播过程混淆了检索、推理和校准环节,难以同时保证判决正确性和引用忠实性。我们的目标是将LLM转化为基于证据的事实核查系统,使其能够预测真值标签、返回最小充分引用,并提供校准后的正确概率,以实现基于维基百科基准的选择性预测和弃答。近期检索增强生成(RAG)系统表明,通过显式检索流程将生成过程锚定于外部证据,能显著提升知识密集型任务(包括事实核查)的性能(Glass等人,2022)。自然语言推理(NLI)模型在事实核查和溯源式流程中日益成为验证器,但其性能在从标准NLI基准转向自然声明与长篇嘈杂证据文档配对的场景时,可能因领域偏移而下降(Kamoi等人,2023)。
现有系统通过检索增强提示、自我修正或基于一致性聚合来缓解幻觉问题,但这些方法常将证据获取、判决生成和置信度估计耦合在LLM循环中,限制了可诊断性并导致弃答启发式方法校准不足。特别是,错误实体证据等检索失误可能产生高置信度的错误,而基于分歧的信号并未直接依据引用段落执行蕴含或矛盾关系判定。因此,我们提出R2VC——一种模块化的检索-推理-验证-校准流程。
我们的设计基于一个更广泛的观察:模块化验证流程因其使系统行为更可控、组件更易独立优化而持续受到关注(Besta等人,2024)。近期交互式验证框架同样强调,证据获取与验证是成本与延迟的主要驱动因素,因此在不同部署约束下独立调整、替换或配置这些模块具有实用价值(Xie等人,2025)。与此同时,紧密耦合的搜索-推理循环必须显式防范检索诱导的错误,这强化了在检索、生成与验证之间建立清晰接口的价值(Xu等人,2024)。我们在基于维基百科的事实验证任务上评估R2VC,使用VitaminC进行有监督训练,并报告在VitaminC和FEVER上的零样本及少样本(3样本)标签准确率。我们对比了移除SFT与DPO、基于验证器的选择、校准或弃答的组件消融实验,以及在统一评估协议下的非LLM与启发式基线。表1报告了多个LLM在FEVER和VitaminC上的标签准确率,并分析了250个标注错误以刻画主要失败模式。附录A.1总结了任务界面并提供了示例。
## 2 相关工作
##### 基准测试与溯源
*FEVER*(Thorne等人,2018)引入了基于句子级证据的大规模声明验证任务,*FEVEROUS*(Aly等人,2021)则扩展了此设定以包含表格证据。WICE(Kamoi等人,2023)将现实世界声明验证构建为基于维基百科声明及其引用来源的文档级蕴含任务,强调检索和长上下文证据选择仍是基于蕴含的验证器的关键瓶颈。我们的主要训练数据源为*VitaminC*,其提供从维基百科修订中挖掘的对比性声明-证据对(Schuster等人,2021)。我们还与溯源研究相关联:AIS形式化验证模型陈述是否可通过指定段落验证,并提出了自动溯源指标(Rashkin等人,2023)。
##### 检索增强事实核查
检索增强生成(RAG)将输出条件化于从维基百科等语料库中检索的段落(Lewis等人,2020)。Self-RAG紧密交织检索、生成与自我批判以提升事实性和引用准确性(Asai等人,2024)。RARR遵循“研究与修订”范式,使用检索到的证据编辑初始响应(Gao等人,2023)。Re2G(检索-重排序-生成)在RAG范式基础上增加了生成前的显式重排序阶段,构建多阶段流程以改善下游生成的证据选择(Glass等人,2022)。此外,Re2G使用重排序器合并具有不同评分函数(如BM25与密集检索)的检索器候选集,通过统一排名信号有效支持稀疏+密集集成。
##### 模块化流程与紧密耦合搜索循环
交互式搜索范式将查询规划与检索反馈交织,并引入显式机制(如基于置信度门控的验证/补全)以缓解检索证据误导模型的情况(Xu等人,2024)。代理式事实核查框架同样将检索与验证决策耦合,以减少不必要的搜索并提高效率(Xie等人,2025)。模块化事实核查流程在操作上仍具吸引力,因其能定位故障、支持清晰消融,并允许增量升级组件而无需端到端重新训练整个系统(Besta等人,2024)。
##### 一致性、校准与对齐
近期研究中,幻觉检测与置信度估计密切相关。基于一致性的方法(如SelfCheckGPT和ConFactCheck)将随机生成或跨模型生成间的分歧作为事实不可靠的信号,而校准研究表明神经模型常存在校准偏差,且温度缩放等事后修复方法在分布偏移下仍可能不稳定(Guo等人,2017;Desai和Durrett,2020)。尽管LLM有时能自我报告正确性,但此类估计的泛化可靠性不足(Kadavath等人,2022)。我们的方法融合了这些研究方向:采用多样本候选生成,但将每个候选锚定于检索证据,并使用外部NLI验证器而非仅依赖自我一致性进行选择。为支持弃答,我们基于验证器与生成特征训练了序列似然校准(SLC)模型,并通过有监督微调与直接偏好优化(DPO)实现对齐(Rafailov等人,2023)。这也与通过聚合提示改进推理的研究相契合(Arora等人,2022)。
图1:R2VC流程:检索→推理→验证→校准
## 3 方法论
##### 概述
R2VC(图1)将事实核查分解为四个阶段:混合检索、候选生成、外部验证与置信度校准。给定一个声明,系统从维基百科检索证据,生成多个结构化候选,通过基于NLI的验证器选择,并应用SLC生成校准后的置信度和弃答决策。算法伪代码见附录C。
VitaminC示例
声明:“《哈利·波特与火焰杯》电影于2005年上映。”
证据:“……《哈利·波特与火焰杯》是一部2005年上映的奇幻电影,由迈克·纽维尔执导……”
标签:支持
FEVER示例
声明:“电影《盗梦空间》由克里斯托弗·诺兰执导。”
证据:“《盗梦空间》是一部2010年上映的科幻动作片,由克里斯托弗·诺兰编剧并执导。”
标签:支持
图2:VitaminC与FEVER在标准化为共同声明-证据-标签格式后的示例
### 3.1 数据集
我们采用标准的基于维基百科的事实验证设定,使用VitaminC进行有监督训练,FEVER进行评估,并以大型英文维基百科快照作为检索语料库。VitaminC(Schuster等人,2021)是基于维基百科修订构建的对比基准,每个样本包含一个声明、单个证据句子以及{支持,反驳,信息不足}标签。许多样本配对差异极小的证据句子(一个支持声明,另一个反驳声明),使其适用于测试对细微事实差异的敏感性。我们使用公开的Hugging Face版本,并将其标准化为{claim, evidence_text, label}格式,将相关标签变体映射到统一的三元空间,并过滤空声明样本。最终数据集包含317,672个训练样本、54,012个验证样本和47,929个测试样本。图2展示了标准化后的示例,图F.1展示了声明与证据长度的联合分布。
FEVER(Thorne等人,2018)是大规模基于维基百科的事实验证基准,包含185,445个标记为支持、反驳或信息不足的声明,每个声明配对一个或多个证据句子。我们使用FEVER作为主要评估基准,并通过保留信息不足样本并将每个证据集通过启发式拼接扁平化为evidence_text字段,将其标准化为与VitaminC相同的三元格式。这在训练与评估数据间建立了统一表示,同时保持了任务语义。图2展示了FEVER示例,表1报告了多个LLM的完整结果。除标注数据集外,我们基于2023年11月的英文维基百科快照构建了大型检索语料库,将每个段落存储为独立文档,字段包括{doc_id, title, url, text},并使用Lucene/BM25和FAISS HNSW进行索引。该语料库包含数百万段落,大致对应完整英文维基百科文章集合,所有内容在推理时均可供检索器使用。
### 3.2 混合检索
我们使用维基百科证据语料库𝒟,其中每个检索单元是段落及其页面标题和URL的配对。设ℛₛ和ℛ_d分别表示稀疏和密集检索器。对于声明c,它们返回带评分列表Eₛ={(eⱼ, rₛⱼ)}ⱼ₌₁ᴺₛ和E_d={(eⱼ, r_dⱼ)}ⱼ₌₁ᴺ_d,其中rₛⱼ和r_dⱼ分别为证据项eⱼ的稀疏和密集检索分数。
我们对每个检索器的分数独立进行最小-最大归一化:
r̃ₘⱼ = (rₘⱼ - min_ℓ rₘ_ℓ) / (max_ℓ rₘ_ℓ - min_ℓ rₘ_ℓ + ε),m∈{s,d}
对于每个证据项e,我们计算融合检索分数r(e|c) = αr̃ₛ(e) + (1-α)r̃_d(e),其中α∈[0,1]为稀疏与密集检索的插值权重,缺失分数视为0。我们保留r(e|c)下分数最高的K项作为最终证据池ℰ(c)。
后续阶段仅在此融合证据池上操作,保持了推理效率同时为下游生成与验证保留了检索召回率。实现中,我们通过doc_id外连接融合结果、按检索器归一化分数,并合并段落字段以确保下游提示的鲁棒性;伪代码见附录C,检索器模型与超参数详见表G.1。
### 3.3 生成器训练:SFT与DPO
我们在VitaminC上对Llama-3.1-8B-Nemotron-Nano模型进行有监督微调(SFT)和基于DPO的偏好优化。训练提示模板见附录B。
##### SFT阶段
我们通过将此模板应用于标准化VitaminC数据集的所有分割构建SFT数据集,使用evidence_text字段作为单一证据来源。相似文章
面向检索增强生成输出的忠实性感知不确定性量化
本论文介绍了FRANQ方法,用于检测检索增强生成(RAG)系统中的幻觉问题。该方法应用不同的不确定性量化技术来区分事实性和对检索上下文的忠实性。作者构建了一个同时标注事实性和忠实性的新数据集,并证明FRANQ在多个数据集和大语言模型上的事实错误检测性能优于现有方法。
ReflectFact:用于提升多跳事实核查理解与推理能力的自反思智能体框架
ReflectFact是一个用于多跳事实核查的自反思智能体框架,通过推理路径规划、证据漂移核查和推理反思来解决客观性冲突与知识冲突,在HOVER和EX-FEVER上取得了最先进的结果。
基于证据链评估的校准式选择性事实核查
本文介绍了一种名为证据链评估(ECE)的选择性事实核查框架,该框架允许基于LLM的验证代理在证据薄弱、稀疏或不一致时放弃给出判断。在ECE-Bench上,ECE实现了93.7%覆盖率下的97.8%选择性准确率,展示了处理认知薄弱证据时面向安全性的权衡。
Regime-Conditional Verification: 用于调整和监控安全分类器的正确性估计
本文介绍了Regime-Conditional Verification (RCV),这是一个轻量级包装器,通过估计预测正确性并检测分布偏移,无需重新训练即可调整用于大型语言模型的现成安全分类器。
CheckRLM:检索增强推理中的有效知识-思维一致性检查
CheckRLM是一个利用检索增强生成来检测并纠正推理语言模型推理链中事实错误的框架,提升了连贯性并减少了错误累积。