新主张还是似曾相识?重新思考多模态自动事实核查的'无污染'动态评估
摘要
本文研究了多模态自动事实核查中动态评估的污染风险,表明即使是截止日期后的声明也可能被污染,并且污染会显著夸大性能指标。
arXiv:2607.23514v1 公告类型:新
摘要:多模态自动事实核查(MAFC)通过检索和推理外部证据来验证声明。然而,大多数现有的静态基准存在污染风险:它们主要由过时的声明组成,这些声明无需外部证据即可使用LLM的内部知识进行验证。这可能导致性能评估膨胀,无法反映对需要最新信息的新声明的真实能力。为解决这一问题,新兴的动态基准收集LLM知识截止日期之后发布的声明,假设其未被污染。本文通过实证研究重新审视这一假设,考察了最先进的静态基准AVeriTeC和我们新构建的动态基准ClaimReview2025Q4中的污染风险,及其对MAFC评估的影响。我们的实验得出16项发现,突出三个关键结果:(1)动态评估减少了但并未消除污染风险,因为17.09%–29.30%的截止日期后声明仍可能被污染;(2)许多新发布的声明可以通过直接或综合截止日期前可用的多条公共知识来验证;(3)污染会导致MAFC性能出现统计上显著的膨胀,将Macro-F1提升多达11.34个百分点,并扭曲系统排名。基于这些发现,我们在严格污染控制的环境下重新评估了最先进的LLM。我们的研究为可信的MAFC评估提供了实用指南。
查看缓存全文
缓存时间: 2026/07/28 06:29
# 全新主张还是“似曾相识”?反思多模态自动事实核查的“无污染”动态评估 来源:https://arxiv.org/html/2607.23514 Haorui He(香港浸会大学互动媒体系,香港大学计算与数据科学学院) harryhe@connect\.hku\.hk (https://arxiv.org/html/2607.23514v1/mailto:[email protected]) Xinwen Chen(北京师范大学-香港浸会大学联合国际学院理工科技学院) xinwwwc@gmail\.com (https://arxiv.org/html/2607.23514v1/mailto:[email protected]) Dacheng Wen(香港浸会大学互动媒体系,香港大学计算与数据科学学院) wdacheng@connect\.hku\.hk (https://arxiv.org/html/2607.23514v1/mailto:[email protected]) Reynold Cheng(香港大学计算与数据科学学院) ckcheng@cs\.hku\.hk (https://arxiv.org/html/2607.23514v1/mailto:[email protected]) Francis C\. M\. Lau(香港大学计算与数据科学学院) fcmlau@cs\.hku\.hk (https://arxiv.org/html/2607.23514v1/mailto:[email protected]) Yupeng Li(香港浸会大学互动媒体系) ivanypli@gmail\.com (https://arxiv.org/html/2607.23514v1/mailto:[email protected]) \(2026\) ###### 摘要 多模态自动事实核查(MAFC)通过检索和推理外部证据来验证声明。然而,现有的大多数静态基准存在污染风险:它们主要由过时的声明组成,这些声明无需外部证据,仅凭大语言模型(LLM)的内部知识即可验证。这可能导致性能评估虚高,无法反映模型在需要最新信息的全新声明上的真实能力。为解决这一问题,新兴的动态基准开始收集在 LLM 知识截止日期之后发布的声明,假设这些声明是未被污染的。本研究重新审视了这一假设,通过实证研究考察了最先进(SOTA)的静态基准 AVeriTeC 和我们新建的动态基准 ClaimReview2025Q4 中的污染风险,以及它们对 MAFC 评估的影响。我们的实验得出 16 项发现,其中三个关键结果尤为突出:(1) 动态评估降低了污染风险,但并未完全消除——仍有 17.09%–29.30% 的截止日期后声明存在潜在污染;(2) 许多新发布的声明可以直接验证,或通过综合截止日期前已有的多条公开知识进行验证;(3) 污染可能导致 MAFC 性能出现统计上显著的虚增,Macro-F1 最高上升 11.34 个百分点,并扭曲模型排名。基于这些发现,我们在严格受控的无污染设置下重新评估了 SOTA LLM。本研究为可信的 MAFC 评估提供了实用指南。 多模态自动事实核查;动态评估 ††journalyear:2026††copyright:cc††conference:Proceedings of the 35th ACM International Conference on Multimedia; November 10–14, 2026; Rio de Janeiro, Brazil.††booktitle:Proceedings of the 35th ACM International Conference on Multimedia (MM ’26), November 10–14, 2026, Rio de Janeiro, Brazil††isbn:979-8-4007-2213-4/2026/11††doi:10.1145/3767308.3836298††ccs:Information systems Multimedia information systems††ccs:Computing methodologies Natural language processing ## 1. 引言 (多模态)错误信息的快速广泛传播构成了紧迫的社会挑战,仅靠专业人工事实核查员无法应对(Vlachos and Riedel, 2014 (https://arxiv.org/html/2607.23514#bib.bib11);Li et al., 2024 (https://arxiv.org/html/2607.23514#bib.bib21);Guo et al., 2022 (https://arxiv.org/html/2607.23514#bib.bib12);Akhtar et al., 2023 (https://arxiv.org/html/2607.23514#bib.bib32);Nan et al., 2021 (https://arxiv.org/html/2607.23514#bib.bib8)),这推动了自动化应对措施的发展。最先进的(SOTA)多模态自动事实核查(MAFC)系统,例如 DEFAME(Braun et al., 2025 (https://arxiv.org/html/2607.23514#bib.bib26)),利用强大的多模态大语言模型(LLM)从在线来源(如网络)检索并分析文本和/或视觉证据,以验证(值得核查的)声明¹¹具有重大公共利益并影响公众行为的值得核查声明(Konstantinovskiy et al., 2021 (https://arxiv.org/html/2607.23514#bib.bib27))。 MAFC 系统的评估依赖于基于专业机构发布的事实核查文章中的声明构建的基准。然而,这些基准(如 AVeriTeC (Schlichtkrull et al., 2024b (https://arxiv.org/html/2607.23514#bib.bib20))是*静态*的,在初始构建后不再更新。随着时间的推移,它们对过去事件声明的过时覆盖引入了*污染*风险:驱动 MAFC 系统的 LLM 主干在预训练期间已经见过这些事件及相关背景,因此可以仅凭参数化知识验证声明,从而规避了 MAFC 的核心挑战——检索和推理外部证据(Xiao et al., 2025 (https://arxiv.org/html/2607.23514#bib.bib18);Vlachos and Riedel, 2014 (https://arxiv.org/html/2607.23514#bib.bib11))。²²表4 (https://arxiv.org/html/2607.23514#S4.T4)提供了此类受污染声明的示例。如图1 (https://arxiv.org/html/2607.23514#S1.F1)所示,这种污染可能人为地高估 MAFC 性能,使其相对于在 LLM 训练数据之外(Xiao et al., 2025 (https://arxiv.org/html/2607.23514#bib.bib18);Vlachos and Riedel, 2014 (https://arxiv.org/html/2607.23514#bib.bib11))的及时新闻事件产生的真正全新声明上的真实能力虚高。为解决这一问题,最近的基准如 VERITAS (Rothermel et al., 2026 (https://arxiv.org/html/2607.23514#bib.bib35)) 和 XFACTA (Xiao et al., 2025 (https://arxiv.org/html/2607.23514#bib.bib18)) 采用了“*动态*”评估范式。它们持续收集在模型知识截止日期之后发布的声明,并定期(例如每月或每季度)刷新数据集,旨在保持评估数据未被见过,从而支持对 MAFC 系统的可靠评估。 Refer to caption图1. MAFC 中的污染概览及我们研究的研究问题(RQs)。 然而,仍有四个关键问题未得到解决。*第一,现有静态 MAFC 基准中的污染程度未知。*以往研究未直接量化这些基准的污染风险,使得评估其结果的可靠性变得困难。*第二,尚不清楚动态基准在多大程度上有效消除了污染风险。*在 LLM 知识截止日期之后发布的声明,仍可能通过截止日期前已有的信息进行验证,或涉及先前已被核查过的话题(Sheng et al., 2021 (https://arxiv.org/html/2607.23514#bib.bib25))。因此,一些看似“全新”的声明对于 LLM 而言可能实际上是*似曾相识*的。其结果是,动态基准仍可能高估 MAFC 在真正未见声明上的性能,从而破坏无污染评估的目标。这些在静态和动态基准中都存在的污染风险引出了*第三个*问题:*这种污染如何扭曲 MAFC 评估?*虽然 Rothermel 等人 (2026 (https://arxiv.org/html/2607.23514#bib.bib35)) 观察到在 LLM 知识截止日期后发布的声明上性能有所下降,但基于按这些日期分组声明的实证证据仍然混杂:Quelle and Bovet (2024 (https://arxiv.org/html/2607.23514#bib.bib41)) 报告没有突然下降,Fontana 等人 (2025 (https://arxiv.org/html/2607.23514#bib.bib42)) 发现仅真实声明出现下降。此外,时间性能变化可能源于与污染无关的因素,例如分布变化(Li et al., 2024 (https://arxiv.org/html/2607.23514#bib.bib21))或声明复杂度的变化(Team, 2025 (https://arxiv.org/html/2607.23514#bib.bib31);Wei et al., 2025 (https://arxiv.org/html/2607.23514#bib.bib4))。因此,在没有直接隔离并控制污染的情况下,尚不清楚现有基准得分在多大程度上被人为抬高。*最后*,鉴于现有基准中的污染风险及其可能扭曲评估的潜力,*SOTA LLM 的真实 MAFC 能力仍不明确。*如果没有严格排除可通过截止日期前知识验证的声明的基准,我们就无法评估模型在快速演变的真实媒体环境中对真正未见声明的泛化能力。 为了系统性地调查这些问题,本研究通过实证研究来解决以下研究问题(RQs)。 - •RQ1:现有静态和动态 MAFC 基准在多大程度上受到污染?为了回答 RQ1,我们采用了 AVeriTeC(Schlichtkrull et al., 2024b (https://arxiv.org/html/2607.23514#bib.bib20))中提出的成熟证据充分性评估流程来检测潜在污染。具体来说,我们测量了直接从 LLM 内部知识中提取的证据相对于同一声明的人工事实核查员使用的 oracle 证据的充分性,将高充分性的声明标记为潜在受污染。我们评估了六个 SOTA LLM,包括专有模型(如 GPT-5.2 和 Gemini-3.0-Pro)和开源模型(如 DeepSeek-V3.2 和 Qwen3.5-122B-A10B)。然后,我们将 SOTA 静态 MAFC 基准 AVeriTeC³³根据 Akhtar 等人 (2023 (https://arxiv.org/html/2607.23514#bib.bib32)) 的人工评估,AVeriTeC 中 28.68% 的声明包含多模态内容或需要多模态推理才能进行事实核查。与我们的新构建的基准 ClaimReview2025Q4 进行比较,该基准包含 2025 年第四季度发布的声明,以模拟截止日期后评估。如第4.1节 (https://arxiv.org/html/2607.23514#S4.SS1)所示,动态评估降低了污染,但并未消除:仍有 17.09%–29.30% 的声明存在潜在污染。 - •RQ2:动态基准中的污染是如何产生的?为了回答 RQ2,我们针对那些 oracle 事实核查文章发表于 LLM 知识截止日期之后,但 LLM 生成的文章与 oracle 文章仍具有高相似度的声明进行了案例研究。如第4.2节 (https://arxiv.org/html/2607.23514#S4.SS2)所示,这种污染之所以持续存在,是因为许多新发布的声明可以使用截止日期前已有的公开知识进行验证,无论是直接验证还是通过综合多个已知事实。 - •RQ3:污染如何影响 MAFC 性能评估?对于 RQ3,我们比较了六个 LLM 在受污染与未受污染声明子集上的 Accuracy 和 Macro-F1。如第4.3节 (https://arxiv.org/html/2607.23514#S4.SS3)所示,污染可显著高估 MAFC 性能,Macro-F1 最高提升 11.34 个百分点,甚至可能改变模型排名。进一步分析表明,污染使 LLM 能够实现更高的检索精度,从而绕开了对证据空间的探索。 - •RQ4:在污染受控的 MAFC 评估下,SOTA LLM 的表现如何?基于 RQ1–RQ3 的发现,我们在一个统一的污染受控集上重新评估了所有模型,该集合仅包含在所有三种相似度指标下对所有六个模型均未受污染的声明。如第4.4节 (https://arxiv.org/html/2607.23514#S4.SS4)所述,DeepSeek-V3.2 取得了最高的 Macro-F1 分数。然而,所有模型的 Macro-F1 得分均低于 56%,表明 MAFC 解决方案仍有很大的改进空间。 ## 2. 相关工作 自动事实核查(AFC)系统通过检索相关证据并预测裁决(如“支持”、“反驳”或“证据不足”,通常附带解释性理由)来验证值得核查的声明。⁴⁴这些裁决类别的定义见附录A (https://arxiv.org/html/2607.23514#A1)。大多数 AFC 系统是基于文本的(Guo et al., 2022 (https://arxiv.org/html/2607.23514#bib.bib12);Schlichtkrull et al., 2024b (https://arxiv.org/html/2607.23514#bib.bib20), a (https://arxiv.org/html/2607.23514#bib.bib1);He et al., 2026a (https://arxiv.org/html/2607.23514#bib.bib10), b (https://arxiv.org/html/2607.23514#bib.bib28);Yoon et al., 2024 (https://arxiv.org/html/2607.23514#bib.bib9);Luo et al., 2024 (https://arxiv.org/html/2607.23514#bib.bib39);Zhang et al., 2021 (https://arxiv.org/html/2607.23514#bib.bib3))。然而,多模态错误信息(将文本与图像或视频等其他模态相结合)已被证明更具误导性(Newman et al., 2012 (https://arxiv.org/html/2607.23514#bib.bib13);Hameleers et al., 2020 (https://arxiv.org/html/2607.23514#bib.bib14);Khaliq et al., 2024 (https://arxiv.org/html/2607.23514#bib.bib15);Qi et al., 2023 (https://arxiv.org/html/2607.23514#bib.bib2);Bu et al., 2024 (https://arxiv.org/html/2607.23514#bib.bib7);Zhang et al., 2025a (https://arxiv.org/html/2607.23514#bib.bib6))。因此,近年来越来越多的研究集中于通常基于多模态 LLM 构建的 MAFC 系统。例如,RAGAR(Khaliq et al., 2024 (https://arxiv.org/html/2607.23514#bib.bib15))利用 LLM 为图像生成文本描述以实现多模态理解,而 DEFAME(Braun et al., 2025 (https://arxiv.org/html/2607.23514#bib.bib26))则使用 LLM 动态选择工具来提取和推理文本及视觉证据。 大多数现有系统是在静态基准上进行评估的,例如 AVeriTeC (Schlichtkrull et al., 2024b (https://arxiv.org/html/2607.23514#bib.bib20))、MOCHEG (Yao et al., 2023 (https://arxiv.org/html/2607.23514#bib.bib16))、VERITE (Papadopoulos et al., 2024 (https://arxiv.org/html/2607.23514#bib.bib19)) 和 AVerImaTeC (Cao et al., 2025 (https://arxiv.org/html/2607.23514#bib.bib17))。如第1节 (https://arxiv.org/html/2607.23514#S1)所述,这些基准存在污染风险,可能损害评估结果的可靠性。为了解决这一问题,新兴的动态评估范式持续引入未见过的、带时间戳的数据,以增强鲁棒性并减轻此类污染风险(White et al., 2025 (https://arxiv.org/html/2607.23514#bib.bib34);Jain et al., 2025 (https://arxiv.org/html/2607.23514#bib.bib37);Zhang et al., 2025b (https://arxiv.org/html/2607.23514#bib.bib33))。例如,LiveBench (White et al., 2025 (https://arxiv.org/html/2607.23514#bib.bib34)) 自动从近期公开基准中获取涵盖推理、编程、数学和写作等多个领域的新问题,并每月更新其评估数据。对于 MAFC,目前存在两个动态基准:XFACTA (Xiao et al., 2025 (https://arxiv.org/html/2607.23514#bib.bib18))(已不再活跃维护,最后更新于 2025 年 8 月)和 VERITAS (Rothermel et al., 2026 (https://arxiv.org/html/2607.23514#bib.bib35)),后者是一个 SOTA 基准,从 108 个专业事实核查机构聚合真实世界声明,并通过全自动管道每季度更新。尽管如此,目前对于现有静态和动态 MAFC 基准的污染程度及其对评估结果的影响仍了解有限。在本研究中,我们利用 AVeriTeC 中的证据充分性评估流程来检测潜在污染。我们的分析(第4节 (https://arxiv.org/html/2607.23514#S4))表明,动态 MAFC 基准仍然容易受到污染,这可能会显著扭曲评估结果。为缓解这一问题,我们过滤掉潜在受污染的样本,以提供对 SOTA LLM 的污染受控评估。 与我们的工作最接近的是 Yoon 等人 (2025 (https://arxiv.org/html/2607.23514#bib.bib30)) 的研究,他们考察了污
相似文章
用于事实核查的多模态声明提取
研究人员提出了首个用于从社交媒体中进行多模态声明提取的基准,评估了最先进的多模态大语言模型,并引入了MICE——一个意图感知框架,在处理图文结合帖子中的修辞意图和上下文线索方面有所改进。
潜在事实核查:通过激活工程检测错误信息
本文介绍了一种基于激活工程的错误信息检测框架,将最后一个token的激活投影到LLM残差流中学习到的“虚假方向”上。研究在Gemma、Llama和Qwen模型上进行了事实核查基准评估,表明真实性在潜在空间中是线性可分的。
多大型语言模型基准测试的可证明联合去污
提出联合包络符合选择(JECS),一种用于多模型基准去污的符合程序,可证明地控制全局污染率,同时保持比基线更高的统计功效。
内存增强型LLM智能体中的状态污染
本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。
分解引发的上下文-记忆冲突:当事实核查流程与其源文本自相矛盾时
本文识别并描述了分解引发的上下文-记忆冲突(DI-CC),这是分解后验证流水线中的一种故障模式,其中分解会用模型的参数化信念替代源文本。作者表明它在机制上与经典的上下文-记忆冲突相关,SelfCheckGPT 无法检测到它,而上下文感知解码可以抑制它,但会引入严重的解析失败。