口语对话中的上下文感知多模态声明验证

arXiv cs.CL 论文

摘要

本文介绍了MAD2,一个用于口语对话中多模态声明验证的新基准,并提出了音频和文本模型的校准融合,利用对话上下文来提高验证准确性。

arXiv:2606.11420v1 Announce Type: new 摘要:每天,数以百万计的听众从播客和直播中获取信息,而这些信息从未经过事实核查。口语错误信息是在对话中构建的,其可信度不仅取决于事实本身,还取决于声明在对话轮次中如何被构建、强化或未被质疑。然而,现有的事实核查工作主要集中在孤立的文本上,对对话音频的研究不足。我们提出了MAD2,一个用于口语声明验证的新多轮音频对话基准,包含1000个双人对话、3368个值得核查的声明以及约10小时的音频,并提出了上下文感知的音频编码器与对话感知的文本模型的校准多模态融合。在不同设置下,加入对话上下文可以提升验证效果,但提升幅度取决于场景类型。仅使用前文上下文通常能达到离线性能,这支持了实时审核场景;而当基于文本的模型因额外上下文而变得不稳定时,音频贡献最大。总体而言,对话结构对验证的影响大于错误信息框架。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:37

# 面向口语对话的上下文感知多模态主张验证

来源:https://arxiv.org/html/2606.11420
Delvin Ce Zhang2Dongwon Lee1 1美国宾夕法尼亚州立大学 2英国谢菲尔德大学 czc5884@psu\.edu, delvin\.ce\.zhang@sheffield\.ac\.uk, dongwon@psu\.edu

###### 摘要

每天,数百万人从播客和直播中获取主张,而这些主张从未经过事实核查。口语错误信息是在对话中构建的,其可信度不仅来自事实本身,更来自主张如何在对话轮次中被构建、强化或无人质疑。然而,现有事实核查主要关注孤立文本,对对话音频的研究不足。我们提出了 MAD2,这是一个面向口语主张验证的新型多轮音频对话基准,包含 1,000 个双人对话、3,368 个值得核查的主张以及约 10 小时的音频。我们还提出了一种校准后的多模态融合方法,结合了上下文感知的音频编码器和对话感知的文本模型。实验表明,添加对话上下文能提升验证效果,但其收益取决于场景类型。仅使用前序上下文通常能达到离线性能,这支持了实时审核设置。当基于转录的模型因额外上下文而变得不稳定时,音频贡献最大。总体而言,对话结构对验证的影响大于错误信息框架本身。

面向口语对话的上下文感知多模态主张验证

Chaewan Chun1、Delvin Ce Zhang2和 Dongwon Lee1
1美国宾夕法尼亚州立大学
2英国谢菲尔德大学
czc5884@psu\.edu, delvin\.ce\.zhang@sheffield\.ac\.uk, dongwon@psu\.edu

## 1 引言

每天,数百万人在播客中听到事实性主张,但这些主张大多从未进入事实核查流程。观众正日益转向音频平台获取新闻和信息 (Whittle 2024 (https://arxiv.org/html/2606.11420#bib.bib39)),然而大多数验证流程仍假定输入为书面文本 (Zhou et al. 2019 (https://arxiv.org/html/2606.11420#bib.bib34); Liu et al. 2020 (https://arxiv.org/html/2606.11420#bib.bib24))。在文本中,主张可以通过超链接关联到来源并交叉引用 (Zhao et al. 2020 (https://arxiv.org/html/2606.11420#bib.bib36); Zhang and Lee 2025 (https://arxiv.org/html/2606.11420#bib.bib35));而在播客和直播中,主张嵌入在多轮对话中,没有引用或归属,相关上下文可能分布在多个轮次中。现有的文本基准 (Thorne et al. 2018 (https://arxiv.org/html/2606.11420#bib.bib12); Wang 2017 (https://arxiv.org/html/2606.11420#bib.bib4); Gupta et al. 2022 (https://arxiv.org/html/2606.11420#bib.bib5)) 并未设计来捕捉这一特点,导致口语对话中的错误信息未被充分探索。

这个问题的难点在于,口语错误信息往往是通过互动*构建*出来的。一个孤立看似无害的陈述,可能因其在对话中被构建、强化或无人质疑的方式而变得具有误导性。主张周围的对话上下文——前序交流、认同、反驳和阐述——可能包含验证所需的信息,而这些信息在孤立评估主张时是缺失的。先前关于对话事实核查的工作侧重于改进证据检索流程以更好地利用文本对话上下文 (Gupta et al. 2022 (https://arxiv.org/html/2606.11420#bib.bib5); Chamoun et al. 2023 (https://arxiv.org/html/2606.11420#bib.bib7)),但并未检验口语信号本身是否携带与真实性相关的信息。这留下了一个基本的实证问题:音频是否在转录之外提供了额外的贡献?以及在何种上下文条件下,对话上下文才有帮助?

脚本:确实如此。这对县预算来说是个真正的问题。我的意思是,在某个时候,你不得不问这是否真的……

ASR:县预算的真正问题我在某个时候你不得不问这是否真的……

0 秒 38 38 秒 21.96 21.96 秒 – 29.73 29.73 秒

图1:MAD2 中精确主张-音频对齐示例,使用 WhisperX (Bain et al. 2023 (https://arxiv.org/html/2606.11420#bib.bib3)) 词级时间戳将值得核查的主张链接到其语音片段。

回答这个问题一直受到两个差距的阻碍。首先,没有基准能够在规模化上将逼真的对话音频与细粒度的主张真实性标注结合起来。早期关于政治辩论 (Kopev et al. 2019 (https://arxiv.org/html/2606.11420#bib.bib9)) 和音频值得核查性检测 (Ivanov et al. 2023 (https://arxiv.org/html/2606.11420#bib.bib15)) 的工作表明,声学特征可以补充文本进行事实性预测,但操作的是独白式辩论语音,而非自然对话音频。现有的直播音频事实核查系统 (Venktesh and Setty 2025 (https://arxiv.org/html/2606.11420#bib.bib6)) 对广播式流进行处理,所有验证都通过自动语音识别 (ASR) 得到的转录本输入到基于文本的自然语言推理 (NLI) 流程中,既没有使用声学特征,也没有对对话上下文建模。在多模态方面,文本-图像验证已有成熟的基准生态系统 (Yao et al. 2023 (https://arxiv.org/html/2606.11420#bib.bib25); Hu et al. 2023 (https://arxiv.org/html/2606.11420#bib.bib26)),但对于对话环境中的口语主张,尚无等效的工作。其次,尚未有系统性研究探讨对话上下文如何影响跨模态的验证——上下文对音频和文本的帮助是否相同,两种模态是否捕捉到对话信号的不同方面,以及每种模态从更多对话上下文中获益的程度。没有这一点,我们无法知道音频和文本是互补、冗余还是各自提取对话上下文的特定方面。

为填补这两个差距,我们提出了 MAD2,一个合成式的多轮音频对话基准,包含 1,000 个双人对话(8,192 个句子;3,368 个值得核查的主张)以及约 10 小时的音频。MAD2 扩展了 MAD (Chun et al. 2025 (https://arxiv.org/html/2606.11420#bib.bib1)),增加了原有基准所缺乏的两个能力:通过 MoonCast (Ju et al. 2025 (https://arxiv.org/html/2606.11420#bib.bib2)) 实现更高保真度的音频合成,以及通过 WhisperX (Bain et al. 2023 (https://arxiv.org/html/2606.11420#bib.bib3)) 词级时间戳实现精确的主张到音频对齐(图1 (https://arxiv.org/html/2606.11420#S1.F1))。我们还提出了一种校准后的条件式上下文感知音频和文本编码器融合方法。

使用 MAD2,我们系统地评估了在匹配的基于句子的上下文窗口中,对话上下文如何影响纯文本、纯音频和融合模型的验证效果。我们聚焦于三个问题:(i)随着上下文扩展,验证效果如何变化;(ii)仅用过去上下文是否能匹配完整对话上下文的性能;(iii)音频在何时提供超越 ASR 转录的补充信号。我们的贡献是:(1)MAD2,一个口语对话主张验证基准,配备有配对的音频、ASR 转录和主张到音频的对齐;(2)一种校准后的条件融合方法,以及分析表明音频不是统一的加性提升,而是一个*选择性*的纠正信号,在仅靠转录的验证因噪声上下文而不稳定时恰好提供帮助;(3)一个受控评估协议,在匹配的基于句子的窗口下,系统性地改变纯文本、纯音频和融合模型中的对话上下文。源代码和 MAD2 基准将在发表后发布。

## 2 相关工作

大多数事实核查研究处理书面主张,并有 FEVER (Thorne et al. 2018 (https://arxiv.org/html/2606.11420#bib.bib12))、LIAR (Wang 2017 (https://arxiv.org/html/2606.11420#bib.bib4)) 和 DialFact (Gupta et al. 2022 (https://arxiv.org/html/2606.11420#bib.bib5)) 等基准支持。对话方面的工作则调整证据检索流程以利用文本上下文 (Gupta et al. 2022 (https://arxiv.org/html/2606.11420#bib.bib5); Chamoun et al. 2023 (https://arxiv.org/html/2606.11420#bib.bib7))。我们从这类资源(LIAR)继承了真实性标签,但在模态上有所不同:我们的任务是从对话*音频*中验证主张,其中声学线索、不流畅、时机和韵律都是可用的,但在仅基于转录的流程中却是缺失的。

关于口语错误信息的研究相对有限。对政治辩论和音频值得核查性的研究表明,语音可以携带有用信号 (Kopev et al. 2019 (https://arxiv.org/html/2606.11420#bib.bib9); Ivanov et al. 2023 (https://arxiv.org/html/2606.11420#bib.bib15)),近期也有系统在流式设置中验证口语主张 (Venktesh and Setty 2025 (https://arxiv.org/html/2606.11420#bib.bib6))。与音频值得核查性工作(决定一个片段是否*值得*核查)不同,我们的任务预测双人对话中主张的真实性,并系统测试周围对话上下文如何影响它;而与完全通过 ASR 文本进行验证的实时系统不同,我们直接对声学信号建模。大型播客语料库提供了丰富的音频-文本数据 (Clifton et al. 2020 (https://arxiv.org/html/2606.11420#bib.bib13); Litterer et al. 2025 (https://arxiv.org/html/2606.11420#bib.bib14)),但缺少主张级值得核查性标签、真实性标注和对齐的主张片段,使其不适合此类评估。最后,多模态事实核查在文本-图像设置中已成熟 (Yao et al. 2023 (https://arxiv.org/html/2606.11420#bib.bib25); Hu et al. 2023 (https://arxiv.org/html/2606.11420#bib.bib26)),但口语对话仍未充分探索。MAD2 通过与对话音频配对的对话级真实性标注和对齐的转录片段填补了这一空白,使得能够在受控条件下评估音频、文本和对话上下文在口语主张验证中的作用。

表1:从 MAD 到 MAD2 的关键扩展。
## 3 数据集创建:MAD2

MAD2 是一个合成式的英语基准,包含双人对话,具有细粒度的主张级真实性标注和高保真度的对话音频。我们采用合成构建流程,因为获取与长格式播客音频对齐的专家真实性标签成本过高,且受控流程使我们能够改变关键的错误信息因素,例如主张如何进入对话以及说话者如何回应。我们基于先前工作 MAD (Chun et al. 2025 (https://arxiv.org/html/2606.11420#bib.bib1)) 的构建流程,并进行了显著扩展,如表1 (https://arxiv.org/html/2606.11420#S2.T1) 总结。

每个对话通过将 Gemini 2.5 Pro (Team 2025 (https://arxiv.org/html/2606.11420#bib.bib32)) 条件化在来自 LIAR (Wang 2017 (https://arxiv.org/html/2606.11420#bib.bib4)) 基准的人工事实核查政治主张上生成,并直接继承其真/假标签。我们采样 1,000 个主张(500 真,500 假),每个主张生成一个双人对话脚本,条件化为虚构的说话者档案、一种传播风格和一种对话场景。*传播风格*捕捉主张如何进入对话(*后果性叙事*、*随意谣言传播*、*讽刺性驳回*),*对话场景*定义互动动态(*协作认同*、*协作怀疑*、*经典辩论*、*说服者与质疑者*、*未解决的争论*)。每个句子都标有二元值得核查性标签。使用 ChatGPT (OpenAI 2024 (https://arxiv.org/html/2606.11420#bib.bib33)) 进行自动质量控制,筛选每个对话的连贯性和与种子主张的一致性。MAD2 包含 1,000 个对话(8,192 个句子;3,368 个值得核查的主张:1,516 真 / 1,852 假),约 10 小时音频(平均每个对话 36 秒)。

音频生成。MAD 使用 XTTS-v2111https://huggingface.co/coqui/XTTS-v2,产生平淡、单调的合成语音。MAD2 改用 MoonCast (Ju et al. 2025 (https://arxiv.org/html/2606.11420#bib.bib2)),一个双人播客合成模型,能产生自然的韵律、更丰富的对话流程和逼真的不流畅。Ju et al. (2025 (https://arxiv.org/html/2606.11420#bib.bib2)) 报告 MoonCast 在自发性上比基于拼接的文本转语音 (TTS) 高 +0.68 +0.68,在连贯性上高 +0.62 +0.62,词错误率为 1.81% (Ju et al. 2025 (https://arxiv.org/html/2606.11420#bib.bib2)),使我们的音频更接近真实播客条件。

转录对齐。MAD2 提供带有词级时间戳的 WhisperX (Bain et al. 2023 (https://arxiv.org/html/2606.11420#bib.bib3)) 转录。由于 ASR 输出不保留句子级标签,我们将每个转录与生成的脚本对齐,以恢复值得核查性标注和时间戳主张片段;低置信度对齐会被标记进行人工审查。这些 ASR 转录在实验中用作文本输入,模拟自动且不完美获得转录的真实条件。为量化转录噪声,我们将 WhisperX 转录与生成脚本比较,观察到句子、对话和语料库级别的非零 WER:分别为 11.3%、11.6% 和 11.9%。因此,纯文本和融合模型操作在不完美的 ASR 派生转录上,而非金标准脚本。

主张级口语实例。尽管脚本生成协议遵循 MAD (Chun et al. 2025 (https://arxiv.org/html/2606.11420#bib.bib1)),MAD2 将每个值得核查的脚本句子转换为带时间戳的口语主张实例。每个对齐示例将一个值得核查的句子与其说话者、轮次位置、ASR 转录、真实性标签、场景类型、传播风格和波形中的开始-结束时间跨度关联起来。这种表示方式使得匹配的多模态评估成为可能:文本模型接收带有目标主张标记的 ASR 句子窗口,而音频模型接收跨越相同句子窗口的波形裁剪,并保留主张的相对时间戳用于主张感知池化。因此,纯文本、纯音频和融合模型之间的差异反映了模态和上下文的使用,而非输入范围不匹配。

## 4 方法

给定一个对话和一个与其在音频中的位置和时间戳跨度对齐的候选主张句子,任务是预测一个二元真实性标签 y ∈ {0,1} y ∈ {0,1} (1 = 真,0 = 假)。我们开发了三种模型变体(纯音频、纯文本和融合),均使用交叉熵损失训练;最佳检查点由验证 AUC 确定,决策阈值在验证数据上通过 F1 分数调整 (Zeng and Gao 2023 (https://arxiv.org/html/2606.11420#bib.bib40)),并应用于测试数据,不再进一步调整。

### 4.1 上下文配置

我们使用每个主张周围基于句子窗口的邻域来改变对话上下文的范围和方向。对话按轮次和位置分割为有序句子。对于位置 i 的主张,我们选择每侧最多 N 个相邻句子的窗口,保留说话者轮次结构。这里,N 索引相邻句子而非说话者轮次,因此即使像 N=2 这样的小窗口,当主张靠近轮次边界时,也可以包含相邻的跨说话者上下文。所有三种模型变体均操作在*相同*的句子窗口上,从而实现跨模态的公平比较。

(1) 仅主张 (N=0): 仅主张句子本身,模仿传统的事实核查设置 (Liu et al. 2020 (https://arxiv.org/html/2606.11420#bib.bib24)),其中主张被孤立验证。

(2) 实时 (-N): 仅前序 N 个句子窗口。

相似文章

用于事实核查的多模态声明提取

arXiv cs.CL

研究人员提出了首个用于从社交媒体中进行多模态声明提取的基准,评估了最先进的多模态大语言模型,并引入了MICE——一个意图感知框架,在处理图文结合帖子中的修辞意图和上下文线索方面有所改进。

当视觉为声音代言

Hugging Face Daily Papers

本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。