ThinkDeception: 一种可解释的多模态欺骗检测的渐进式强化学习框架
摘要
ThinkDeception提出了一种新颖框架,利用多模态大语言模型和带有思维链推理的渐进式强化学习策略进行可解释的欺骗检测,在标准基准上取得了最新的最优结果。
arXiv:2606.18988v1 Announce Type: new
摘要:多模态欺骗检测对于识别欺诈意图至关重要,然而现有方法主要依赖于端到端的黑盒范式。这些方法严重缺乏可解释性,无法提供透明的推理轨迹,也难以显式捕捉欺骗行为中固有的微妙跨模态不一致性。为了超越这些局限,我们提出了ThinkDeception,一种新颖且可解释的多模态欺骗检测框架。作为开创性工作,它将多模态大语言模型(MLLMs)引入该领域,将欺骗检测从传统的二分类任务转变为显式的认知推理过程。借助于首个精心标注的逐步多模态思维链(CoT)数据集,我们开发了一个基础模型ThinkDeception Base,实证验证了模态不一致性在解码欺骗中的关键作用。在此基础上,我们的核心创新在于提出了带有渐进训练策略的视觉-音频一致性组相对策略优化(VAC-GRPO)。与标准GRPO不同,我们将训练数据分层为四个渐进难度等级,引导模型经历心理上合理的从易到难的认知转变。通过将这一动态课程调度器与多维度的过程感知奖励机制以及反思学习范式创新性地结合,我们显著提升了模型的整体推理质量。在主流基准上的广泛实验表明,ThinkDeception达到了新的最优结果,在检测准确性和推理质量上均显著优于现有方法。最终,这项工作成功将欺骗检测领域推向可解释的、多模态的认知推理。
查看缓存全文
缓存时间: 2026/06/18 05:41
# ThinkDeception:面向可解释多模态欺骗检测的渐进式强化学习框架 来源:https://arxiv.org/html/2606.18988 ,Shan LiangShan\.Liang@xjtlu\.edu\.cn (https://arxiv.org/html/2606.18988v1/mailto:[email protected])西安交通大学-利物浦大学 苏州 中国, Yiqun Yue西安交通大学-利物浦大学 苏州 中国, Zhuhuayang Zhang西安交通大学-利物浦大学 苏州 中国, Tianqi Gao西安交通大学-利物浦大学 苏州 中国Tianqi\.Gao25@student\.xjtlu\.edu\.cn (https://arxiv.org/html/2606.18988v1/mailto:[email protected]) (2026) ###### 摘要。 多模态欺骗检测对于识别欺诈意图至关重要,然而现有方法主要依赖端到端的黑箱范式。这些方法严重缺乏可解释性——无法提供透明的推理轨迹,也难以明确捕捉欺骗行为中固有的细微跨模态不一致性。为了突破这些局限,我们提出了 ThinkDeception,一个新颖且可解释的多模态欺骗检测框架。作为一项开创性工作,它将多模态大语言模型(MLLMs)引入该领域,将欺骗检测从传统的二分类任务转变为显式的认知推理过程。借助首个精心标注的逐步多模态链式思考(CoT)数据集,我们开发了基础模型 ThinkDeception-Base,经验性地验证了模态不一致性在解码欺骗中的关键作用。在此基础之上,我们的核心创新在于提出了视觉-音频一致性组相对策略优化(VAC-GRPO),并配备渐进式训练策略。与标准 GRPO 不同,我们将训练数据分为四个渐进难度层级,引导模型经历基于心理学的“由易到难”认知过渡。通过将这种动态课程调度器与多维、过程感知的奖励机制及反思学习范式创新性地结合,我们显著提升了模型的整体推理质量。在主流基准上的大量实验表明,ThinkDeception 达到了新的最先进水平(SOTA),在检测准确率和推理质量上均显著优于现有方法。最终,这项工作成功推动了欺骗检测领域向可解释的多模态认知推理迈进。 欺骗检测, 多模态学习, 链式思考, 强化学习 ††版权:acm授权 ††期刊年份:2026 ††doi:XXXXXXX.XXXXXXX ††会议:请从版权确认邮件中填写正确的会议标题;2026年6月3-5日;纽约州伍德斯托克 ††isbn:978-1-4503-XXXX-X/2018/06 ††ccs:计算方法 场景理解 ## 1. 引言 尽管融合视觉和声学信息的多模态欺骗检测方法已取得显著进展,但它们仍受限于两个主要瓶颈 (Guo et al., 2024 (https://arxiv.org/html/2606.18988#bib.bib26)) (Zhu et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib29))。首先,由于数据收集和标注的高成本,现有数据集规模有限,导致模型容易局部过拟合,难以提取普遍适用的欺骗线索。其次,数据源场景(法庭、实验室环境)的多样性带来了显著的领域差异 (Cai et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib8)),加上模态之间的固有异质性,严重阻碍了多模态表示的学习和模型的跨域泛化能力。 随着多模态大语言模型(MLLMs)在视频理解等领域 (Li et al., 2024a (https://arxiv.org/html/2606.18988#bib.bib38)) (Liu et al., 2024 (https://arxiv.org/html/2606.18988#bib.bib39)) (Chen et al., 2024 (https://arxiv.org/html/2606.18988#bib.bib40)) (Li et al., 2024b (https://arxiv.org/html/2606.18988#bib.bib41)) (Rong et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib42)) (Wang et al., 2024 (https://arxiv.org/html/2606.18988#bib.bib43)) (Ye et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib44)) 的快速发展,我们开始思考一个问题:能否充分利用 MLLMs 的推理潜力,提出一种类似于人类认知的方法,逐步分析欺骗线索并最终做出判断?因此,我们首次探索了一种由强化学习(RL)赋能的可解释欺骗检测方法。在研究中,我们识别并解决了以下核心瓶颈: (1) 缺乏细粒度推理数据集:当前数据集 (Cai et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib8)) (Guo et al., 2023 (https://arxiv.org/html/2606.18988#bib.bib9)) (Pérez-Rosas et al., 2015 (https://arxiv.org/html/2606.18988#bib.bib6)) (Soldner et al., 2019 (https://arxiv.org/html/2606.18988#bib.bib7)) 大多局限于粗粒度的真实性标签或浅层特征偏移,严重缺乏用于监督推理过程所需的细粒度视觉和声学描述性标注。最关键的是,该领域仍然缺少能够直接指导 RL 模型进行链式思考(CoT)推理的高质量数据集。 (2) 逻辑推理能力不足:当前的 MLLMs 缺乏用于欺骗检测的系统性推理范式 (Yang et al., 2024 (https://arxiv.org/html/2606.18988#bib.bib48)) (Fang et al., 2026 (https://arxiv.org/html/2606.18988#bib.bib49))。它们难以对齐关键的多模态线索,包括视觉微表情和 AU 强度、声学音调和韵律波动,以及文本情感变化。 (3) 传统 RL 的迁移局限性 (Liu et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib46)) (Zhou et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib47)):虽然 RL 在视觉理解方面表现出色,但其直接应用于欺骗检测仍然非常有限。严格依赖最终分类准确率进行结果监督会创造稀疏的奖励环境,这常常在视听线索提取中引发事实性幻觉,严重损害推理链的可解释性和可靠性。 (4) 显著的异质性和领域偏移:现有数据集高度异质,包含自发的、高度微妙的欺骗行为。将 RL 直接应用于具有如此严重领域偏移的数据,常常使模型陷入局部最优或导致训练崩溃。 参见标题说明图 1。(A) 传统深度学习直接产生预测,没有可解释的过程。(B) 相反,我们的方法执行显式的逐步推理,提供透明的分析轨迹和最终结果。 为了应对上述挑战,我们提出 ThinkDeception,一种由强化学习(RL)增强的新颖多模态欺骗检测推理框架。首先,为了弥合推理数据的关键缺口,我们构建了 Deception-10K,一个基于开源数据的高质量多模态链式思考(CoT)数据集。我们设计了一个专门的标注流水线,提取文本、视觉和声学线索,并辅以细粒度的时间戳标注,以实现精确的视听对齐。其次,由于直接将 RL 策略应用于大模型常常面临收敛困难且无法捕捉核心线索,我们采用“先教后对齐”的范式。通过监督微调(SFT),我们训练 ThinkDeception-Base,使其初步获得逐步推理和跨模态不一致性验证的能力。这一阶段确保模型的推理过程与人类心理认知模型紧密对齐。最后,在 RL 阶段,我们引入课程学习 (Narvekar et al., 2020 (https://arxiv.org/html/2606.18988#bib.bib45)) (Zhao et al., 2026 (https://arxiv.org/html/2606.18988#bib.bib50)) 机制。通过将数据分为四个难度等级——真实、低级别、中级别和高级别欺骗——我们以渐进式由易到难的方式引导模型学习。在此过程中,除了基础的规则和格式奖励外,我们首创了一种细粒度的、步骤式的评估指标,遵循“观察-倾听-推理-回答”的认知顺序。通过为多模态推理链提供全面的奖励监督,我们最终确保了推理质量和预测准确性的双重优势。 ## 2. 相关工作 ### 2.1. 欺骗检测 最近,欺骗检测在单模态表示和多模态融合方面取得了显著进展。具体而言,捕捉细粒度声学特征 (Wang et al., 2026b (https://arxiv.org/html/2606.18988#bib.bib1)),分析视觉情绪和眼球运动 (Yang et al., 2020 (https://arxiv.org/html/2606.18988#bib.bib2)) (Foucher et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib3)),以及通过特征对齐和统一映射增强跨域泛化 (Xiang et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib5)) 极大地推动了该领域的发展。(Hu et al., 2024 (https://arxiv.org/html/2606.18988#bib.bib53)) 然而,当前的深度学习方法受限于其固有的黑箱特性 (Xiang et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib5)) (Lin et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib33)) (Li et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib34)),产生的预测缺乏可追溯且可验证的逻辑推理依据。因此,克服这一可解释性瓶颈,将范式从不透明的分类转向全流水线的透明推理,对于确保欺骗检测的可靠性和准确性至关重要。 ### 2.2. GRPO 与多模态推理 组相对策略优化(GRPO)(Shao et al., 2024 (https://arxiv.org/html/2606.18988#bib.bib19)) 通过组内相对分数估计优势值,显著降低了训练开销。DeepSeek-R1 (Guo et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib20)) 证明了基于稀疏规则的奖励可以激发涌现的链式思考(CoT)推理。然而,仅依赖结果奖励使得标准 GRPO 在多模态任务中容易产生“奖励黑客”现象,导致模型生成表面上流畅但与感知证据脱节的推理,从而损害 CoT 的可信度。为了解决这个问题,Vision-R1 (Huang et al., 2026 (https://arxiv.org/html/2606.18988#bib.bib21)) 和 Video-R1 (Feng et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib22)) 将 GRPO 扩展到视觉领域,展示了 RL 后训练的泛化优势。随后,像 GRPO-CARE (Chen et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib23))、Fact-R1 (Zhang et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib24)) 和 EmotionThinker (Wang et al., 2026a (https://arxiv.org/html/2606.18988#bib.bib25)) 等作品引入了过程感知奖励和渐进约束,部分缓解了优势信号崩溃问题,并为多模态推理提供了范例。虽然新兴工作已成功将 RL 驱动的 CoT 适应到自动驾驶 (ThinkDrive (Zhao et al., 2026 (https://arxiv.org/html/2606.18988#bib.bib50))) 和情感识别 (EmotionThinker (Wang et al., 2026a (https://arxiv.org/html/2606.18988#bib.bib25)), EMO-R3 (Yang et al., 2024 (https://arxiv.org/html/2606.18988#bib.bib48))) 等特定领域,但它们都在多模态特征之间合作一致的基本假设下运作。然而,欺骗检测本质上是一个由故意行为伪装驱动的对抗性认知过程。因此,为欺骗检测开发 GRPO 优化机制对于推动多模态大语言模型(MLLMs)中的欺骗推理至关重要。 ## 3. 方法 参见标题说明图 2。提出的 ThinkDeception 框架的整体流水线。它包含四个主要部分:(a) 数据集处理流水线;(b) 监督微调(SFT)阶段;(c) 强化学习阶段;(d) 渐进式训练策略,将数据集划分为四个不同的难度级别,以便实现由易到难的渐进课程;(e) 奖励与反思机制。 提出的 ThinkDeception 框架分三个关键阶段展开,如图 2 (https://arxiv.org/html/2606.18988#S3.F2) 所示。首先,我们构建 Deception-10K 数据集,该数据集提供基于细粒度视觉、声学和时间标注的逐步推理轨迹。随后,以 Qwen2.5-Omni-7B (Xu et al., 2025a (https://arxiv.org/html/2606.18988#bib.bib18)) 作为基础架构,我们应用监督微调(SFT)进行冷启动,生成具备初步演绎推理技能的 ThinkDeception-Base。最后,我们部署一种新颖的调度训练策略和反思式强化学习(RL)方法,以全面细化和优化模型的推理优化过程。 ### 3.1. Deception-10K 通过结合开源基准,包括 MDPE (Cai et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib8))、DOLOS (Guo et al., 2023 (https://arxiv.org/html/2606.18988#bib.bib9))、RLTD (Pérez-Rosas et al., 2015 (https://arxiv.org/html/2606.18988#bib.bib6)) 和 Box of Lies (Soldner et al., 2019 (https://arxiv.org/html/2606.18988#bib.bib7)),我们构建了首个细粒度视听链式思考(CoT)数据集。该数据集包含 10,000 个视频-推理对,总计约 50 小时,每个样本都包含逐步推理轨迹和精确的时间戳对齐标注。对于视觉特征提取,我们使用 OpenFace 3.0 (Hu et al., 2025 (https://arxiv.org/html/2606.18988#bib.bib10)),该模型在 Affect+ 数据集 (Fard et al., 2026 (https://arxiv.org/html/2606.18988#bib.bib32)) 上预训练,以系统提取面部动作单元(AUs)强度和八种基本情绪类别。在本工作中,我们不使用情绪标签,而是使用情绪概率分布来表示微妙和动态的变化。这一设计背后的核心动机是:情绪表达和欺骗线索的泄露都是高度连贯的时间过程。强制使用离散标签固有地会使模型忽略具有判别性的潜在情绪波动。相比之下,连续概率分布有效地保留了这些容易被忽视但至关重要的真实情绪变化。在声学特征方面,我们使用标准语音处理工具直接从原始音频信号中深度解耦和提取音高、语速和韵律。最终,这些细粒度的多模态线索作为条件提示,驱动 Qwen3-Omni-30B (Xu et al., 2025b (https://arxiv.org/html/2606.18988#bib.bib17)) 模型生成高质量的逐步推理过程。生成的推理链被严格标准化为“`”、“`”和“`”结构格式。为了减轻语言模型可能存在的固有偏差和事实性幻觉,所有生成的推理轨迹都经过专业心理学家的严格审查和评分。完整的流水线细节
相似文章
当大语言模型学会持续犯错:合成欺骗线性表示的多模型研究
本文通过微调五个Transformer模型的诚实与欺骗变体,研究大语言模型中的合成不诚实行为,发现鲁棒且域不变的不诚实表示可以通过适度的监督微调迅速固化,这对基于激活的监控具有重要意义。
DECOR:基于信息操纵理论审计LLM欺骗行为
介绍了DECOR,一个基于信息操纵理论的多智能体框架,用于细粒度审计LLM回应中的策略性欺骗,在15个前沿模型的欺骗检测基准测试中取得了最先进的性能。
解码推理型LLM中隐藏的欺骗:用于欺骗审计的激活解释器
提出了STATEWITNESS,一种用于审计推理型LLM中欺骗的激活解释器,相比现有监测器取得了显著改进,并提供了可供人工检查的证据。
在复杂隐藏角色游戏中评估大型语言模型
本文介绍了一个开源框架,用于评估大型语言模型在隐藏角色游戏《秘密希特勒》中的推理、说服和欺骗能力。研究发现,当前模型在持续的多轮操纵上表现不佳,而基于规则的智能体优于它们。
LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘
本文揭示了经过强化学习训练的多模态大型推理模型中的一个隐私漏洞:即使在最终答案中成功消除了敏感事实,模型仍可能在推理轨迹中重现这些事实。为此,本文提出LEMUR,一个无需训练、推理时运行的框架,利用熵动态来检测并抑制此类泄露。