面向可泛化深度伪造视频检测的多智能体取证推理
摘要
本文介绍了 FaceVid-Forensics-100K,一个带有细粒度标注的大规模深度伪造视频数据集,并提出了一个多智能体取证推理框架(ARGUS),该框架使用四个专门的专家智能体和一个裁判智能体,在深度伪造检测上优于闭源模型。
查看缓存全文
缓存时间: 2026/08/10 18:16
论文页面 - 用于可泛化深度伪造视频检测的多智能体取证推理
Source: https://huggingface.co/papers/2608.06865
摘要
生成式人工智能被恶意用于制造高度逼真的深度伪造视频,引发了严重的伦理担忧,并对AI安全构成了重大挑战。然而,现有的深度伪造视频基准对近期合成方法的覆盖有限,且普遍缺乏可靠的细粒度文本标注。与此同时,传统检测器和多模态大语言模型(MLLMs)——无论是作为单一模型运行,还是依赖单一分析视角——往往难以捕捉细微的伪造痕迹,限制了它们对新兴AI生成方法的泛化能力。为解决这些局限,我们引入了FaceVid-Forensics-100K,这是一个大规模深度伪造视频数据集,包含100,000个视频,涵盖人脸交换、人脸重演和全脸合成等33种合成方法,包括Seedance 2.0等近期生成器。该数据集提供了视觉观察的细粒度文本标注和与判决一致的取证解释,这些内容通过由先进MLLMs驱动的多模型聚合与冲突消解流水线自动合成。基于该基准,我们提出了一种多智能体取证推理框架,采用四个专门的领域专家智能体,从纹理、光照、运动和物理四个角度独立分析伪造线索。然后,一个法官智能体协调它们的报告,生成最终预测及解释。在域外测试集上的大量评估表明,尽管我们的框架完全由小型开源MLLMs组成,但其性能优于包括闭源GPT和Gemini模型在内的所有方法,并在该基准的所有报告指标上排名第一。项目页面可在 https://xavierjiezou.github.io/ARGUS/ 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2608.06865) 查看 PDF (https://arxiv.org/pdf/2608.06865) 项目页面 (https://xavierjiezou.github.io/ARGUS) GitHub 0 (https://github.com/XavierJiezou/ARGUS) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06865)
在您的代理中获取此论文:
hf papers read 2608\.06865
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.06865,即可从本页面链接到它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.06865,即可从本页面链接到它。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.06865,即可从本页面链接到它。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接到它。
相似文章
Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning
This paper presents a unified global-to-local paradigm for video anomaly detection, introducing a training-free framework (GtS) and a tool-augmented agentic reasoning method with reinforcement learning, along with a new benchmark VAGU-T and metric JeAUG.
Video-DeepResearch:迈向下一代多模态深度研究智能体
Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。
基于多智能体协作推理与工具增强证据的城市区域画像
本文提出 UrbanAgent,一个将城市区域画像重新定义为基于推理的推断问题的智能体框架,利用多智能体协作推理和工具增强的证据检索。在全球城市数据集上的碳排放、GDP和人口估算任务中,该框架优于基线方法,R²平均提升8.1%。
VideoKR:面向知识和推理密集型视频理解
VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。
EMO-BOOST:情绪增强的视听特征提升深度伪造检测的泛化能力
本文提出Emo-Boost,一种多模态深度伪造检测框架,利用情绪线索(视听情绪识别)作为高层语义信号,提升对未见操纵类型的泛化能力,在FakeAVCeleb数据集上实现了平均AUC提升2.1%。