我们能否抵御针对现实世界危机事件的AI生成视频攻击?对检测器、生成器和社会传播的系统性评估
摘要
本文介绍了RA-Bench,一个用于评估现实世界危机事件中AI生成视频检测的新基准,表明当前检测器无法泛化,并在社会传播过程中可靠性降低。
查看缓存全文
缓存时间: 2026/08/17 03:44
论文页面 - 我们能防御针对真实世界危机事件的AI生成视频攻击吗?:对检测器、生成器及社会传播的系统性评估
来源:https://huggingface.co/papers/2608.14391 发布于 8 月 14 日
#2 当日论文 (https://huggingface.co/papers/date/2026-08-17) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
一个用于AI生成视频检测的新基准测试揭示,当前的检测器无法泛化到现实的危机相关视频中,并且随着内容在社会中传播,其可靠性会下降。
最近的视频生成器可以制造出战争、灾难、公共紧急情况及其他真实世界危机的逼真描绘,从而带来巨大的虚假信息风险。然而,现有的基准测试在评估检测器和生成器在这些场景下的行为时证据有限,包括可检测性如何随生成条件变化、人们如何感知生成视频,以及检测器在社会传播期间是否仍保持可靠 (https://huggingface.co/papers?q=social%20dissemination)。为填补这一空白,我们引入了RA-Bench (https://huggingface.co/papers?q=RA-Bench),一个用于AI生成视频检测 (https://huggingface.co/papers?q=AI-generated%20video%20detection) 的基准测试,它使用真实视频作为锚点 (Anchors)。RA-Bench (https://huggingface.co/papers?q=RA-Bench) 包含 17,886 个视频,涵盖 10 个社会风险类别下的 1,830 个真实视频锚点,以及来自四个开源和五个闭源生成器的 16,056 个生成片段。
基于 RA-Bench (https://huggingface.co/papers?q=RA-Bench),我们从三个维度组织我们的评估。我们首先评估了七个传统检测器、三种审查设置下的十个零样本多模态模型 (https://huggingface.co/papers?q=zero-shot%20multimodal%20models) 以及两个专门针对AI生成视频检测 (https://huggingface.co/papers?q=AI-generated%20video%20detection) 微调的多模态大语言模型 (MLLMs) (https://huggingface.co/papers?q=MLLMs) 的检测器泛化能力 (https://huggingface.co/papers?q=detector%20generalization)。在这些方法中,三个检测器家族都无法在 RA-Bench (https://huggingface.co/papers?q=RA-Bench) 的所有实例上保持一致的泛化能力。
接着,我们考察了可检测性如何随生成质量、条件信息和采样种子而变化。这些分析表明,生成属性对不同检测器家族的影响不同,而源自生成源的检测模式在不同种子间保持稳定。
最后,我们研究了人类真实性判断和检测器在社会传播 (https://huggingface.co/papers?q=social%20dissemination) 期间的可靠性。我们发现,能够误导人类的视频对于当前检测器来说也同样难以检测,并且社会传播 (https://huggingface.co/papers?q=social%20dissemination) 会使检测变得更加困难。
这些发现共同表明,当前方法难以检测逼真的AI生成视频,凸显了需要能够应对不断演进的视频生成器的鲁棒检测器的必要性。
查看 arXiv 页面 (https://arxiv.org/abs/2608.14391) 查看 PDF (https://arxiv.org/pdf/2608.14391) 项目页面 (https://ra-bench-crisis-video.yxgma811120.chatgpt.site/) GitHub2 (https://github.com/24029100313/RA-Bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.14391)
在您的代理中获取此论文:
hf papers read 2608\.14391
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.14391 以从本页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.14391 以从本页面链接它。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.14391 以从本页面链接它。
包含此论文的集合 0
没有集合包含此论文
将此论文添加到集合 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
SynCred-Bench: AI生成视觉虚假信息中合成可信度的基准测试
介绍了SynCred-Bench,这是一个包含600张AI生成的虚假信息图像的基准测试,涵盖六种可信形式类别,表明现有检测器(包括MLLMs、开源AIGC检测器和商业API)表现不佳,人类标注者同样难以识别。
AI生成的社交机器人内容的对抗性创建与检测
本文提出了一种对抗性方法,用于创建和检测AI生成的社交机器人内容,并整理了一个多语言、跨平台的人类与AI消息配对数据集。在这种对抗性数据上进行训练,能够在实际环境中显著超越现有的基于内容的机器人检测模型。
WorldReasonBench:将视频生成器作为未来世界状态预测器进行人类对齐的压力测试
本文介绍了 WorldReasonBench 和 WorldRewardBench,这两个新基准旨在评估视频生成模型对世界状态演变和物理一致性的推理能力。研究突显了当前商业视频生成器在视觉合理性与真实逻辑推理之间存在的差距。
Artifact-Bench:评估多模态大语言模型在检测与评估AI生成视频伪影方面的能力
Artifact-Bench是一个综合性基准,用于评估多模态大语言模型在检测和分析AI生成视频伪影方面的表现,揭示了它们的显著局限性以及与人类感知的错位。
各类AI生成文本检测方法在面对释义攻击时的鲁棒性
本文研究了AI生成文本检测方法(微调后的RoBERTa、Binoculars、文本特征分析及其集成方法)在面对释义攻击时的鲁棒性。研究发现,包含Binoculars的集成方法效果最强,但在攻击中损失也最大,揭示了性能与鲁棒性之间的二分法。