使用多模态语言模型检测社交媒体上的AI生成内容

arXiv cs.CL 论文

摘要

来自Meta和卡内基梅隆大学的这篇论文提出了一种多模态视觉-语言模型管道,用于检测社交媒体上的AI生成内容,实现了最先进的性能,并对用户参与度产生了积极的下游影响。

arXiv:2606.11200v1 公告类型: 新 摘要:生成式AI能够创建逼真的图像和视频,这些内容越来越多地在社交媒体上传播,常被用于垃圾信息、虚假信息、操纵和欺诈。现有的AI生成内容检测方法面临诸多挑战,包括对新一代生成模型的泛化能力差、依赖单一模态、缺乏可解释性的解释。我们提出了我们的管道,通过持续整理多样化的多模态社交媒体数据,并训练一个紧凑的视觉-语言模型进行检测和解释,来缓解这些问题。我们的模型在公共基准上实现了最先进的检测性能,并在多个平台的内部社交媒体数据集上展示了强大的检测和解释能力。我们在社交媒体平台上部署了我们的模型用于帖子推荐,并观察到了对用户参与度的积极下游影响,表明在动态、真实的社交媒体环境中进行有效的AI生成内容检测是可行的。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:34

# 使用多模态语言模型检测社交媒体上的AI生成内容

**来源:** https://arxiv.org/html/2606.11200

杨晨阳¹, 严深², 杨一波², 胡丽涛², 刘宇晨², 曾媛², 于汉超², 朱一南², Sumedha Singla², Brian Vanover², 钱慧君², 王子浩², 刘富军², Aashu Singh², 王建宇², 张学文²

¹卡内基梅隆大学, ²Meta

###### 摘要

生成式AI已能创建照片级真实的图像和视频,并日益在社交媒体上传播,常被用于垃圾信息、虚假信息、操纵和欺诈。现有的AI生成内容(AIGC)检测方法面临诸多挑战,包括对新生成模型的泛化能力差、依赖单一模态以及缺乏可解释性。我们提出了一套流程,通过持续整理来自社交媒体的多样化多模态数据,并训练一个紧凑的视觉语言模型用于检测和解释,从而缓解这些问题。我们的模型在公开基准上达到了最先进的检测性能,并在多个平台的内部社交媒体数据集上展现了强大的检测和解释能力。我们在社交媒体平台上部署了该模型用于帖子推荐,并观察到对用户参与度的积极下游影响,证明了在动态、真实的社交媒体环境中进行有效AIGC检测是可行的。

## 使用多模态语言模型检测社交媒体上的AI生成内容

杨晨阳¹*†††工作完成于Meta。, 严深², 杨一波², 胡丽涛², 刘宇晨², 曾媛², 于汉超², 朱一南², Sumedha Singla², Brian Vanover², 钱慧君², 王子浩², 刘富军², Aashu Singh², 王建宇², 张学文²

¹卡内基梅隆大学, ²Meta

## 1 引言

生成式AI日益能够创建高度逼真的图像和视频,并通过社交媒体传播 (Rombach et al., 2022; Brooks et al., 2024)。AI生成内容正被用于生成垃圾点击诱饵 (Forbes Technology Council, 2024)、制造和传播虚假信息 (Associated Press, 2024)、操纵和影响行为 (Tarsney, 2025),以及进行骚扰、诈骗和欺诈用户 (Wired, 2024)。这推动了大量关于AI生成内容(AIGC)检测的研究工作:已经开发了专门的模型来检测深度伪造 (Frank et al., 2020)、AI生成艺术 (Rahman et al., 2023),以及最近的照片级真实图像 (Yan et al., 2024)。然而,现有方法普遍存在三个问题:(1) 它们在静态数据集上训练,对较新模型生成的图像泛化能力差 (Epstein et al., 2023);(2) 它们仅依赖单一模态的信息进行检测(例如,Frank et al., 2020; Yan et al., 2024),无法利用社交媒体帖子中丰富的多模态信号;(3) 它们大多不提供人类可读的解释,使得其判断难以被人类理解。在这项工作中,我们分享了在Meta检测和解释含有AI生成内容的社交媒体帖子的方法,旨在缓解上述三个问题(第3节)。首先,我们开发了一个专门的数据整理流程,使我们能够持续从各种社交媒体平台整理新的高质量AIGC数据。其次,我们采用多模态基础模型的最新进展 (Grattafiori et al., 2024),并训练了一个小型但有效的视觉语言模型 (IFM-AIGCSpotter-3b),用于检测和解释含有AI生成内容的社交媒体帖子。我们通过两组实验评估了我们的方法:首先,我们在公共数据集上对我们的方法进行了基准测试(第4.1节),显示我们的模型达到了与其他开源模型相当的最先进性能。接下来,我们在一个内部数据集上评估了我们训练的模型(第4.2节),证明了我们的模型能够准确检测AI生成内容并提供有用的解释。我们进行了进一步的消融实验,并在社交媒体平台上部署了我们的模型用于帖子推荐。总体而言,我们证明了从大量、多样且不断演变的社交媒体帖子中有效检测AI生成内容是可能的。

## 2 相关工作

已有大量工作研究AI生成内容(AIGC)检测。早期方法利用低级空间或频率伪影 (McCloskey and Albright, 2018; Frank et al., 2020),而在GAN数据集上训练的轻量级CNN则捕捉生成器特定的线索 (Wang et al., 2020; Rossler et al., 2019)。扩散模型的兴起催生了新的检测器,包括CLIP-based方法,这些方法显示出更好的跨生成器泛化能力 (Cozzolino et al., 2024)。为应对快速演变的生成器,近期工作将检测视为连续学习问题,研究在线或连续自适应 (Epstein et al., 2023; Tassone et al., 2024)。

![图1:我们基于LLaVA的模型架构概述。我们的模型通过PerceptionEncoder将图像和视频处理成视觉令牌,这些令牌与语言令牌一起输入语言模型。](图1)

![图2:数据整理和后训练流程概述。模型使用Llama3.2-3B-Instruct (Grattafiori et al., 2024) 和 Perception Encoder (Bolya et al., 2025) 的预训练权重进行初始化。然后在三个整理的数据类别上进行后训练:(1) 来自Shutterstock和社交媒体的图像描述数据,包括人工注释的高质量描述;(2) 多任务微调数据,通过命名实体识别和标签生成等任务增强多模态理解;(3) AIGC微调数据,用于AI生成内容的检测和解释,通过启发式标注和持续自动收集进行整理。](图2)

##### 视觉语言模型。大型预训练VLM为AIGC检测提供了更强的多模态先验。先前的工作探索了在冻结的CLIP骨干网络上的线性探针或提示微调 (Ojha et al., 2023; Keita et al., 2024)、多模态LLM的上下文提示 (Jia et al., 2024; Ye et al., 2024),以及微调MLLM以推理视觉语义 (Liu et al., 2024; Wen et al., 2025b)。

##### 真实世界基准。近期数据集更好地反映了现实世界的分布偏移。MiRAGeNews (Huang et al., 2024) 将Midjourney图像与合成描述配对,揭示了在未见发布者上的弱点。Deepfake-Eval-2024 (Chandra et al., 2025) 和 BusterX++ (Wen et al., 2025a) 收集了最近的社交媒体假内容,导致最先进检测器的性能大幅下降。这些基准凸显了对多模态推理和持续自适应的需求。

##### 讨论。大多数现有检测器特定于特定生成器或仅依赖视觉伪影,而当前基准大多忽略了社交背景。我们的工作通过持续收集带有社交信号的图像-文本对,并训练一个统一的VLM来同时利用视觉和上下文线索,从而实现鲁棒、实时的AIGC检测,从而解决了这些局限性。

## 3 方法

在本节中,我们提供方法的详细描述。我们首先概述模型架构,然后介绍我们的数据整理流程及其相应的模型训练方案。

### 3.1 模型架构

我们遵循LLaVA (Liu et al., 2023) 的通用架构,这是一种广泛采用的视觉语言建模架构,例如用于Qwen2.5-VL (Bai et al., 2025) 和 InternVL-2.5 (Chen et al., 2024a)。LLaVA架构有三个主要组件:视觉编码器、语言模型和连接视觉编码器与语言模型的MLP投影层,如图1所示。

##### 实现。为确保高推理效率,我们选择一个小型模型 Llama3.2-3B-Instruct (Grattafiori et al., 2024) 作为语言模型。对于视觉编码器,我们选择 Perception Encoder (Bolya et al., 2025),参数量为300M,因为它相比其他视觉编码器展示了强大的零样本分类结果 (Bolya et al., 2025)。为提高推理效率,我们将图像裁剪为448×448分辨率,并采用自适应池化策略,每张图像生成总共256个输出视觉令牌。对于投影层,我们使用一个带有零权重初始化的单线性层。

### 3.2 数据整理

我们使用预训练权重初始化模型,并在广泛的整理图像-文本数据上训练模型。数据可分为三个部分,如图2所示:

- • **图像描述数据**:用于对齐图像-文本模态。
- • **多任务微调数据**:用于提高多模态内容理解能力。
- • **AIGC微调数据**:用于使模型适应下游AIGC检测和解释任务。

##### 图像描述数据。我们从三个来源收集了总计6000万+的图像描述数据:

- • **Shutterstock部分**:我们利用了Shutterstock数据集的一个大型子集,包含6000万张图像,经过严格清洗。第一轮数据清洗移除了低质量数据,包括非ASCII编码特征、重复词语、不完整句子等。然后我们使用Llama-3.2-90B为过滤后的数据生成详细描述,同时提供原始描述作为依据。
- • **社交媒体部分**:我们根据帖子参与度,从社交媒体平台的公开帖子中采样了1000万张图像和220万个视频。然后使用Llama4-Scout为这些图像生成描述。
- • **高质量社交媒体部分**:对于16.4万张社交媒体图像的一个子集,我们让人类首先注释描述,包括视觉细节、OCR和摘要。这些描述进一步由Llama4-Scout优化,然后由人类注释者审查和编辑。

##### 多任务微调数据。在此阶段,我们收集了各种下游任务的数据,这些任务能提高模型的多模态理解能力。我们包括命名实体识别、关键词生成、标签生成和流派分类等任务。我们从社交媒体部分采样了13万张图像,并使用Llama4-Maverik生成任务特定标签。注意,在此阶段,训练数据通常包含与AI生成内容相关的信号(例如,在生成的关键词或标签中),这为模型引导出一些初始知识,以便后续进行AIGC检测和解释。

##### AIGC微调数据。在最后阶段,我们收集了20万个样本用于AIGC微调。我们从社交媒体帖子中采样图像,并使用简单的启发式方法进行标注:如果帖子文本或评论中根据整理好的词汇表明确提及AIGC相关关键词(例如,“ai-generated”、“Midjourney”、“AI art”),或者前一阶段的多任务模型预测出AIGC相关的关键词或标签,则帖子被标注为AIGC;否则标注为非AIGC。我们通过使用嵌入对数据进行聚类,并在人工确认后保留顶部聚类,进一步清洗数据。结果得到3万个AIGC样本和17万个负样本,解释由Llama4-Maverik注释。此阶段持续运行,使得能够在新出现的AI生成内容上进行数据收集和模型重新训练。

### 3.3 后训练方案

我们的后训练流程包含三个阶段:

- • **阶段1(图像描述)**:这个初始阶段赋予我们的模型基本的图像理解能力。
- • **阶段2(多任务微调)**:此阶段提高模型的多模态内容理解能力,并帮助为最终阶段准备数据。
- • **阶段3(AIGC检测微调)**:这个最终阶段专门关注检测和解释AIGC的能力。

##### 阶段1(图像描述)。在第一阶段,我们的目标是通过对齐文本-图像模态来赋予模型基本的图像理解能力。我们首先冻结语言模型和视觉编码器,仅使用Shutterstock部分的图像描述数据训练MLP投影层。我们使用有效批量大小为2048,学习率为0.002,并使用带有200步预热的余弦调度器。然后我们解冻视觉编码器,在社交媒体部分上进行训练。最后,我们在小规模的高质量社交媒体部分上端到端训练模型。对于阶段1训练的最后两部分,我们分别使用有效批量大小为128和64,学习率为4e-5。

##### 阶段2(多任务微调)。第二阶段的目标是提高模型的多模态内容理解能力。我们在整理的多任务微调数据上对阶段1的模型进行微调。我们使用有效批量大小为256,学习率为4e-5,并使用Adam 8-bit进行优化。

##### 阶段3(AIGC检测微调)。最后阶段的目标是提高模型检测和解释含有AI生成内容帖子的能力。我们在整理的AIGC微调数据上执行标准的监督微调。在微调过程中,我们随机丢弃90%的文本信息,使得训练后的模型不仅依赖文本线索,还能从图像中的相关特征中学习。

##### 讨论。我们的训练流程产生了一个专门的模型 IFM-AIGCSpotter-3b,它能够很好地理解多模态社交媒体帖子。与现有的视觉语言模型 (Grattafiori et al., 2024; Bai et al., 2025) 不同,IFM-AIGCSpotter-3b 接触了社交媒体上发布的广泛图像,这提供了AIGC最新趋势的强烈信号,为检测和解释奠定了基础。

表1:各种模型在FakeClue和LOKI数据集上的性能比较。IFM-AIGCSpotte

相似文章

多模态大语言模型能否生成并检测多模态社交媒体假新闻?

arXiv cs.CL

EMNLP Findings 2026 的一篇论文提出了一种多智能体框架(包括文本、图像和批评者智能体),生成了 9,000 多条多模态假新闻帖子,并对 16 个开源和闭源多模态大语言模型进行了基准测试。结果发现这些模型的检测准确率尚达不到人类水平,尤其在判断图像真实性方面表现不佳。

AI生成的社交机器人内容的对抗性创建与检测

arXiv cs.CL

本文提出了一种对抗性方法,用于创建和检测AI生成的社交机器人内容,并整理了一个多语言、跨平台的人类与AI消息配对数据集。在这种对抗性数据上进行训练,能够在实际环境中显著超越现有的基于内容的机器人检测模型。

热门好莱坞电影的多模态叙事理解评估

arXiv cs.AI

本文介绍了一个新的多模态基准,用于评估AI模型对好莱坞电影的叙事理解,解决了版权问题,并表明视觉语言和音视频模型在该任务上的表现低于人类水平的准确性。