轻量级风格一致性分析:用于多媒体内容审核的大语言模型生成文本鲁棒性检测
摘要
提出了 LiSCP,一种轻量级的风格一致性分析方法,旨在鲁棒性地检测大语言模型(LLM)生成的文本内容,重点关注在对抗性操纵下特征的稳定性。在域内和跨域检测中取得了优异的性能,并具有显著的鲁棒性。
arXiv:2605.05950v1 公告类型:新增
摘要:随着大语言模型(LLM)在内容创作中的日益普及,区分人类撰写的文本内容与 LLM 生成的文本内容已成为多媒体内容审核中的一项关键任务。现有的检测器通常依赖统计线索或特定于模型的启发式规则,使其容易受到改写和对抗性操纵的影响,从而限制了其鲁棒性和可解释性。在这项工作中,我们提出了 LiSCP,一种新颖的轻量级风格一致性分析方法,用于鲁棒性地检测 LLM 生成的文本内容,重点关注在对抗性操纵下特征的稳定性。我们的方法构建了一个一致性特征分布,将离散的风格特征与连续的语义信号相结合,利用多模态引导的改写文本变体中的风格稳定性。在真实世界的多媒体新闻、电影数据集以及传统文本领域的广泛实验表明,LiSCP 在域内检测中取得了卓越的性能,在跨域设置下比现有方法高出多达 11.79%。此外,它在对抗性场景下(包括对抗性攻击和混合人机生成环境)也展现了显著的鲁棒性。
查看缓存全文
缓存时间: 2026/05/08 06:49
# 轻量级风格一致性轮廓分析:面向多模态审核的大语言模型生成文本内容的鲁棒检测 来源: https://arxiv.org/html/2605.05950 李思源, 吴奥都, 王林海 上海交通大学计算机科学与技术学院, 上海, 中国 [email protected] (https://arxiv.org/html/2605.05950v1/mailto:[email protected]) 林曦 上海交通大学计算机科学与技术学院, 上海, 中国 [email protected] (https://arxiv.org/html/2605.05950v1/mailto:[email protected]) 袁锡斌 上海交通大学计算机科学与技术学院, 上海, 中国 [email protected] (https://arxiv.org/html/2605.05950v1/mailto:[email protected]) 毛清华 上海交通大学计算机科学与技术学院, 上海, 中国 [email protected] (https://arxiv.org/html/2605.05950v1/mailto:[email protected]) 李广言 中国科学院自动化研究所, 北京, 中国 [email protected] (https://arxiv.org/html/2605.05950v1/mailto:[email protected]) 陈翔 浙江大学计算机科学与技术学院, 杭州, 中国 [email protected] (https://arxiv.org/html/2605.05950v1/mailto:[email protected]) 吴军 上海交通大学计算机科学与技术学院, 上海, 中国 [email protected] (https://arxiv.org/html/2605.05950v1/mailto:[email protected]) 李建华 上海交通大学计算机科学与技术学院, 上海, 中国 [email protected] (https://arxiv.org/html/2605.05950v1/mailto:[email protected]) (2026) ###### 摘要 大型语言模型(LLMs)在内容创作中的日益普及,使得区分人工撰写文本与 LLM 生成文本成为多模态审核中的关键任务。现有的检测器通常依赖统计线索或特定于模型的启发式方法,使其容易受到改写和对抗性操纵的影响,从而限制了其鲁棒性和可解释性。在本工作中,我们提出了 **LiSCP**,一种新颖的轻量级风格一致性轮廓分析方法,用于鲁棒地检测 LLM 生成的文本内容,重点关注对抗性操纵下的特征稳定性。我们的方法构建了一个一致性轮廓,将离散的风格特征与连续的语义信号相结合,利用在多模态引导的改写文本变体中的风格稳定性。跨越真实世界多模态新闻和电影数据集以及传统文本领域的实验表明,LiSCP 在域内检测中取得了优越的性能,并在跨域设置中比现有方法高出多达 11.79%。此外,它在对抗性场景(包括对抗性攻击和混合人机设置)下表现出显著的鲁棒性。 **关键词:** LLM 生成内容检测,多模态内容审核,风格一致性轮廓分析 ††copyright:none††journalyear:2026††conference:第 34 届 ACM 国际多媒体会议;2026 年 11 月 10-14 日;巴西里约热内卢††ccs:计算方法论 人工智能††ccs:计算方法论 机器学习 ## 1. 引言 大型语言模型(LLMs)已成为开放域内容创作的默认工具,能够在新闻报道、产品评论、学术论文、技术文档甚至多模态关联文本内容(例如,图像字幕、视频字幕和多模态平台评论)等多个领域实现高质量生成 (Dubey et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib55); Chen et al., 2026 (https://arxiv.org/html/2605.05950#bib.bib11); Su et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib10); Hurst et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib56); Li et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib9); Xu et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib59))。这些模型广泛应用于日常工具和专业工作流中,日益模糊了人工撰写与机器生成文本内容之间的界限,引发了关于内容真实性、归属权和问责制的严重担忧,这在文本经常与视觉或听觉模态交互的多模态内容审核场景中尤为突出 (Sadasivan et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib27); Wu et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib52); Yu et al., 2025b (https://arxiv.org/html/2605.05950#bib.bib53); Li et al., 2026b (https://arxiv.org/html/2605.05950#bib.bib12); Arevalo et al., 2017 (https://arxiv.org/html/2605.05950#bib.bib47); Nguyen et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib57))。因此,可靠地检测 LLM 生成的文本内容对于学术诚信执行、高风险决策审计、维持数字通信信任以及确保多模态内容的可信度等应用至关重要 (Li et al., 2025b (https://arxiv.org/html/2605.05950#bib.bib48); Cao, 2025 (https://arxiv.org/html/2605.05950#bib.bib58))。 尽管取得了显著进展,但在现实条件下——特别是在多模态衍生场景中——的鲁棒检测仍然是一个未解决的挑战。当前的检测器通常依赖令牌级统计量(例如,基于似然或排名的特征)或特定于模型的启发式方法 (Hans et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib17); Gehrmann et al., 2019 (https://arxiv.org/html/2605.05950#bib.bib3); Li et al., 2026a (https://arxiv.org/html/2605.05950#bib.bib60); Koike et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib49); Abdelnabi and Fritz, 2021 (https://arxiv.org/html/2605.05950#bib.bib36); Kirchenbauer et al., 2023 (https://arxiv.org/html/2605.05950#bib.bib37)),当生成模型发生变化、领域偏移、文本经过后期编辑或文本内容经过调整以配合伴随的视觉元素(例如,为传播虚假信息而编辑的图像字幕)时,这些方法往往效果下降 (Chen and Wang, 2025 (https://arxiv.org/html/2605.05950#bib.bib14); Chen et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib51); Zhou et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib54); Guo et al., 2023 (https://arxiv.org/html/2605.05950#bib.bib61); Krishna et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib35))。虽然最近基于改写或重新查询的方法减少了对监督的需求,但它们通常仅将改写视为分数聚合的一种手段,并且与特定模型或提示策略紧密耦合。这导致在分布偏移、风格变化、混合人机创作或多模态上下文变化(例如,文本在不相关的图像之间重用)下表现不可预测 (Lei et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib13); Bao et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib32); Zhang et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib33))。此外,大多数现有方法将文本作为一个整体单元进行评估,对于在保持意义的操纵下风格模式如何表现提供有限的洞察——当文本是需要跨模态一致性的更广泛多模态生态系统的一部分时,这一问题更加严重 (Chen and Wang, 2025 (https://arxiv.org/html/2605.05950#bib.bib14); Bao et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib32))。 为了聚焦上述问题,本工作由以下关键研究问题(RQs)引导: - • **RQ1:** 如何设计一种在对抗性操纵下保持鲁棒且无需依赖重型模型的检测框架? - • **RQ2:** 如何增强跨领域和多模态衍生文本场景的检测泛化能力,特别是在保持语义的变换下统计特征变得不可靠时? 针对这两个问题,我们提出了 **LiSCP**,一种用于 LLM 生成文本内容检测的**轻量级风格一致性轮廓分析方法**。我们的方法基于一个简单而强大的原则:可以通过文本在保持意义的操纵下风格模式的稳定性来推断 LLM 的作者身份。与其依赖于单个文本实例或聚合检测分数,LiSCP 通过生成输入的多个多模态对齐的改写变体(确保与伴随的多模态上下文一致)并测量它们之间的一致性,明确地对风格行为进行轮廓分析。具体而言,我们的方法构建了一个风格一致性轮廓,整合了:(i) 捕获表面不变性的**离散风格一致性信号**,以及 (ii) 量化变体之间语义对齐的**连续语义信号**,包括与底层多模态上下文的隐式对齐。这种轮廓分析的视角将焦点从脆弱的、特定于措辞的人工痕迹转移到在改写和多模态上下文适应下持续存在的稳定性模式,从而旨在解决 **RQ2**。 为了回答 **RQ1**,LiSCP 设计为在现实世界的检测部署中既轻量又鲁棒。最终决策源自紧凑的一致性轮廓,而不是大型端到端模型或特定于检测器的启发式方法,这提高了效率并减少了对任何特定生成器的依赖。通过对保持意义的变体聚合稳定性信号,LiSCP 强调通过后期编辑或重写难以消除的变换一致信号。总之,本工作做出以下贡献: - • **轻量级风格轮廓框架。** 我们提出了 **LiSCP**,一个通过聚合多模态对齐的改写变体之间的稳定性信号来分析风格一致性的框架,对后期编辑和模型偏移具有鲁棒性。 - • **多层次风格-语义融合。** 在本工作中,检测被重构为操纵下的**风格一致性推断**。我们的轮廓结合了离散的风格和连续的语义信号,以增强在不同场景下的鲁棒性和泛化能力。 - • **在挑战性设置下的实证验证。** 在多样化的领域和真实世界的多模态场景(例如,图像-文本对验证、视频字幕认证)中,LiSCP 取得了最先进的性能,并对对抗性攻击和混合人机创作表现出强大的鲁棒性。 ## 2. 相关工作 #### 统计和基于模型的检测器 早期的机器生成文本检测工作依赖于人工撰写和机器生成内容之间的统计不规则性,例如困惑度、熵或基于似然的度量 (Lavergne et al., 2008 (https://arxiv.org/html/2605.05950#bib.bib1); Hashimoto et al., 2019 (https://arxiv.org/html/2605.05950#bib.bib2); Gehrmann et al., 2019 (https://arxiv.org/html/2605.05950#bib.bib3))。这些方法在令牌或序列级别识别异常,构成了许多现代检测器的基础。然而,随着 LLMs 变得越来越流畅,这种表面水平的统计量通常不足以捕捉当代机器生成文本表现出的微妙风格模式 (Jawahar et al., 2020 (https://arxiv.org/html/2605.05950#bib.bib4))。值得注意的是,在多模态内容场景(例如,图像-文本对、视频字幕和多模态评论)中,这些统计方法面临额外的挑战:它们未能利用跨模态语义对齐线索,并且当文本被改写以适应多模态上下文时往往效果下降 (Yu et al., 2025a (https://arxiv.org/html/2605.05950#bib.bib62); Zhang et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib63); Sadanandan and Behzadan, 2026 (https://arxiv.org/html/2605.05950#bib.bib64))。最近的工作探讨了基于监督训练的检测器,通常微调大型模型以区分人工撰写和机器生成的文本内容 (Yang et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib25))。代表性的系统如 GPTZero 和 OpenAI 的分类器在标记语料库上训练 RoBERTa 风格的模型以学习判别性表示 (Tian, 2023 (https://arxiv.org/html/2605.05950#bib.bib20); Solaiman et al., 2019 (https://arxiv.org/html/2605.05950#bib.bib21))。虽然在受控设置中有效,但这些检测器经常遭受领域偏移、有限的跨模型泛化以及对后期编辑或重写的敏感性 (Hu et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib6); Mao et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib18); Dai et al., 2026 (https://arxiv.org/html/2605.05950#bib.bib69))。相比之下,我们的工作避免依赖重型分类器或特定任务的监督,而是专注于风格稳定性和多模态引导的语义一致性。 #### 基于改写和扰动的检测 为了减轻对单个文本实例的过拟合,几种方法利用扰动或改用来提高鲁棒性。DetectGPT (Mitchell et al., 2023 (https://arxiv.org/html/2605.05950#bib.bib15)) 通过比较扰动前后的模型分数来利用似然曲率,基于 LLM 生成的文本通常位于局部似然最大值附近并在受控重写下变得不稳定这一观察。Fast-DetectGPT (Bao et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib7)) 通过更轻量的扰动例程提高了效率。其他方法,如 Binoculars (Hans et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib17)) 和 BiScope (Guo et al., 2024 (https://arxiv.org/html/2605.05950#bib.bib8)),对比不同语言模型之间的分数,以增强超越单个生成器的泛化能力。尽管它们有效,但大多数基于扰动的方法将改写视为分数聚合的机制,而不是其自身的信号 (Shportko and Verbitsky, 2025 (https://arxiv.org/html/2605.05950#bib.bib67); Mao and others, 2025 (https://arxiv.org/html/2605.05950#bib.bib68); Li et al., 2025a (https://arxiv.org/html/2605.05950#bib.bib66), b (https://arxiv.org/html/2605.05950#bib.bib48))。因此,它们继续依赖全局似然统计量,并且对细粒度风格属性提供有限的洞察,特别是在文本风格模式通常受配对视觉内容约束的多模态场景中 (Cao, 2025 (https://arxiv.org/html/2605.05950#bib.bib58))。我们的工作从根本上不同,因为它明确地对多模态引导的改写变体之间的风格一致性进行建模,将焦点从分数转移到在对抗性操纵和多模态上下文适应下持续存在的稳定性模式。 #### 现实世界设置下的鲁棒检测 最近的研究越来越强调现实世界的约束,例如混合人机作者身份、对专有模型的部分访问以及流式文本场景。PALD (Lei et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib13)) 在句子级别估计机器生成内容的比例,从而能够在混合文档中进行部分作者身份分析。GLIMPSE (Bao et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib32)) 通过从有限观察中重建概率分布来弥合白盒和黑盒设置,提高了跨专有模型的鲁棒性。其他工作探索非参数分布比较 (Song et al., 2025 (https://arxiv.org/html/2605.05950#bib.bib16)) 或用于在线检测的顺序假设检验 (Chen and Wang, 2025 (https://arxiv.org/html/2605.05950#bib.bib14))。现有的鲁棒检测方法提高了适用性,但它们通常输出单个全局分数,对改写或轻度编辑保持敏感,并且忽视了跨模态语义约束。相比之下,我们的方法明确地在保持意义...
相似文章
LLM生成文本中的文学非风格
本文使用n-gram分布分析LLM生成文本中的统计模式,揭示了其风格缺陷,并表明风格与语义不可分离。
区分AI生成与人类撰写:评估LLM检测LLM生成内容的能力
本文研究了在教育场景中,LLMs在多大程度上能够检测自身生成的内容,发现检测准确率因任务类型而异,且对于简答题不可靠。
LLMs中的隐私与个性化权衡:风格测量信号减少对用户特定文本生成的影响
本文通过减少用户特定文本生成中的风格信号,研究了LLMs中的隐私与个性化权衡,发现匿名化降低了风格保真度,同时保留了语义含义。
通过句法可预测性的语言学感知型LLM水印技术
本文介绍了STELA,一个语言学感知的LLM水印框架,通过POS n-gram的句法可预测性来平衡文本质量和检测鲁棒性。该方法无需访问模型logits即可实现公开可验证的水印检测,在类型学多样化的语言(英语、中文、韩语)上展示了优异性能。
从专业化到通用化:指令微调大语言模型用于健壮有害内容缓解
本文研究了通过指令微调通用大语言模型来实现健壮的有害内容缓解,特别是仇恨言论检测,使用了一个包含36个数据集的统一语料库,取得了最先进的性能,并增强了跨领域和跨语言的泛化能力。