Telescope:通过测量标记重复概率改进LLM生成内容的零样本检测
摘要
论文引入了Telescope Perplexity这一指标,通过测量标记重复概率以零样本方式检测LLM生成的文本,在多个数据集上实现了最先进或具有竞争力的性能。
arXiv:2607.04061v1 公告类型:新
摘要:区分大型语言模型(LLM)生成的文本与人类写作是一个关键且困难的挑战。虽然LLM被训练成像人类一样写作,但我们假设这种训练留下了不可磨灭的印记。LLM在训练初期就对标记重复产生了特别强烈的厌恶。这种偏见作为一种“残留启发式”(发展过程中的产物)持续存在,并在LLM生成的文本中被激活,从而将LLM与人类写作区分开来。为了探究这一现象,我们引入了Telescope Perplexity这一指标,用于评估模型的标记重复概率$P(s_i | s_{1:i})$。我们的实证研究表明,Telescope Perplexity特征在预训练早期就已出现,并且Telescope Perplexity在经验上实现了高效零样本LLM检测。我们在多个数据集(包括我们引入的现代评估集)、参考模型和扰动方案上展示了最先进或具有竞争力的性能,且效率高于其他方法。
查看缓存全文
缓存时间: 2026/07/07 04:38
# Telescope: 通过测量标记重复概率改进对LLM生成内容的零样本检测 来源:https://arxiv.org/html/2607.04061
###### 摘要
区分大语言模型(LLM)生成的文本与人类写作是一项关键且困难的挑战。尽管LLM被训练得如同人类一样写作,但我们假设这种训练会留下不可磨灭的印记。LLM在训练早期就对标记重复形成了特别强烈的厌恶。这种偏差作为一种“遗迹性启发式”(一种发育残留)持续存在,在LLM生成的文本中被激活,从而将LLM与人类写作区分开。为了探究这一现象,我们引入了Telescope Perplexity,这是一种评估模型标记重复概率 \(P(s_i|s_{1:i})\) 的指标。我们的实证研究发现,Telescope Perplexity特征在预训练早期就会出现,并且Telescope Perplexity能够有效实现高效的零样本LLM检测。我们在多种数据集(包括我们引入的现代评估集)、参考模型和扰动方案上展示了最先进或具有竞争力的性能,且效率高于其他方法。
LLM文本检测,可解释性
## 1 引言
### 1.1 背景与动机
大语言模型(LLM)在2022年OpenAI发布ChatGPT时引起了公众的广泛关注。这一进步向世界展示了深度学习模型在理解和响应人类文本方面可以达到的高度(Ouyang等人,2022 (https://arxiv.org/html/2607.04061#bib.bib55))。自ChatGPT发布以来,人工智能行业已融入文化潮流,同时大语言模型的能力得到了显著提升。语言模型变得更快(Hoffmann等人,2022 (https://arxiv.org/html/2607.04061#bib.bib31))、更高效(Dao等人,2022 (https://arxiv.org/html/2607.04061#bib.bib28))且更便宜(Cai等人,2024 (https://arxiv.org/html/2607.04061#bib.bib30))。如今它们被广泛应用于从实时翻译到帮助学生理解复杂主题与问题等各种任务。然而,LLM也被用于部署垃圾邮件机器人(Liyanage等人,2024 (https://arxiv.org/html/2607.04061#bib.bib33))、在网上传播假新闻(Sallami等人,2024 (https://arxiv.org/html/2607.04061#bib.bib32))以及为学生代写论文(Jelson等人,2026 (https://arxiv.org/html/2607.04061#bib.bib34))。人类无法区分LLM与人类撰写的文本(Ippolito等人,2020 (https://arxiv.org/html/2607.04061#bib.bib50)),因此需要算法方法来帮助控制LLM的滥用,并且这些方法最好能够持续有效,跟上新模型发布的步伐。出于这个原因,我们专注于零样本检测。零样本方法无需不断更新其训练数据即可运行,这使其非常适合处理模型发布的持续更迭。
### 1.2 核心贡献
在这项工作中,我们提出并研究了“遗迹性启发式”假设,该假设提供了一种新颖的视角来观察早期训练动态如何影响最终模型的行为。我们引入了Telescope Perplexity(公式1 (https://arxiv.org/html/2607.04061#S3.E1)),这是一个简单、概念上有根据的探针,专门针对其中一个假设的、导致特定且极端厌恶重复的遗迹性启发式。此外,我们提供了广泛的测试来验证我们的“遗迹性启发式”假设以及该特征的早期出现/局部性,这使我们能够更好地理解Telescope Perplexity的工作原理、可能失效的地方以及未来如何改进。最后,我们提供了广泛的实证验证,证明了Telescope Perplexity在各种场景下(包括使用当代LLM如GPT4o Mini、Deepseek-V3构建的新评估集)具有最先进或具有竞争力的零样本检测性能和鲁棒性。重现本文所有实验所需的代码可在以下GitHub仓库中找到:https://github.com/ChrisNassif/Telescope。
## 2 相关工作
检测一段文本是否由某个未知的“目标模型”生成的技术(也称为黑盒设置)大致可分为两类:零样本检测器或监督分类器。零样本检测器用“参考模型”对文本进行推理,然后使用某种统计技术分析该参考模型的输出标记。统计分析的目标是试图衡量LLM生成文本背后存在的某种基础且可解释的模式,这种模式适用于各种目标语言模型。关于参考模型和目标模型之间关系的更多说明,请参见附录第8.1节 (https://arxiv.org/html/2607.04061#S8.SS1)。监督检测器利用某种训练好的机器学习模型来识别文本是否源自LLM。这些监督检测器既可以将零样本检测器作为启发式输入提供给模型,以学习指示文本是否为LLM生成的模式(Verma等人,2024 (https://arxiv.org/html/2607.04061#bib.bib4)),也可以直接从另一个语言模型进行微调,无需使用任何零样本启发式即可直接对文本进行操作(Su等人,2024 (https://arxiv.org/html/2607.04061#bib.bib22))。这些监督检测器面临的主要限制是,随着新目标模型的发布,它们可能会迅速过时,难以检测新目标LLM的输出。因此,我们选择将这项工作重点放在零样本方法上,并且仅针对零样本方法进行基准测试。
早期构建LLM生成文本的零样本检测器的尝试包括使用参考语言模型的对数困惑度或损失来检测目标语言模型生成的文本。正如Xu等人 (2024 (https://arxiv.org/html/2607.04061#bib.bib5)) 先前的研究所示,参考模型产生的更高困惑度分数意味着该段文本不太可能由该参考模型输出。更高的困惑度也可以表明该参考模型在训练中从未见过任何与推理时文本相似的文本,因为大语言模型倾向于在与训练时发现的分布相似的分布中进行写作。此外,由于大语言模型通常在非常相似且广泛的数据集上训练,如果参考LLM对一段文本感到困惑并且从未见过类似内容,那就意味着其他语言模型很可能在其训练数据中也未见过类似内容。如果其他语言模型不太可能见过相似的文本,它们也就不太可能写出该文本(Choshen等人,2022 (https://arxiv.org/html/2607.04061#bib.bib38)),这就在人类撰写的文本和LLM生成的文本之间创造了一种分离。
除了基于困惑度的技术外,还存在基于排序的技术,例如DetectLLM LRR (Su等人,2023 (https://arxiv.org/html/2607.04061#bib.bib18)),它利用了logits分布的对数秩。一个标记在分布中的秩是指该标记在按概率排序的logits分布中的索引。分布中概率最高的标记的秩为1,概率第二高的标记的秩为2,依此类推。对数秩就是计算出的秩的自然对数。利用标记秩,Su等人 (2023 (https://arxiv.org/html/2607.04061#bib.bib18)) 设计了一种名为LRR(对数秩比)的新型检测器,它在区分LLM生成文本和人类撰写的文本方面非常准确。Su等人 (2023 (https://arxiv.org/html/2607.04061#bib.bib18)) 还引入了第二种名为DetectLLM-NPR的技术,该技术结合了排序信息和文本扰动。基于扰动的方法通过单词替换或轻微改写等方式对文本进行扰动,然后分析在扰动文本时零样本统计量如何变化。DetectLLM-NPR和类似技术如DetectGPT (Mitchell等人,2023 (https://arxiv.org/html/2607.04061#bib.bib6)) 能够实现检测LLM生成文本的高性能,但计算成本高昂。DetectGPT和DetectLLM-NPR各自需要对参考模型进行多次推理才能获得良好性能,这极大地增加了推理成本。我们选择不将基于扰动的方法作为基准,因为巨大的计算成本加上我们在各种数据集和参考模型上的广泛测试会超出我们可用的计算资源。
最近的零样本工作避免了DetectGPT和DetectLLM-NPR的扰动成本。Fast-DetectGPT (Bao等人,2024 (https://arxiv.org/html/2607.04061#bib.bib51)) 将扰动替换为单次采样步骤,通过条件概率曲率对文本进行评分,而DNA-GPT (Yang等人,2024 (https://arxiv.org/html/2607.04061#bib.bib52)) 则重新生成截断的续写,并测量其n-gram或概率与原文的差异。两者都从少量前向传播中提取了强信号,但并未专门针对重复厌恶。除了统计评分,Ackerman和Panickssery (2025 (https://arxiv.org/html/2607.04061#bib.bib53)) 表明,经过指令微调的Llama3-8B可以通过一个可识别的残差流方向识别自己的写作,这与我们的主张一致,即LLM生成文本留下了可学习的、局部可检测的痕迹。我们建议读者参考Wu等人 (2025 (https://arxiv.org/html/2607.04061#bib.bib54)) 的综合性调研。
零样本黑盒检测器的最新技术水平是通过对困惑度的关键改进来实现的。这项技术称为Binoculars Score (Hans等人,2024 (https://arxiv.org/html/2607.04061#bib.bib1)),它尝试用两个模型的交叉困惑度分数来归一化困惑度分数,以便在不同领域表现更好。计算Binoculars Score需要两个语言模型而不是一个,这相对于仅使用困惑度而言计算需求翻倍;然而,Hans等人 (2024 (https://arxiv.org/html/2607.04061#bib.bib1)) 表明,额外的成本是值得的,因为性能提升非常显著。据我们所知,使用Falcon 7B参考模型的Binoculars Score目前是零样本检测LLM生成文本的最先进方法。
## 3 理解遗迹性启发式
众所周知,神经网络通常在掌握长距离依赖之前先学习更简单的局部模式(Choshen等人,2022 (https://arxiv.org/html/2607.04061#bib.bib38);Belrose等人,2024 (https://arxiv.org/html/2607.04061#bib.bib39))。这提出了一个引人深思的问题:
> LLM早期预训练期间的优化压力是否灌输了根本性的统计偏差,而这些偏差在后续训练中从未被遗忘?
我们从Belrose等人 (2024 (https://arxiv.org/html/2607.04061#bib.bib39)) 的先前工作中知道,大多数语言模型在早期训练中开始时是二元模型,直接根据前一个或可能两个标记预测下一个标记。我们假设,在训练早期,当LLM发展这些二元模型时,它们学习了一个重要的启发式,这有助于它们将文本建模为二元模型:标记极少重复自身。因此,这些早期阶段的二元模型在学习到标记在自然语言中极少重复时,会始终对标记重复具有特别强烈的厌恶。
先前工作中的几个关键结果表明,这些二元模型所学到的内容在训练的后期阶段持续存在,并且大多数LLM会相互发展出相同的二元模型,即使它们是通过不同的数据集和架构训练的(Choshen等人,2022 (https://arxiv.org/html/2607.04061#bib.bib38)),(Belrose等人,2024 (https://arxiv.org/html/2607.04061#bib.bib39))。这种启发式随时间持续存在,尽管在训练早期阶段强烈拒绝标记重复通常并不完全必要。我们称之为“遗迹性启发式”,因为它是在训练早期发展起来以辅助初始二元模型的,但在训练的后期阶段模型并不严格需要它。目标模型和参考模型都会有一个“遗迹性启发式”来防止标记重复,因此目标模型生成的文本会比人类文本(没有相同的“遗迹性启发式”)更强地激活负责“遗迹性启发式”的神经元。
为了探究这一假设及其在区分人类撰写的文本和LLM生成的文本方面的能力,我们提出了Telescope Perplexity。尽管公式异常简单,但我们认为其力量在于探测训练早期形成的这种特定的假设性重复厌恶。Telescope Perplexity衡量参考语言模型根据其到当前标记为止的上下文输出最后一个已处理标记的学习似然性。对于一个语言模型 \(\mathcal{M}\) 和一个长度为 \(L\) 的标记序列 \(\vec{s} = (s_1, ..., s_L)\),Telescope Perplexity定义如下:
\[
\text{Telescope PPL}_{\mathcal{M}}(\vec{s}) = -\frac{1}{L} \sum_{i=1}^{L} \log \mathcal{M}(s_i \mid s_{1:i})
\]
其中 \(\mathcal{M}(s_i \mid s_{1:i})\) 是模型 \(\mathcal{M}\) 在给定序列 \(s_1...s_i\) 的情况下分配给标记 \(s_i\) 的概率。这提供了对模型标记重复似然性的针对性观察,而标准困惑度则通过预测下一个标记(\(\mathcal{M}(s_i \mid s_{1:i-1})\))来工作。图1 (https://arxiv.org/html/2607.04061#S3.F1) 提供了Telescope Perplexity的概念性概述。请注意,Telescope Perplexity与标准困惑度不同,因为负对数似然没有取指数;但这计算效率更高,并且由于取指数是单调函数,因此不会影响使用固定阈值的任何检测结果。
图1:“遗迹性启发式”假设以及测量Telescope Perplexity的平均标记重复概率的概述。
### 3.1 训练动态
如果Telescope Perplexity检测到的统计偏差确实是训练早期建立的“遗迹性启发式”,我们预期该特征会相对较快地出现,并在预训练的后期阶段保持稳定。为了研究这一点,我们使用Amber-7B (Liu等人,2023 (https://arxiv.org/html/2607.04061#bib.bib2)) 和Pythia (Biderman等人,2023 (https://arxiv.org/html/2607.04061#bib.bib3)) 不同预训练阶段的检查点,分析了生成文本的Telescope Perplexity。图2 (https://arxiv.org/html/2607.04061#S3.F2) 显示了使用Pythia-2.8B训练检查点生成的文本中Telescope Perplexity的演变。
图2:(a) 最终Pythia检查点作为参考模型 (b) SmolLM 360M作为参考模型。图2:由整个训练过程中的Pythia-2.8B模型检查点生成的文本上评估的Telescope Perplexity。注意Telescope Perplexity早期的稳定化。
图2 (https://arxiv.org/html/2607.04061#S3.F2) 中的结果揭示了一个关键特征:Telescope Perplexity在训练早期急剧上升,然后大致趋于稳定。相似文章
一次响应,始终响应:通过潜在提示恢复检测LLM生成的文本
本文提出了EchoPrompt,一种无需训练的LLM生成文本检测器,通过添加通用前缀恢复潜在提示依赖性,并衡量指令微调模型与基础模型之间的似然增益差异,实现了最先进的零样本检测性能。
令牌统计揭示多轮大语言模型交互中的对话漂移
本文提出双可预测性(P)和信息数字孪生(IDT),一种使用令牌频率统计来监控多轮LLM交互中对话一致性的轻量级方法,无需使用嵌入或模型内部信息。该方法在检测矛盾和话题转换时达到100%的敏感度,同时为扩展LLM部署建立了实用的监控框架。
LLM生成样本的几何过滤在少样本文本分类中的应用
本文提出了一种几何过滤框架,通过评估LLM生成样本在嵌入空间中与真实类别示例的欧氏距离来选择高质量样本,从而将少样本文本分类性能提升了2.61个百分点,优于SMOTE方法。
零样本嵌入漂移检测:一种针对LLM中提示注入的轻量级防御方法
本文介绍了零样本嵌入漂移检测(ZEDD),这是一种轻量级框架,通过测量嵌入空间中的语义偏移来检测LLM中的提示注入攻击,在多种架构上实现了超过93%的准确率和低于3%的假阳性率。
超越熵:从令牌级分布偏差中学习以提升LLM推理
提出独立组合令牌(ICT)框架,利用令牌logit分布之间的Jensen-Shannon散度识别关键分支点,防止RLVR在LLM推理中的熵坍缩和熵爆炸。在Qwen模型上实现了高达14.9%的pass@4改进。