论人类与人工智能生成文本的不可区分性

arXiv cs.LG 论文

摘要

本文理论分析了重复改写如何使人工智能生成的文本与人类写作分布对齐,推导出收敛率,并探讨了对可靠的人工智能文本检测的影响。

arXiv:2608.26797v1 Announce Type: new 摘要:大型语言模型的快速发展使得区分人工智能生成的文本与人类写作成为了一个紧迫的问题。这一挑战因旨在使机器生成文本更像'人类'的改写工具而进一步加剧。我们研究如何利用人类写作样本,战略性地改写机器生成的回答,使其趋向于人类分布。在针对相同提示的人类和机器回答的多样本设置下,我们证明了在简单的混合和稳定性条件下,重复改写会使机器分布向经验人类分布移动。我们的结果推导出显式的收敛率,将分析扩展到有限样本设置,并表征了所需的人类样本数量和改写轮数如何随期望误差而缩放。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:44

# 论人类与人工智能生成文本的不可区分性
来源:https://arxiv.org/html/2608.26797
作者:Aritra Das、Mihir More、Debayan Gupta
所属机构:Truth Audit Labs
联系邮箱:{jaee, aritra, mihir, debayan}@truthauditlabs.ai

2026年7月

###### 摘要

大型语言模型的快速进步使得区分人工智能生成的文本与人类写作成为一个紧迫的问题。旨在让机器生成的文本显得更“人性化”的改写工具进一步加剧了这一挑战。我们研究了如何利用人类写作样本来战略性地改写机器生成的回答,使其分布趋近于人类写作分布。在针对相同提示词同时具有人类回答和机器回答的多样本设定下,我们证明在简单的混合与稳定性条件下,反复改写能够使机器分布逐步趋近于经验人类分布。我们的研究推导出了明确的收敛速率,将分析扩展到有限样本场景,并刻画了所需的人类样本数量和改写轮次如何随期望误差进行缩放。

## 1引言

大型语言模型现已能就广泛的学术任务生成流畅且令人信服的文本。它们在学术界的日益普及引发了关于抄袭、未披露的AI辅助以及书面提交内容完整性的严重关切(Johnston等,2024)(https://arxiv.org/html/2608.26797#bib.bib26)。近期研究表明,AI生成的学术写作可以达到与人类作品相当的质量,使得仅凭文本越来越难以推断作者身份(Yeadon等,2024)(https://arxiv.org/html/2608.26797#bib.bib27)。作为回应,大学和其他机构越来越多地将AI文本检测工具纳入其学术诚信流程(Weber-Wulff等,2023)(https://arxiv.org/html/2608.26797#bib.bib7)。然而,这些检测器在面对重写时非常脆弱。先前的工作表明,改写或反复重写可以在保持内容和质量的同时,显著降低机器生成文本的可检测性(Sadasivan等,2023)(https://arxiv.org/html/2608.26797#bib.bib9);(Weber-Wulff等,2023)(https://arxiv.org/html/2608.26797#bib.bib7)。因此,理解反复改写如何改变机器生成的文本,特别是它是否系统性地使此类文本趋近于人类分布,对于可靠的AI文本归因至关重要。

理解AI文本检测局限性的一个有用方法是考察人类分布与机器分布之间的距离。Sadasivan等人(Sadasivan等,2023)(https://arxiv.org/html/2608.26797#bib.bib9)表明,一旦机器文本与人类写作足够相似,对单个机器生成回答的检测就可能变得不可靠。具体来说,他们认为当人类文本分布和机器文本分布变得过于接近时,任何检测器都无法保持可靠性,并进一步证明了反复改写可以显著削弱现有检测器。Chakraborty等人(Chakraborty等,2024)(https://arxiv.org/html/2608.26797#bib.bib10)给出了一个互补的结果:即使单个回答难以区分,但对多个独立回答的访问使检测成为可能,因为人类分布与机器分布之间的微小差异会在样本间累积。

一个有趣的问题是多样本设定的对抗性版本。在实践中,攻击者不仅可以访问机器生成的文本,还可以获取特定个人的写作样本。这些人类样本可用于指导机器文本的反复改写。例如,给定一个学生的过往作文和同一主题的机器生成作文,机器作文能否被改写得越来越像该学生的写作风格,同时保持其意义和质量?

我们研究了人类引导改写这一动态过程,并形式化地定义了在何种情况下,对人类样本的访问能够逐步将机器生成的文本推向人类分布、这一过程发生的速度有多快,以及需要多少人类数据。我们的主要贡献如下:

- • 我们证明,反复进行的、保持语义的扰动可以将机器生成分布推向经验人类分布,并给出了明确的收敛速率(定理1 (https://arxiv.org/html/2608.26797#Thmtheorem1))。
- • 我们将此保证扩展到有限样本情况,限定了在有限次语义表示后,观测到的扰动后机器分布与真实人类分布之间的距离(定理2 (https://arxiv.org/html/2608.26797#Thmtheorem2))。
- • 我们证明,随着可用人类示例的增加,改写器在处理人类文本时变得越来越稳定,且这种稳定性以平方根速率提升(定理3 (https://arxiv.org/html/2608.26797#Thmtheorem3))。

## 2预备知识

在讨论结果之前,我们定义本文使用的主要符号。令 $\mathcal{X}$ 表示提示词空间,$\mathcal{Y}$ 表示文本输出空间。对于提示词 $x \in \mathcal{X}$,令 $P_M(y \mid x)$ 表示机器生成回答的分布,令 $P_H(y \mid x)$ 表示人类书面回答的分布。在实践中,真实的人类分布是未知的,我们转而观察 $\mathcal{H}_m = \{h_1, \ldots, h_m\}$,其中 $h_j \overset{\mathrm{i.i.d.}}{\sim} P_H(\,\cdot \mid x)$,以及 $\mathcal{M}_p = \{y_1, \ldots, y_p\}$,其中 $y_i \overset{\mathrm{i.i.d.}}{\sim} P_M(\,\cdot \mid x)$。

###### 定义 1(经验分布)

这些样本定义了经验分布 $\widehat{P}_H^{(m)} = \frac{1}{m} \sum_{j=1}^{m} \delta_{h_j}$,$\widehat{P}_M^{(p)} = \frac{1}{p} \sum_{i=1}^{p} \delta_{y_i}$,其中 $\delta_z$ 表示在 $z$ 处赋予概率 1 的点质量分布。

全文中,我们使用全变差距离 $d_{\mathrm{TV}}(P, Q) = \frac{1}{2} \sum_{z \in \mathcal{Y}} \left\|P(z) - Q(z)\right\|$。

###### 定义 2(质量控制神谕)

质量控制神谕定义为 $Q: \mathcal{X} \times \mathcal{Y} \to [0,1]$。值 $Q(x, z)$ 衡量 $z$ 是否是对提示词 $x$ 的正确、相关、清晰且有用的回应。固定一个质量阈值 $q_0$。仅当 $Q(x, z) \geq q_0$ 时,输出才会被接受。

###### 定义 3(语义保持神谕)

令 $\mathcal{Z}$ 为所有扰动输出的空间。$\mathrm{Sem}: \mathcal{X} \times \mathcal{Y} \times \mathcal{Z} \to [0,1]$。值 $\mathrm{Sem}(x, y, z)$ 衡量 $z$ 是否保持了对提示词 $x$ 的原始回应 $y$ 的含义。我们固定一个阈值 $s_0$。仅当 $\mathrm{Sem}(x, y, z) \geq s_0$ 时,$y$ 的改写才会被接受。

我们认为这些工具在现实世界中是可用的,其中现有的检测器可以实例化 $D$,而 $Q$ 和 $\mathrm{Sem}$ 可以使用语言模型本身作为评估器来实现。对于原始回应 $y_i$ 的反复扰动,语义保持性总是针对 $y_i$ 进行检查,而不仅仅是针对最近的改写,这防止了一系列单个微小的变化漂移到不同的答案。定义 $y_i$ 的可接受集为 $\mathcal{A}_i = \left\{ z \in \mathcal{Y}: Q(x, z) \geq q_0 \ \text{and} \ \mathrm{Sem}(x, y_i, z) \geq s_0 \right\}$。

###### 定义 4(质量条件扰动核)

我们从一个基础重写规则 $R_{i,m}(z' \mid z)$ 开始,它生成当前回应的候选扰动。然后通过将这个提议限制在满足质量和语义保持约束的重写上来获得接受的核。它可能使用人类样本 $\mathcal{H}_m$。接受的扰动核为 $T_{i,m}(z, z') = \frac{R_{i,m}(z' \mid z) \mathbf{1}\{z' \in \mathcal{A}_i\}}{\sum_{u \in \mathcal{Y}} R_{i,m}(u \mid z) \mathbf{1}\{u \in \mathcal{A}_i\}}$。我们假设对于过程到达的每个状态,分母都是正数。因此 $T_{i,m}(z, \mathcal{A}_i) = 1$。对于 $\mathcal{Y}$ 上的一个分布 $P$,用 $P T_{i,m}$ 表示经过一步扰动后的分布:$(P T_{i,m})(z') = \sum_{z \in \mathcal{Y}} P(z) T_{i,m}(z, z')$。

我们声称这样的核在实践中是合理的,这与研究表明改写工具具有强语义保持性和适度质量退化的研究一致(Masrour等,2025)(https://arxiv.org/html/2608.26797#bib.bib15);(Sadasivan等,2023)(https://arxiv.org/html/2608.26797#bib.bib9);(Xu等,2026)(https://arxiv.org/html/2608.26797#bib.bib16)。

###### 假设 1(人类可接受性)

对于每个机器回答 $y_i$ 和每个人类回答 $h_j \in \mathcal{H}_m$,有 $Q(x, h_j) \geq q_0 \quad \text{and} \quad \operatorname{Sem}(x, y_i, h_j) \geq s_0$。等价地,每个人类回答都位于可接受集 $\mathcal{A}_i$ 中,因此对于每个 $i$,有 $\widehat{P}_H^{(m)}(\mathcal{A}_i) = 1$。这在我们的情境中是自然的,因为人类和机器回答对应于相同的提示词,并旨在代表可比的答案。

###### 假设 2(人类稳定性)

我们定义经验人类稳定性为 $\varepsilon_m = \max_{1 \leq i \leq p} d_{\mathrm{TV}}\left( \widehat{P}_H^{(m)} T_{i,m}, \widehat{P}_H^{(m)} \right)$。(2.1) 人类稳定性参数 $\varepsilon_m$ 衡量了扰动神谕在多大程度上改变了经验人类分布。较小的 $\varepsilon_m$ 意味着人类文本在改写器下近似平稳。

###### 假设 3(块混合性)

存在一个整数块长度 $\ell_m \geq 1$ 和一个常数 $\rho_m \in [0,1)$,使得对于每个 $i$ 以及所有支撑在 $\mathcal{A}_i$ 上的分布 $P$ 和 $Q$,有 $d_{\mathrm{TV}}\left( P T_{i,m}^{\ell_m}, Q T_{i,m}^{\ell_m} \right) \leq \rho_m d_{\mathrm{TV}}(P, Q)$。(2.2) 假设 3 (https://arxiv.org/html/2608.26797#Thmassumption3) 形式化了反复扰动使输出逐渐遗忘其起始点的思想。$\ell_m$ 确保收缩不必发生在每次重写中。只要它在扰动块中出现就足够了。命题 1 (https://arxiv.org/html/2608.26797#Thmproposition1) 给出了保证这种行为的一个简单条件。(Rosenthal, 1995 (https://arxiv.org/html/2608.26797#bib.bib25))

## 3相关工作

#### AI生成文本检测

早期的检测器使用语言模型令牌概率中的统计模式。例如,GLTR 显示令牌排名以帮助读者识别生成的文本(Gehrmann等,2019 (https://arxiv.org/html/2608.26797#bib.bib1))。后来的系统从人类和机器示例中学习分类器,或结合来自多个语言模型的信号(Verma等,2024 (https://arxiv.org/html/2608.26797#bib.bib2))。零样本方法避免训练单独的检测器(Mitchell等,2023 (https://arxiv.org/html/2608.26797#bib.bib3);Bao等,2024 (https://arxiv.org/html/2608.26797#bib.bib4))。另一系列工作在生成期间插入统计水印,然后测试该信号(Kirchenbauer等,2023 (https://arxiv.org/html/2608.26797#bib.bib5))。这些方法在其测试环境中可能有效。然而,它们在新的生成器、领域、解码规则和编辑下,性能可能会发生变化(Weber-Wulff等,2023 (https://arxiv.org/html/2608.26797#bib.bib7);Dugan等,2024 (https://arxiv.org/html/2608.26797#bib.bib6))。我们不提出另一种检测器。我们研究检测器必须区分的分布在反复重写下如何变化。

#### AI检测的局限性

多篇论文将检测视为统计检验问题进行研究。Varshney等人(Varshney等,2020 (https://arxiv.org/html/2608.26797#bib.bib8))分析了当机器文本与人类文本非常接近时出现的局限。Sadasivan等人(Sadasivan等,2023 (https://arxiv.org/html/2608.26797#bib.bib9))给出了一个更清晰的分布视角。他们将最佳单文本检测器的性能与人类分布和机器分布之间的全变差距离联系起来。他们还通过实验证明,递归改写可以降低许多检测器的准确率,同时仅造成适度的质量损失。Chakraborty等人(Chakraborty等,2024 (https://arxiv.org/html/2608.26797#bib.bib10))研究了互补的多样本设定。他们表明,当检测器收到许多独立回答时,固定的人类分布与机器分布之间的微小差异可以累积。

#### 改写攻击

大量实证文献表明,重写会削弱机器文本检测器。DIPPER 是一个段落级改写器,具有控制词汇多样性和内容顺序的功能。它在避开多种检测器家族的同时,保持了段落的主要含义(Krishna等,2023 (https://arxiv.org/html/2608.26797#bib.bib11))。递归改写通过多次应用改写器来加强这种攻击(Sadasivan等,2023 (https://arxiv.org/html/2608.26797#bib.bib9))。其他攻击会替换选定的单词或搜索能改变写作风格的提示词(Shi等,2024 (https://arxiv.org/html/2608.26797#bib.bib12))。检测器分数也可用作训练奖励。这产生了直接优化为难以检测的生成器(Nicks等,2024 (https://arxiv.org/html/2608.26797#bib.bib13))。最近的工作在改写生成过程中使用检测器来引导令牌选择(Cheng等,2025 (https://arxiv.org/html/2608.26797#bib.bib14))。

#### 作者身份混淆

我们对人类示例的使用也与作者身份混淆和风格迁移相关。早期的攻击修改文档,直到作者身份分类器不再将其与其作者联系起来(Brennan and Greenstadt, 2009 (https://arxiv.org/html/2608.26797#bib.bib17);Bevendorff等,2019 (https://arxiv.org/html/2608.26797#bib.bib18))。后来的组合式改写改进了内容保持,并支持非定向混淆和模仿选定的写作风格(Gröndahl and Asokan, 2020 (https://arxiv.org/html/2608.26797#bib.bib19))。低资源风格迁移方法使用少量目标作者示例,并优化风格变化与语义保持之间的平衡(Liu等,2024 (https://arxiv.org/html/2608.26797#bib.bib20))。

#### 反复重写作为动态过程

其他工作研究了反复重写在许多轮次中会产生什么。Tripto等人(Tripto等,2024 (https://arxiv.org/html/2608.26797#bib.bib21))表明,连续的改写保留了大部分内容,但逐渐用改写器的风格替换了原作者的风格。Wang等人(Wang等,202

相似文章

各类AI生成文本检测方法在面对释义攻击时的鲁棒性

arXiv cs.LG

本文研究了AI生成文本检测方法(微调后的RoBERTa、Binoculars、文本特征分析及其集成方法)在面对释义攻击时的鲁棒性。研究发现,包含Binoculars的集成方法效果最强,但在攻击中损失也最大,揭示了性能与鲁棒性之间的二分法。

Counter Turing Test 的发现:AI生成文本检测

arXiv cs.CL

本文介绍了 Counter Turing Test 共享任务在AI生成文本检测方面的发现,顶级系统在二分类任务中达到了完美表现,但在模型归因方面性能显著较低,突显了区分不同大语言模型输出的难度。

人们能在75%的情况下检测出AI生成的文本

Reddit r/artificial

UnslopAI的一项测试显示,读者能在75%的情况下识别出AI生成的文本,这凸显了让AI写作听起来更人性化、以避免搜索引擎惩罚并保持真实性的必要性。

这篇文章完全由AI撰写,你能证明吗?

Reddit r/artificial

文章批判了AI生成文本的概念以及水印技术在证明AI参与方面的有效性,认为它可能无法捕捉人类贡献,并突出了定义‘AI垃圾’时的模糊性。

基础模型被AI检测器视为人类

arXiv cs.CL

这篇论文揭示,GPTZero和Pangram等商用AI检测器将基础语言模型生成的文本判定为几乎完全是人类撰写,而经过指令微调的模型输出则被标记为AI生成。作者提出了HIP,一种与检测器无关的迭代改写流程,能在保持语义的同时提升文本的类人性。