AI生成文本检测中语言特征的系统性分析:跨领域与跨模型研究

arXiv cs.CL 论文

摘要

一项大规模实证研究对284个语言特征在27个大语言模型和10个文本领域中的表现进行了分析,以评估哪些特征能够可靠地检测AI生成文本。研究发现,词汇丰富度指标是跨领域和跨模型最稳健的信号,而许多其他已提出的指标则高度依赖具体上下文。

arXiv:2606.04177v1 公告类型:新论文 摘要:可解释的语言特征为解释某段文本为何看起来像机器生成提供了一种有前景的方法,尤其适用于非专业用户。然而,现有关于哪些特征能可靠标识大语言模型生成文本的研究结论,在特征集、模型和文本领域之间仍较为分散。为填补这一空白,我们开展了一项大规模实证研究,评估用于表征AI生成文本的语言信号的鲁棒性。我们的分析涵盖284个可解释语言特征,涉及27个大语言模型的输出及10个文本领域,并在跨模型和跨领域泛化设置下进行评估。研究表明,仅基于语言特征的分类器能够可靠地区分AI生成文本与人类撰写文本。然而,许多此前提出的指标被证明高度依赖具体上下文,词汇丰富度指标是例外——它在不同模型系列和文本领域中均保持稳健的信号强度。这些结果揭示了哪些语言信号能够跨情境泛化,为更可靠、更可解释的AI生成语言分析奠定了基础。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:13

# 跨领域与跨模型的AI生成文本检测语言特征系统性分析

来源:https://arxiv.org/abs/2606.04177
查看PDF(https://arxiv.org/pdf/2606.04177)

> 摘要:可解释的语言特征为解释某段文本为何看起来像机器生成提供了一种颇具潜力的方法,尤其适用于非专业用户。然而,现有关于哪些特征能可靠标识LLM生成文本的研究结论,在特征集、模型和文本领域之间仍较为零散。为填补这一空白,我们开展了一项大规模实证研究,评估语言信号在刻画AI生成文本方面的鲁棒性。我们的分析涵盖284个可解释语言特征,针对27个LLM的输出及十个文本领域,并在跨模型与跨领域泛化设置下进行评估。研究表明,仅基于语言特征构建的分类器能够可靠地区分AI生成文本与人类书写文本。然而,许多此前提出的指标被证明具有强烈的上下文依赖性,词汇丰富度指标是例外——它在不同模型家族和文本领域中均保持稳健的信号表现。这些结果揭示了哪些语言信号具备跨情境的泛化能力,并为更可靠、可解释的AI生成语言分析奠定了基础。

## 提交历史

作者:Esra Dönmez \[查看邮箱(https://arxiv.org/show-email/ce7b820c/2606.04177)\] **\[v1\]** 2026年6月2日(周二)19:46:22 UTC(8,530 KB)

相似文章

Counter Turing Test 的发现:AI生成文本检测

arXiv cs.CL

本文介绍了 Counter Turing Test 共享任务在AI生成文本检测方面的发现,顶级系统在二分类任务中达到了完美表现,但在模型归因方面性能显著较低,突显了区分不同大语言模型输出的难度。

使用可解释语言特征检测AI生成假新闻的跨提示词泛化研究

arXiv cs.CL

来自肯尼索州立大学的研究人员利用可解释语言特征(词汇多样性、可读性、情感特征)对检测AI生成假新闻的跨提示词泛化能力展开研究。在一种提示策略上训练、在另一种提示策略上测试的随机森林分类器取得了0.988至1.000的AUC值,表明这些特征能够捕捉AI生成文本的稳定且可泛化的属性。

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。

聚光灯与盲区:机器生成文本检测的评估

arXiv cs.CL

# 聚光灯与盲区:机器生成文本检测的评估 来源:[https://arxiv.org/html/2604.16607](https://arxiv.org/html/2604.16607) ###### 摘要 随着生成式语言模型的兴起,机器生成文本检测已成为一项关键挑战。尽管模型种类繁多,但不一致的数据集、评估指标和评估策略使得模型有效性的比较变得模糊。为此,我们从...