区分AI生成与人类撰写:评估LLM检测LLM生成内容的能力
摘要
本文研究了在教育场景中,LLMs在多大程度上能够检测自身生成的内容,发现检测准确率因任务类型而异,且对于简答题不可靠。
arXiv:2607.20446v1 公告类型:新
摘要:随着学生越来越多地使用大型语言模型(LLM)生成自然语言回复和程序代码,人们越来越关注是否可以用LLM本身来区分AI生成的作品与人类撰写的提交内容。在本文中,我们调查了LLM在多大程度上能够检测自身生成的内容,涵盖多种教育任务类型,包括编程练习、反思性写作和简答题。利用真实的学生回答和多种变体的LLM生成答案,我们评估了在不同提示策略和输出格式下的检测性能。我们的研究探讨了三个研究问题:(1) LLM在不同任务领域中识别自身输出的准确度如何;(2) 提示设计、回答长度和任务类型等因素如何影响检测效果;(3) LLM生成回答的哪些特征有助于成功或失败的检测。我们的发现表明,基于LLM的检测高度依赖于任务:对于编程任务和较长的反思性回答,检测可靠性显著更高,但在简答题上表现不佳,LLM经常将自身输出判断为比真实学生回答更像人类。我们进一步发现,在反思性写作任务中,提示框架和回答长度对可检测性有显著影响,相对较小的提示变化会显著降低检测准确性,而与编程相关的检测对提示变化更为稳健。总之,这些结果突显了LLM自检在教育环境中的潜力和局限性,并建议在依赖LLM作为识别AI生成学生作业的独立工具时需谨慎。
查看缓存全文
缓存时间: 2026/07/24 05:16
# 区分人工与真实:评估LLM检测LLM生成内容的能力 来源:https://arxiv.org/html/2607.20446 芬兰 juho\.2\.leinonen@aalto\.fi Paul Denny 奥克兰大学 奥克兰 新西兰 paul@cs\.auckland\.ac\.nz ###### 摘要 随着学生越来越多地使用大型语言模型(LLM)生成自然语言回复和程序代码,人们日益关注LLM本身能否用于区分AI生成的作品与人工提交的内容。本文研究了LLM在多种教育任务类型(包括编程练习、反思性写作和简答题)中检测自身生成内容的能力。我们使用真实的学生回复和多种LLM生成答案的变体,评估了不同提示策略和输出格式下的检测性能。本研究探讨了三个研究问题:(1) LLM在不同任务领域识别自身输出的准确度如何;(2) 提示设计、回复长度和任务类型等因素如何影响检测效果;(3) LLM生成回复的哪些特征有助于成功或失败的检测。我们的发现表明,基于LLM的检测高度依赖于任务:对于编程任务和较长的反思性回复,检测显著更可靠,但对于简答题,LLM经常判定自己的输出比真实学生回复更像人类。我们进一步发现,提示框架和回复冗长度对反思写作任务的可检测性有显著影响,相对较小的提示变化会大幅降低检测准确性,而与编程相关的检测对提示变化更为稳健。这些结果共同凸显了LLM在教育环境中自我检测的潜力与局限,并提醒我们在依赖LLM作为识别AI生成学生作业的独立工具时应保持谨慎。 ###### 关键词: 生成式AI,大型语言模型,检测 ## 1 引言 大型语言模型(LLM)正越来越多地嵌入教育场景。除了被学生用于起草书面回复[10 (https://arxiv.org/html/2607.20446#bib.bib27)]或在编程课程中生成代码[11 (https://arxiv.org/html/2607.20446#bib.bib28)]之外,LLM目前还被探索用作评分者、反馈提供者以及为研究和工具开发生成合成学生数据[7 (https://arxiv.org/html/2607.20446#bib.bib30),18 (https://arxiv.org/html/2607.20446#bib.bib29),12 (https://arxiv.org/html/2607.20446#bib.bib15)]。特别是在合成数据生成方面,LLM生成的输出在结构和分布上都需要与真实学生作品高度相似[16 (https://arxiv.org/html/2607.20446#bib.bib31)]。然而,这一目标与并行进行的区分AI生成输出与真实学生作品的努力共存在。 在高等教育领域,对AI生成内容检测方法的兴趣日益增长。大学收到的学术诚信举报大幅增加,其中成千上万起与疑似使用AI有关[4 (https://arxiv.org/html/2607.20446#bib.bib25)]。检测方法的可靠性也引发了担忧。一些教师直接依赖LLM输出来确定作者身份,导致错误的学术不端指控[3 (https://arxiv.org/html/2607.20446#bib.bib26)]。常用的基于分类器的检测工具(包括GPTZero等系统)也被证明不稳定且不一致[17 (https://arxiv.org/html/2607.20446#bib.bib24)]。虽然水印方法已被提出,但它们尚未广泛可用,并且在某些场景下(如代码生成)被证明非常脆弱[25 (https://arxiv.org/html/2607.20446#bib.bib23)]。 尽管兴趣日益增加,但关于LLM在真实教育任务环境中检测自身输出能力的研究相对较少。特别是,自检测性能在编程、反思写作和简答回复等不同领域的变化,以及提示框架和回复长度等因素如何影响可检测性,这方面的研究有限。在本文中,我们探索以下研究问题: - • RQ1:LLM在不同教育任务领域(编程、反思和简答回复)中检测自身生成内容的准确度如何? - • RQ2:提示框架、回复长度和任务类型如何影响LLM自检测性能? - • RQ3:LLM生成回复的哪些特征有助于成功或失败的检测? ## 2 相关工作 随着大型语言模型(LLM)越来越多地被用于生成跨多个领域的广泛内容,人们越来越关注检测LLM生成材料的能力[27 (https://arxiv.org/html/2607.20446#bib.bib16)]。这是一个关键问题,原因很多,包括防止 misinformation 以及在对人类作者身份有要求的场景(如许多教育场景)中保持问责制[20 (https://arxiv.org/html/2607.20446#bib.bib17),15 (https://arxiv.org/html/2607.20446#bib.bib18)]。此外,还有 Shumailov 等人[23 (https://arxiv.org/html/2607.20446#bib.bib12)]提出的模型崩溃问题,即当LLM在包含自身生成内容的数据上训练时,会丧失表示原始人类文本分布的能力。随着AI生成文本变得越来越复杂,检测任务的难度也在增加。传统方法往往依赖于水印技术、统计分析检测器和基于神经网络的检测器的创新[14 (https://arxiv.org/html/2607.20446#bib.bib19),1 (https://arxiv.org/html/2607.20446#bib.bib20),27 (https://arxiv.org/html/2607.20446#bib.bib16)]。 ### 2.1 LLM自检测 最近的研究还探索了LLM本身能否成为LLM生成内容的有效检测器。例如,Zhu 等人提出了一种零样本黑盒检测方法,利用 ChatGPT 修订文本,然后测量原始版本与修订版本之间的相似度[28 (https://arxiv.org/html/2607.20446#bib.bib21)]。他们方法背后的直觉是,ChatGPT 对 LLM 生成文本的修订会比人类撰写的文本少,因为 LLM 输出更符合这些模型学到的统计模式和生成逻辑。类似地,Wang 等人将指令微调应用于开源 LLM,用于文档级和句子级检测[26 (https://arxiv.org/html/2607.20446#bib.bib22)]。当应用于 LLM 生成的中文文本时,他们发现指令微调的 LLM 显著优于传统分类器。其他近期工作表明,未经修改的模型(如 GPT-4 和 Llama 2)在区分自己生成的内容与其他 LLM 和人类生成的内容方面具有非平凡的准确度[22 (https://arxiv.org/html/2607.20446#bib.bib10)]。Steyvers 等人关注人类对AI生成回复的信任与LLM传达其预测正确可能性方式之间的一致性[24 (https://arxiv.org/html/2607.20446#bib.bib13)]。他们的发现表明,改进不确定性沟通可以提高LLM生成内容检测的可靠性,尤其是在教育和专业场景中。 ### 2.2 挑战与基准 Gressel 等人提出了一个检测AI生成回复的基准,测试了显式和隐式检测策略[6 (https://arxiv.org/html/2607.20446#bib.bib3)]。他们发现显式检测成功率更高,而隐式挑战(即给LLM提供提示引导其伪装输出)则显著更难。Najjar 等人使用可解释AI方法将文本分类为人类或LLM生成,在直接复制和更微妙的抄袭形式上均优于一些训练过的检测工具(如 GPTZero)[19 (https://arxiv.org/html/2607.20446#bib.bib6)]。 在计算教育背景下,Hoq 等人提出了一种基于机器学习的方法来检测 CS1 课程中的 ChatGPT 生成代码提交,使用传统 ML 和基于 AST 的深度学习模型实现了超过90%的准确率[9 (https://arxiv.org/html/2607.20446#bib.bib9)]。他们的发现表明,即使采用旨在模仿新手程序员的提示变化,ChatGPT 生成的代码在结构上仍然与学生代码不同。他们观察到,代码结构提供了可检测的签名,能够区分学生作品与AI生成的解决方案,这强化了LLM可以被训练在结构化领域检测自身输出的观点。相比之下,Orenstrakh 等人评估了计算教育中的八个 LLM 生成文本检测器,注意到基于代码的提交和非英语文本的检测准确率有所下降[21 (https://arxiv.org/html/2607.20446#bib.bib7)]。 ### 2.3 偏见与虚假信息 其他工作更明确地关注偏见和检测虚假信息。Chen 等人探讨了检测 LLM 生成虚假信息的挑战,表明由于欺骗性风格,这类内容通常比人类撰写的虚假信息更难检测[5 (https://arxiv.org/html/2607.20446#bib.bib2)]。他们提出了一个 LLM 生成虚假信息的分类法,并强调了稳健检测框架的必要性。Lin 等人调查了基于 LLM 的检测系统中的偏见,揭示了政治和语言偏见可能影响分类准确性[13 (https://arxiv.org/html/2607.20446#bib.bib5)]。他们提出了去偏见技术以提高AI生成内容检测的公平性。除了简单的检测,Achintalwar 等人专注于识别 LLM 生成内容中的风险,如偏见、幻觉、毒性以及虚假信息,而不是区分 AI 生成文本与人类撰写的文本[2 (https://arxiv.org/html/2607.20446#bib.bib1)]。他们引入了一个紧凑分类器库,可以独立于底层 LLM 运行,从而实现可扩展的 AI 安全措施。 ## 3 方法 \\描述 你已经学习 MATLAB 6 周了,并且刚刚开始学习 C 编程语言。你会注意到有些东西不同,有些相似。也许你觉得学习另一种语言更容易,因为你已经理解了基本编程原理,或者你觉得更难,因为有些东西的工作方式与你熟悉的不同。每个人都会有不同体验。 在本练习中,请用你自己的话写一篇简短的反思性文章(从几个句子到几个段落不等),描述你在学习新语言过程中的感受。与 MATLAB 相比,学习 C 时你觉得什么更容易,什么更难? 你已经学习 MATLAB 6 周了,并且刚刚开始学习 C 编程语言。你会注意到有些东西不同,有些相似。也许你觉得学习另一种语言更容易,因为你已经理解了基本编程原理,或者你觉得更难,因为有些东西的工作方式与你熟悉的不同。每个人都会有不同体验。 在本练习中,请用你自己的话写一篇简短的反思性文章(从几个句子到几个段落不等),描述你在学习新语言过程中的感受。与 MATLAB 相比,学习 C 时你觉得什么更容易,什么更难? 图 1:反思:一项引导学生在入门编程课程中反思从 MATLAB 过渡到 C 的练习。\\描述 \[反思提示\]反思提示 \\描述 一张图展示了两个代码片段示例,除了间距不同外完全相同。学生被问到:‘用一句话,为什么你认为你上面选择的代码更容易阅读? 你现在已经看到了很多代码示例。下面展示的两个示例除了使用的间距外完全相同。 参考标题 用一句话,为什么你认为你上面选择的代码更容易阅读? 图 2:简答:一项引导学生对提供的代码片段的可读性进行一句话长度回复的练习。\\描述 \[可读性提示\]可读性提示 \\描述 定义一个名为 `SignBalance()` 的函数,它接收一个输入:一个整数数组。该函数应确定数组中(直到第一个 0 元素的位置)正数多还是负数多。计算时,应检查数组中直到第一个 0 值出现的每个值。如果正数多于负数,返回 1。如果负数多于正数,返回 -1。如果正数和负数数量相等,返回 0。函数原型声明如下: int SignBalance(int values[]) 定义一个名为 `SignBalance()` 的函数,它接收一个输入:一个整数数组。该函数应确定数组中(直到第一个 0 元素的位置)正数多还是负数多。计算时,应检查数组中直到第一个 0 值出现的每个值。如果正数多于负数,返回 1。如果负数多于正数,返回 -1。如果正数和负数数量相等,返回 0。函数原型声明如下: int SignBalance(int values[]) 图 3:编程 1:涉及循环和数组的练习,答案需用 C 语言指定。\\描述 \[编程提示 1\]编程提示 1 \\描述 编写一个函数,接收两个字符串作为输入:要检查的单词和用于检查的模式。函数原型声明如下: int WordMatchesPattern(char *word, char *pattern) 仅当字符串“word”是字符串“pattern”的可能完成时,函数才返回 true。“pattern”字符串是一个部分单词,其中某些字符已替换为连字符(-)。如果所有不对应连字符的字符都匹配,并且两者长度相同,则“word”将是“pattern”的有效完成。 编写一个函数,接收两个字符串作为输入:要检查的单词和用于检查的模式。函数原型声明如下: int WordMatchesPattern(char *word, char *pattern) 仅当字符串“word”是字符串“pattern”的可能完成时,函数才返回 true。“pattern”字符串是一个部分单词,其中某些字符已替换为连字符(-)。如果所有不对应连字符的字符都匹配,并且两者长度相同,则“word”将是“pattern”的有效完成。 图 4:编程 2:涉及字符串匹配的练习,答案需用 C 语言指定。\\描述 \[编程提示 2\]编程提示 2 ### 3.1 背景与数据 我们分析来自一所大学的学生提交
相似文章
LLMs判断能力是否强于生成能力?评估上下文问答中的任务不对称性、机制可解释性与可迁移性
本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
使用“经典”机器学习检测LLM生成的文本
一位开发者探索使用经典机器学习来检测LLM生成的网络小说,创建了一个开源演示和模型,单句准确率约为85%。
LLM-as-a-Discriminator:当合成表格看起来仍然真实
本文提出了一种基于LLM鉴别的方法,用于审计合成表格数据的隐私,通过让LLM将样本分类为真实或合成,表明LLM鉴别可以作为一种实用的隐私审计信号。
@rohanpaul_ai: LLM 常常无法判断攻击是否导致它们说出了不安全的内容。询问一个 LLM 它自己之前的回答是否……
本文研究了 LLM 是否能够可靠地自我报告其输出被对抗性预填充篡改的情况,发现模型通常无法区分被篡改的输出和故意的输出,其有限的识别能力源自正常的拒绝行为,而非真正的自我意识。