展示而非告知:可解释的AI生成文本检测
摘要
介绍TELL,一种AI生成文本检测系统,它在提供数值评分的同时给出可解释的标注,实现了具有竞争力的AUROC 0.927,并允许用户根据高亮的文本指标判断作者身份。
查看缓存全文
缓存时间: 2026/06/03 03:35
论文页面 - 展示,而非告知:可解释的AI生成文本检测
来源:https://huggingface.co/papers/2605.27921
摘要
本文介绍了一种名为 TELL 的新型AI生成文本检测系统,它将高性能检测与原生可解释性相结合,通过展示具体的文本指示标记来帮助用户对作者身份做出明智的判断。
关于AI生成文本检测 (https://huggingface.co/papers?q=AI-generated%20text%20detection) 的研究已经提出了多种区分人类与AI文本的方法,其中一些在分布内数据上取得了较高性能。然而,其实际应用却停滞不前,因为输出与用户(如教授)的需求不匹配——用户只看到一个没有附带解释的数值分数。我们通过一种新颖架构 TELL 来解决这一问题,该架构从底层就融入了可解释性 (https://huggingface.co/papers?q=explainability)。尽管为了可比性,我们的系统仍然像其他检测器一样提供数值分数,但 TELL 采取了根本不同的方法:我们旨在向用户展示模型认为文本是AI或人类写作的“标记”,使用户能够根据自己的判断和对写作上下文以及疑似作者的理解来决定谁写了该文本。我们在一个特定领域的作者身份标注自定义 SFT 数据集 (https://huggingface.co/papers?q=SFT%20dataset) 上训练 TELL,并使用 GRPO (https://huggingface.co/papers?q=GRPO) 结合课程学习 (https://huggingface.co/papers?q=curriculum%20learning) 进一步优化系统以提升性能。我们取得了与最先进检测器相竞争的性能(AUROC (https://huggingface.co/papers?q=AUROC) 0.927),同时原生提供了解释检测器决策依据的标注。我们进一步利用人类标注数据集评估了解释的质量,并在标注的具体性、可证伪性、连贯性、合理性和依据性方面报告了较高的胜率(平均72.3%),允许用户进行批判性思考并自行判断。因此,我们的工作从以人为中心 (https://huggingface.co/papers?q=human-centric%20perspective) 的角度重新定义了AI生成文本检测问题,并为聚焦于原生可解释性 (https://huggingface.co/papers?q=explainability) 的新型检测器家族铺平了道路。
查看 arXiv 页面 (https://arxiv.org/abs/2605.27921) 查看 PDF (https://arxiv.org/pdf/2605.27921) 项目页面 (https://ai-tells.tech/) GitHub (https://github.com/ACMCMC/TELL) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.27921)
引用本文的模型 (0)
没有模型链接到此论文
请在一个模型 README.md 中引用 arxiv.org/abs/2605.27921 以从此页面链接。
引用本文的数据集 (2)
suraj-ranganath/tell-human-detectors 查看器•约2小时前更新 • 300 • 129 (https://huggingface.co/datasets/suraj-ranganath/tell-human-detectors)
suraj-ranganath/unified_tell_dataset 预览•约2小时前更新 • 70 (https://huggingface.co/datasets/suraj-ranganath/unified_tell_dataset)
引用本文的 Spaces (0)
没有 Space 链接到此论文
请在一个 Space README.md 中引用 arxiv.org/abs/2605.27921 以从此页面链接。
包含本文的收藏 (0)
没有收藏包含此论文
请将此论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从此页面链接。
相似文章
Counter Turing Test 的发现:AI生成文本检测
本文介绍了 Counter Turing Test 共享任务在AI生成文本检测方面的发现,顶级系统在二分类任务中达到了完美表现,但在模型归因方面性能显著较低,突显了区分不同大语言模型输出的难度。
人们能在75%的情况下检测出AI生成的文本
UnslopAI的一项测试显示,读者能在75%的情况下识别出AI生成的文本,这凸显了让AI写作听起来更人性化、以避免搜索引擎惩罚并保持真实性的必要性。
AI生成文本检测中语言特征的系统性分析:跨领域与跨模型研究
一项大规模实证研究对284个语言特征在27个大语言模型和10个文本领域中的表现进行了分析,以评估哪些特征能够可靠地检测AI生成文本。研究发现,词汇丰富度指标是跨领域和跨模型最稳健的信号,而许多其他已提出的指标则高度依赖具体上下文。
AEyeDE:一种基于注意力归因的AI生成文本检测框架
AEyeDE是一个基于注意力归因的框架,它使用代理Transformer模型从文本中提取注意力图,并训练轻量级CNN来区分人类撰写与AI生成的文本,性能优于纯文本基线,并且在各种设置下表现出鲁棒性。
用于识别AI生成文本的新型分类器
# 用于识别AI生成文本的新型分类器 来源:[https://openai.com/index/new-ai-classifier-for-indicating-ai-written-text/](https://openai.com/index/new-ai-classifier-for-indicating-ai-written-text/) 我们认识到,在教育工作者中,识别AI生成的文本一直是一个重要的讨论话题,同样重要的是认识到AI文本分类器在课堂中的局限性和影响。我们开发了一个[初步资源\(在新窗口中打开\)](ht