精细调整与小众AI模型 vs AI检测器
摘要
本文批评了如Pangram和GPTZero等AI检测器在面对精细调整的AI模型时准确率低,并引用了一项研究表明读者更喜欢基于受版权保护的书籍训练的AI输出。
尽管Pangram及其客户都在为能够宣称近乎完美的检测率和几乎没有误报而互相庆祝,但对我们来说,重要的是不要轻信魔术师的话,而要探究其背后。我稍作调查,发现了一些商业可用的模型,这些模型可以精细调整以模仿你选择的作家的写作风格。我只能想象,提示其中一个模型将你的框架想法转化为像Conrad或Faulkner那样有价值的作品会有多令人陶醉,但我不会批评用户。我想做的是关注大公司如何通过假设你不会深入调查其断言来掩盖其解决方案中的明显漏洞。那么,让我们看一些数字。Pangram可以宣称对普通LLM在特定风格提示下有97%的准确率,GPTZero有91%。记住,这些是AI检测器,它们的目的是检测AI。幸运的是,在正常情况下,它们以极低的误报率(基本上为零)做到这一点,假设我们不把英语学习者和自闭症谱系的人混进来,但现在我们不讨论这些。但是,面对精细调整的模型,这些模型训练以模仿特定作者或作品集,Pangram,检测器的宠儿,准确率降至3%,GPTZero降至0%。我可以发布精细调整模型的链接,但我不想给他们带来更多业务。简而言之,Houston我们遇到问题了。读者更喜欢基于受版权保护的书籍训练的AI输出而非人类专家作家 Chakrabarty, Ginsburg and Dhillon Stony Brook University, Columbia Law, MIT 附图是本文原始和人类创作的证据。
相似文章
基础模型被AI检测器视为人类
这篇论文揭示,GPTZero和Pangram等商用AI检测器将基础语言模型生成的文本判定为几乎完全是人类撰写,而经过指令微调的模型输出则被标记为AI生成。作者提出了HIP,一种与检测器无关的迭代改写流程,能在保持语义的同时提升文本的类人性。
Pangram已成为AI检测的黄金标准。你是否应该信任它?
本文探讨了Pangram,一家检测AI生成文本的AI初创公司,它在出版丑闻中的角色,以及对其检测模型可信度的质疑。
AI检测器能发现模式,但仍无法听见作者的声音。
本文批评AI检测工具依赖表面模式,容易误判人类写作,特别是经过润色的作品,并指出它们未能捕捉到个人作家的独特声音。
放大而非学习:微调后的AI文本检测器放大预训练方向
本文表明,微调后的AI文本检测器放大了预训练的典型性轴,而非学习AI与人类之间的界限,原始编码器投影通常达到或超过微调后的性能。
Pangram的Max Spero谈为何AI检测比‘真或假’更难
本文探讨了AI检测的挑战,介绍了Pangram的创业努力,包括一轮900万美元的融资以及与Substack的合作,以识别AI生成的内容。