基础模型在AI检测器中像人类
摘要
一项研究发现,基础语言模型在AI检测器中看起来像是人类写的,而经过指令微调的模型则不然。作者提出了一种名为HIP的改写管道,该管道能在不同模型规模下提高文本的人类相似度,同时保持语义。
查看缓存全文
缓存时间: 2026/05/20 22:40
论文页面 - 基础模型对AI检测器而言更像人类
来源:https://huggingface.co/papers/2605.19516
摘要
指令微调语言模型生成的文本会被商业检测器判定为非人类,这促使我们开发了一种释义流水线,能在提升类人性的同时保持语义,适用于不同规模的模型。
随着AI生成文本大规模进入现实世界,机构越来越多地使用商业AI文本检测器,特别是在教育和学术诚信工作流中。我们报告了一个关于此类系统的惊人实证发现:当使用GPTZero和Pangram进行评估时,基础模型生成的文本往往被判定为极其类人,而经过指令微调的对应模型生成的文本则并非如此。基于这一观察,我们提出了迭代释义人性化方法(HIP),这是一种与检测器无关的流水线,它通过少量微调将基础模型变为释义器,并迭代应用。与我们测试的基线方法相比,HIP在商业检测器上实现了语义保持与检测规避之间更强的权衡。在Llama-3和Qwen-3系列(涵盖0.6B到70B的模型规模)中,HIP一致地提升了检测器的类人评分。我们的发现表明,当前检测器追踪的是指令微调和局部上下文的痕迹,而非任何不变的机器生成文本特征。这进而要求检测器设计更显式地对这些因素进行建模。
查看arXiv页面(https://arxiv.org/abs/2605.19516)
查看PDF(https://arxiv.org/pdf/2605.19516)
GitHub(https://github.com/YixuanEvenXu/humanization-by-iterative-paraphrasing)
添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.19516)
在你的代理中获取此论文:
hf papers read 2605.19516
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型(14个)
YixuanEvenXu/Llama-3-70B-HIP-adapter 文本生成 • 更新于约18小时前 • 13 🔥(https://huggingface.co/YixuanEvenXu/Llama-3-70B-HIP-adapter)
YixuanEvenXu/Llama-3-70B-Instruct-HIP-adapter 文本生成 • 更新于约18小时前 • 10 🔥(https://huggingface.co/YixuanEvenXu/Llama-3-70B-Instruct-HIP-adapter)
YixuanEvenXu/Llama-3-8B-HIP-adapter 文本生成 • 更新于约18小时前 • 10 🔥(https://huggingface.co/YixuanEvenXu/Llama-3-8B-HIP-adapter)
YixuanEvenXu/Llama-3-8B-Instruct-HIP-adapter 文本生成 • 更新于约18小时前(https://huggingface.co/YixuanEvenXu/Llama-3-8B-Instruct-HIP-adapter)
浏览14个引用该论文的模型(https://huggingface.co/models?other=arxiv:2605.19516)
引用该论文的数据集(1个)
YixuanEvenXu/HIP-training-and-evaluation-data 查看器 • 更新于约18小时前 • 11.1k • 9 🔥(https://huggingface.co/datasets/YixuanEvenXu/HIP-training-and-evaluation-data)
引用该论文的Space(0个)
无Space链接此论文
请在Space的README.md中引用 arxiv.org/abs/2605.19516,以便从此页面链接。
包含该论文的收藏(0个)
无收藏包含此论文
请将此论文添加至收藏(https://huggingface.co/new-collection)以从此页面链接。
相似文章
基础模型被AI检测器视为人类
这篇论文揭示,GPTZero和Pangram等商用AI检测器将基础语言模型生成的文本判定为几乎完全是人类撰写,而经过指令微调的模型输出则被标记为AI生成。作者提出了HIP,一种与检测器无关的迭代改写流程,能在保持语义的同时提升文本的类人性。
AI生成诗歌中的人性化特征刻画:一项零样本分类研究
本文提出了一种零样本检测流水线,用于刻画AI生成诗歌中的人性化特征,旨在识别区分人类与机器诗歌的属性,并改进检测方法。
大型语言模型中的类人回指消解
本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。
如果大语言模型具有类人属性,那么《帝国时代II》也具有
本文认为,将类人属性归因于大语言模型是有问题的,因为类似的论断也可用于更简单的系统,例如在《帝国时代II》上训练的人工智能,并提出了非唯一性的零假设以避免循环推理。
人类认知与行为的小型基础模型
本文在Psych-101数据集上训练了14个小语言模型(参数规模从1.35亿到140亿),该数据集包含来自160个实验的1070万次逐试次人类选择。研究发现,小型模型足以匹配分布内数据,而大型模型在分布外泛化方面表现更好。诊断结果表明,遮蔽刺激和反馈会破坏大部分已学信息,表明仅凭选择历史是不够的。