基础模型在AI检测器中像人类

Hugging Face Daily Papers 论文

摘要

一项研究发现,基础语言模型在AI检测器中看起来像是人类写的,而经过指令微调的模型则不然。作者提出了一种名为HIP的改写管道,该管道能在不同模型规模下提高文本的人类相似度,同时保持语义。

随着AI生成的文本大规模进入现实世界,越来越多的机构开始使用商业AI文本检测器,尤其是在教育和学术诚信工作流程中。我们报告了一个关于此类系统的令人惊讶的实证发现:当使用GPTZero和Pangram进行评估时,基础模型生成的文本通常被判定为高度像人类,而经过指令微调的同系列模型生成的文本则不然。基于这一观察,我们提出了迭代改写人性化(HIP)方法,这是一种与检测器无关的管道,它对基础模型进行最小微调,使其成为改写器,并迭代应用。与我们测试的基线相比,HIP在商业检测器上的语义保持与规避检测之间取得了更好的权衡。在Llama-3和Qwen-3系列中,模型规模从0.6B到70B,HIP一致地提高了检测器的人类相似度。我们的发现表明,当前的检测器追踪的是指令微调和局部上下文的痕迹,而不是任何不变的机器生成文本概念。这反过来要求检测器设计更明确地建模这些因素。
查看原文
查看缓存全文

缓存时间: 2026/05/20 22:40

论文页面 - 基础模型对AI检测器而言更像人类

来源:https://huggingface.co/papers/2605.19516

摘要

指令微调语言模型生成的文本会被商业检测器判定为非人类,这促使我们开发了一种释义流水线,能在提升类人性的同时保持语义,适用于不同规模的模型。

随着AI生成文本大规模进入现实世界,机构越来越多地使用商业AI文本检测器,特别是在教育和学术诚信工作流中。我们报告了一个关于此类系统的惊人实证发现:当使用GPTZero和Pangram进行评估时,基础模型生成的文本往往被判定为极其类人,而经过指令微调的对应模型生成的文本则并非如此。基于这一观察,我们提出了迭代释义人性化方法(HIP),这是一种与检测器无关的流水线,它通过少量微调将基础模型变为释义器,并迭代应用。与我们测试的基线方法相比,HIP在商业检测器上实现了语义保持与检测规避之间更强的权衡。在Llama-3和Qwen-3系列(涵盖0.6B到70B的模型规模)中,HIP一致地提升了检测器的类人评分。我们的发现表明,当前检测器追踪的是指令微调和局部上下文的痕迹,而非任何不变的机器生成文本特征。这进而要求检测器设计更显式地对这些因素进行建模。

查看arXiv页面(https://arxiv.org/abs/2605.19516)
查看PDF(https://arxiv.org/pdf/2605.19516)
GitHub(https://github.com/YixuanEvenXu/humanization-by-iterative-paraphrasing)
添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.19516)

在你的代理中获取此论文:

hf papers read 2605.19516

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型(14个)

YixuanEvenXu/Llama-3-70B-HIP-adapter 文本生成 • 更新于约18小时前 • 13 🔥(https://huggingface.co/YixuanEvenXu/Llama-3-70B-HIP-adapter)

YixuanEvenXu/Llama-3-70B-Instruct-HIP-adapter 文本生成 • 更新于约18小时前 • 10 🔥(https://huggingface.co/YixuanEvenXu/Llama-3-70B-Instruct-HIP-adapter)

YixuanEvenXu/Llama-3-8B-HIP-adapter 文本生成 • 更新于约18小时前 • 10 🔥(https://huggingface.co/YixuanEvenXu/Llama-3-8B-HIP-adapter)

YixuanEvenXu/Llama-3-8B-Instruct-HIP-adapter 文本生成 • 更新于约18小时前(https://huggingface.co/YixuanEvenXu/Llama-3-8B-Instruct-HIP-adapter)

浏览14个引用该论文的模型(https://huggingface.co/models?other=arxiv:2605.19516)

引用该论文的数据集(1个)

YixuanEvenXu/HIP-training-and-evaluation-data 查看器 • 更新于约18小时前 • 11.1k • 9 🔥(https://huggingface.co/datasets/YixuanEvenXu/HIP-training-and-evaluation-data)

引用该论文的Space(0个)

无Space链接此论文

请在Space的README.md中引用 arxiv.org/abs/2605.19516,以便从此页面链接。

包含该论文的收藏(0个)

无收藏包含此论文

请将此论文添加至收藏(https://huggingface.co/new-collection)以从此页面链接。

相似文章

基础模型被AI检测器视为人类

arXiv cs.CL

这篇论文揭示,GPTZero和Pangram等商用AI检测器将基础语言模型生成的文本判定为几乎完全是人类撰写,而经过指令微调的模型输出则被标记为AI生成。作者提出了HIP,一种与检测器无关的迭代改写流程,能在保持语义的同时提升文本的类人性。

大型语言模型中的类人回指消解

arXiv cs.CL

本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。

人类认知与行为的小型基础模型

Hugging Face Daily Papers

本文在Psych-101数据集上训练了14个小语言模型(参数规模从1.35亿到140亿),该数据集包含来自160个实验的1070万次逐试次人类选择。研究发现,小型模型足以匹配分布内数据,而大型模型在分布外泛化方面表现更好。诊断结果表明,遮蔽刺激和反馈会破坏大部分已学信息,表明仅凭选择历史是不够的。