基于Qwen 0.8b在Pangram数据集上微调的AI内容检测器
摘要
在Pangram的EditLens数据集上微调Qwen 0.8B,创建了一个快速、本地的AI内容检测器,并以'Slop Hammer' Chrome扩展形式发布。
我使用Pangram论文EditLens提供的数据集微调了Qwen 3.5 0.8B。该模型通过[Chrome扩展](https://chromewebstore.google.com/detail/slop-hammer/gfjdmhfokmhedlgfggmmgchpppmhkdgg)提供;你只需选中文本,它就会给出文本由AI生成的概率分布。在我的M1 MacBook Pro上,这一过程不到1秒。Pangram确实发布了基于其数据集训练的Llama 3.2 3B模型,但我认为该模型略有过时(对于其能力来说太大)。Qwen 0.8B(基础版)在经过大约20小时的单张RTX 3090微调后表现同样出色。我还尝试过Qwen 2B和Gemma 4 e2b及e4b,但Qwen 3.5 0.8B似乎足以胜任此任务,坦白说,在我发布时使用的检查点上取得了最佳结果。以下是Chrome扩展的链接(我称之为Slop Hammer 😅)。安装后,它将允许你从Hugging Face下载模型(约400MB),此后所有操作均在本地进行:[https://chromewebstore.google.com/detail/slop-hammer/gfjdmhfokmhedlgfggmmgchpppmhkdgg](https://chromewebstore.google.com/detail/slop-hammer/gfjdmhfokmhedlgfggmmgchpppmhkdgg)。以下是onnx格式的模型:[https://huggingface.co/Slomin/slop\_hammer\_0\_8\_b/tree/main](https://huggingface.co/Slomin/slop_hammer_0_8_b/tree/main)。小提示:由于Pangram EditLens数据集的限制,该模型采用CC-BY-NC-SA-4.0许可。如果有人感兴趣,这里是Pangram的论文:[https://arxiv.org/abs/2510.03154](https://arxiv.org/abs/2510.03154) ——这是一种相当有趣的方法(使用4个分布桶而非单一的0-1浮点数神经元)。局限性主要在于他们开源的数据集是用较旧的LLM模型创建的。例如,它对GPT-5.5会有些混淆(但仍会显示为AI编辑过,而非纯人工书写)。浏览如LinkedIn或*某些*subreddit等充斥低质内容(slop)的网站时,效果相当搞笑……
相似文章
推出Pangram 4(2分钟阅读)
Pangram Labs宣布推出Pangram 4,这是其迄今为止最强大的AI检测器,大幅降低了假阳性率和假阴性率,在前沿模型上实现稳健检测,并新增图像扫描功能。
随着AI内容充斥互联网,Pangram筹集900万美元用于检测
Pangram筹集900万美元用于检测AI生成内容,推出新的文本和图像检测模型,识别AI辅助写作的准确率超过99%。
Pangram 4 技术报告
Pangram Labs 推出 Pangram 4,这是一款最先进的 AI 文本检测模型,AUROC 达到 0.9916,误报率和漏报率极低,并且提高了对对抗性攻击的鲁棒性以及混合作者身份的检测能力。
探索Pangram 3.3.2的内部表示
Pangram Labs探索其AI检测模型Pangram 3.3.2的内部表示,分析模型如何在不同层中区分人工文本与AI文本,使用来自多种来源的5,000份文档的平衡数据集。
@Dinosn: 我尝试了一个本地AI模型(Qwen 3.6 27b)进行安全研究,效果出奇地好。
作者测试了一个本地AI模型(Qwen 3.6 27b)进行安全研究,发现其效果出奇地好,在发现PHPIPAM LFI漏洞方面优于Semgrep和云端AI代理等其他方法。