NeurIPS决定已出。我核查了自己的Pangram文章,而Pangram自己的报告改变了叙述 [N]

Reddit r/MachineLearning 新闻

摘要

作者核查了自己之前关于NeurIPS 2026立场轨道决定和Pangram AI检测的帖子,纠正了早期错误,并提供了更新的基准测试和报告。

三周前我在这里发布了关于NeurIPS立场轨道/Pangram的故事。决定在24日公布,所以我回溯到原始资料。我说过的一些内容有误——79篇论文的层级并非“0.8 + 独立作者”。而是0.8加上多个独立提交的投稿,或者一个作者有另一个桌面拒绝(表5:https://blog.neurips.cc/2026/06/02/ai-generated-papers-in-the-neurips-2026-position-paper-track/)——22篇论文的层级也捕获了那些将AI声明留空的作者,而不仅仅是那些否认使用AI的作者。——“独立研究者”指的是一个人,Sergey Berezin,并且他明确没有声称主席论文是如何撰写的(https://www.linkedin.com/pulse/we-shouldnt-desk-reject-papers-based-unvalidated-ai-sergey-berezin-orc6e)——61%的ESL数字来自2023年,并测试了七个*其他*检测器(https://doi.org/10.1016/j.patter.2023.100779)。Pangram自己的报告显示v3.3.2在89篇相同的TOEFL论文中0个假阳性(供应商数据,未复制)。仍然成立的部分更为有限。Pangram自己的v4报告对v3.3.2进行了基准测试,这正是NeurIPS使用的版本(https://arxiv.org/abs/2607.27183,表28)。在人工撰写、AI润色的同行评审中,它将14.9%(简单子集)和4.5%(困难)标记为完全“AI”,比v3.0和v4都更差。该轨道的政策明确允许润色。一篇ICML 2026论文以名称讨论了拒绝情况,并表示每窗口的假阳性率不应“以任何方向”外推到整篇论文(https://arxiv.org/abs/2603.20450)。尚未公开:123篇条件论文中有多少被清除。完整报告包含图表和所有来源:https://strictcite.com/blog/neurips-2026-position-paper-results-pangram-fact-check
查看原文

相似文章

推出Pangram 4(2分钟阅读)

TLDR AI

Pangram Labs宣布推出Pangram 4,这是其迄今为止最强大的AI检测器,大幅降低了假阳性率和假阴性率,在前沿模型上实现稳健检测,并新增图像扫描功能。

Pangram 4 技术报告

arXiv cs.CL

Pangram Labs 推出 Pangram 4,这是一款最先进的 AI 文本检测模型,AUROC 达到 0.9916,误报率和漏报率极低,并且提高了对对抗性攻击的鲁棒性以及混合作者身份的检测能力。

**解释全字母句** 在英语中,**全字母句**是指包含字母表中所有字母的句子,且通常每个字母只出现一次。经典例子是:"The quick brown fox jumps over the lazy dog"(这只敏捷的棕色狐狸跳过了那只懒狗)。 让我们通过一些例子来理解: ### 简单例子 - "Pack my box with five dozen liquor jugs"(用五打酒瓶装满我的箱子) - "How vexingly quick daft zebras jump"(斑马跳得多么敏捷而古怪,真令人恼火) ### 代码中的应用 在编程或测试中,全字母句常用于验证字符处理功能。例如: ```python # 检查一个字符串是否包含所有字母 def is_pangram(sentence): alphabet = set('abcdefghijklmnopqrstuvwxyz') return alphabet.issubset(set(sentence.lower())) ``` ### 趣味事实 全字母句不仅有用,还能成为语言游戏和打字练习的工具。你也可以尝试自己创造一个全字母句!

Armin Ronacher

这篇文章讨论了Pangram检测器将David Sacks的推文识别为AI生成内容的事件,引发了关于AI检测工具的辩论,其中包含利用大语言模型模仿人类写作的实验案例。