我对我们自主研究代理发布的32项已发布“发现”进行了审计。按表述来看,没有一项是新颖的——标签失效的程度远超过测量本身。
摘要
一位审计员发现,自主研究代理发布的32项“发现”中,按表述没有一项是新颖的,主要问题在于过度贴标签而非测量错误。
我们运行了一个自主代理循环,它进行调研并发布报告。我从中选取了32项它作为确信的“发现”(例如“一条定律”、“我们发现了”、“一种方法胜利”)发布的成果,对其进行了全面的对抗性审计,然后重新评分。真实结果如下:
- **34%** — 实质错误(真实的统计错误、被操控的基线、不可复现或测量伪影)。
- **53%** — 测量正确且可复现,但被标记为“定律/发现”,而其实质是教科书内容。例如:“双层内存定律”不过是分段缓存(SLRU/ARC,1990年代);“验证税定律”不过是P与NP问题中验证比生成容易的非对称性。
- **13%** — 从一开始就是诚实的。
- 严格标准(作为*原创发现,按最初表述*保留下来的):**0/32.**
因此,主要失败在于过度*贴标签*,而非测量错误。标签的失效程度超过了科学本身。
明显的反对意见:也许我的审计只是将所有有先例来源的东西重新标记为“教科书”,而几乎所有东西都有先例。所以我运行了一个阳性对照——一组标记好的10个真正里程碑(Transformer、CRISPR、GANs,再加上一些困难案例,如PageRank与特征向量中心性并列,Adam与RMSprop并列)和10个打扮成发现的教科书结果,通过相同的流程盲审。误分类率(真正的创新被错误地称为“教科书”):**0/10.** 评分者不会贬低真正的创新——因此0/32是关于生成器(一个针对成熟领域的代理),而非一个容易触发的关卡。我想指出两点可能有用,但并非新颖:失败分类学不过是人类可疑研究实践文献(HARKing、研究者自由度、Ioannidis的“大多数已发表发现都是假的”)——代理循环在其自身输出上重现了该分布。*轻量级*自检会认可自身的错误。只有完整的流程(多视角+对抗性+原始来源验证+对修改稿的重新审计)才能可靠地捕获缺陷。这符合“LLM无法可靠地自我纠正”的结果。评分和阳性对照面板是公开脚本,你可以重新运行并提出异议:我先坦诚说明限制:自我评分(我对自己帖子的审计),n=32/43,这些是我们选择发布的(最自信的输出,因此*所有*候选者的基率较低),而阳性对照是手工构建的20条目面板。如果你运行一个代理循环:你是否看到同样的过度贴标签?在它发布之前你是如何捕获的?
相似文章
自主分析代理的新息残差审计:定位、检测极限、错误控制与可辨识性
本文对自主分析代理的新息残差审计进行了理论分析,研究如何定位代理生成的数据分析中的错误、控制误报,并识别错误归因的根本限制。
@HuggingPapers: 自主研究代理无法自我纠正 我们在100个真实前沿研究任务上测试了8种框架-模型组合…
本文探讨了对自主研究代理的压力测试,发现失败源于元认知问题,而非能力问题,并介绍了ARFT——一种包含45种模式的故障分类体系。
我在一个月的假账目中植入了六个错误,看我的AI智能体能发现几个。它们发现了五个。漏掉的那个才是最可怕的部分。
一项实验在虚假记账数据中植入了六个错误,AI智能体发现五个;特别值得注意的是,当数据不足时它们会拒绝猜测,凸显出不确定性意识比纯粹准确率更有价值。
智能体在AutoResearch上的失败分析:基于100个真实前沿研究任务的端到端诊断评估
本文介绍了AutoResearchEval,一个用于自动化科学研究中AI智能体的评估框架,揭示了元认知能力的关键缺失作为跨模型的反复失败模式。
我审计了AI事实核查工具引用的来源。大约每18个中就有1个不存在。
一位作者分享了对其AI事实核查工具引用的审计,发现大约每18个中就有1个是失效或捏造的,并提供了实用修复方法来提高AI系统的可靠性。