没有通用的幻觉检测器,但有一个通用的底线——预注册,10个模型。来打破它。[R]
摘要
一项预注册研究提出了一种使用内部模型信号跨10个模型进行首token幻觉检测的方法,发现没有通用检测器,但存在一个普遍高于随机水平的底线,并公开了代码和验证脚本。
哟,我不是实验室,也不是博士——只是一个有执念的人:在模型承诺第一个token的那一刻抓住它在编造。一次前向传播,模型冻结,在你看到任何文本之前。我拟合了四类内部信号(注意力形状、残差运动、读出几何、置信度——共29个),让一个诚实的挑选器为每个模型选一个,并在数据存在之前预先注册了一切。两次。
Run 1 — 2个任务,10个模型(20个部署):
- 仅几何检测器通过了其预注册的门槛:18/20(需要≥17)。再加上模型自身的置信度,你得到相同的18/20——同样的两次未命中,零救回——因此更严格的“置信度覆盖更多”的主张(门槛≥19)被证伪。模型的置信度与几何是冗余的。
- 没有通用的最佳信号——在18个有效案例中,有12个不同的信号获胜,因此最佳选择是每个模型+任务各自不同。但存在一个通用的底线:一个固定的组合,在九个模型上校准,并在第十个上测试——每次排除一个模型并对该被排除模型打分,轮转全部十个。仍然在9/10(ANLI)和10/10(TriviaQA)上超过随机水平。
Run 2 — 一个独立的6任务扩展,包括HaluEval-QA(发现幻觉答案):
- 在新任务上按模型校准:10/10超过随机水平。
- 我预注册的那个即插即用检测器——固定信号、固定符号、盲应用——6/10。四次未命中并没有丢失信号;它们把信号读反了(AUROC低至0.17)。相同的几何,符号反转。这是一个通用的拟合过程和高于随机水平的底线——而不是一个可交付的检测器。即使是符号也必须按模型设置。所有已注册的得分矩阵都是公开的;两个预注册判定都可以从它们重新推导,零模型推理(python stage_b/verify_endpoints.py,无需GPU)。请找出漏洞。论文:furnace.baby/cc-paper · 代码:github.com/flowstyleliving/commit-confluence
---
FAQ
“幻觉难道不是量化伪影吗?你运行的是4位模型。” 合理的担忧,所以我为此预注册了一个证伪器:在nf4 → int8 → bf16 → fp32下运行同样的模型,检查信号是否随精度下降而退化。结果没有。在检测器有效的模型上,其数字是精度不变的——所以它测量的是真实计算,而不是舍入噪声。(小模型上的int8波动在32B时消失。)
“我怎么知道你的研究本身不是幻觉?AI辅助,大话连篇。” 一切都可以验证,无需相信我。每个已注册的得分矩阵都是公开的,两个预注册判定都可以从它们零模型推理地重新推导——python stage_b/verify_endpoints.py,无需GPU,逐字节一致地复现摘要。预注册在数据存在之前就被冻结(哈希),使用一个全新的不相交种子,带有打乱标签的对照组,并经过了四轮对抗性评审。如果我错了,矩阵会显示出来。
“你报告了7/20的失败,但说信号没问题。到底是哪个?而且你是不是只重新跑了一个很小的样本?” 这两点我都没有偷懒。Run 2的六个任务中有两个是密封对(ANLI和TriviaQA)的直接复制,但基于全新的、不相交的数据,样本量五倍——n=200 → n=1000——所以这不是小样本的侥幸。原始几何仍然成立:18/18可部署。7/20来自于一个预注册的零错误预算规则:如果几行未能提交到干净的YES/NO第一个token,则整个任务单元作废。诚实的陷阱是:检测器读取提交时刻,因此它假设答案优先的输出——如果模型在回答之前输出了一个换行符或开始思维链,那么该行就算作未提交,即使其最终答案是正确的。1000行中确实只有少数这样的行(一个模型偶尔会推理而不是判断),这就是导致FAIL的原因。该规则在我看到数据之前就已冻结,所以我现在不能软化它——诚实的标题是规则产生的数字7/20,旁边显示原始几何。未来的预注册修订将把一次性小故障与真正的离题推理区分开来;我真心希望有人来看看这个答案优先的约束是正确的选择,还是隐藏的偏袒。
“6/10的迁移失败不正是噪声吗?” 不——这正是有趣的部分。四次未命中并没有丢失信号,而是把信号读反了:AUROC低至0.17,即自信地错误。每个模型在自己的数据上校准后,选择了相反的符号。因此,一个固定的检测器不能盲目地跨模型部署。按模型来看,是10/10。失败特别在于固定符号的迁移,而不是信号本身。
“那些我没有看到门槛的任务呢?” Run 2的六个任务中有三个是探索性的——ANLI第2轮(一个故意更难的NLI轮),以及HaluEval的对话和摘要子集(除QA之外的两种格式的幻觉检测)。根据注册,这些任务没有通过/失败门槛,也不会影响头条主张。但顺便说一句,在按模型校准下,信号在每个任务上都高于随机水平——25个模型-任务单元中的25个,所有置信区间都超过0.5。我没有把它们计入任何判定;我只是没有隐藏它们。
“为什么整个事情没有一个单一的准确率数字?” 因为没有诚实的单一数字。这是三个实验,具有不同的构念和不同的预注册门槛(18/20需要≥17;10/10对比6/10需要≥8;以及7/20的门控规则)。把它们平均将是一个范畴错误——一个单一数字看起来更干净,但含义更少。贯穿始终的不是分数,而是一个主张:没有通用的检测器,但有一个部分迁移的通用底线。
相似文章
OpenHalDet:一种针对多样生成场景下幻觉检测的统一基准
OpenHalDet 是一个用于大语言模型幻觉检测的统一基准,它标准化了跨不同生成场景的评估,并支持黑盒、灰盒和白盒检测方法。
世界模型中的幻觉是可预测且可预防的
本文证明世界模型中的幻觉是一个数据覆盖问题,并提出基于数据的信号来检测它们,以及利用新的MMBench2数据集采用覆盖感知采样技术来减轻幻觉。
PARALLAX: 区分真实幻觉检测与基准构建伪影
本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。
首个Token已知:用于幻觉检测的单次解码置信度
本文介绍了一种利用大语言模型生成首Token的置信度来检测幻觉的方法,该方法仅需执行单次解码步骤。
幻觉起始的最快检测:延迟界与学习型CUSUM统计量
将词元级幻觉检测重新表述为最快变化检测问题,建立了检测延迟的理论下界,并表明因果循环模型实现了接近最优的性能,优于线性基线。