我审计了AI事实核查工具引用的来源。大约每18个中就有1个不存在。

Reddit r/artificial 新闻

摘要

一位作者分享了对其AI事实核查工具引用的审计,发现大约每18个中就有1个是失效或捏造的,并提供了实用修复方法来提高AI系统的可靠性。

我花了相当一段时间构建一个事实核查流程,最终做了一件早就该做的无聊事:我拿系统中引用的所有来源URL进行测试,检查页面是否实际存在。大约每18个中就有1个(215个中有12个)是失效或从未存在过。有顺序看似合理的文章ID,一个并不存在的Wikipedia子域名,以及几个在真实、权威域名上返回404的页面。真正让我担心的部分:其中一些来源被系统评为顶级。因此,判定看起来有充分来源和权威性,但其下的“证据”部分是捏造的。根本原因事后看来很简单。模型在输出JSON时自己编写了引用列表,而这个列表被直接信任。API可以返回实际检索到的来源,但显示的引用是模型写的,没有任何检查确保这些URL在显示前能正常解析。捏造的引用如果在一个真实域名上,就能直接通过,因为域名是可信的,即使具体页面是虚构的。以下是我实际采取的修复方法,对构建此类系统的人可能有用: - 停止信任模型自身的引用列表。使用检索层实际返回的URL,并将模型添加的内容视为未经验证,除非得到证明。 - 约束模型仅从检索集中引用,并在提取/归因步骤保持低温设置。大多数捏造引用来自于让模型自由联想来源,而不是引用面前的内容。 - 在显示前检查每个URL(是否解析,页面是否仍包含该声明),并丢弃那些无效的。 - 单独评估来源的可靠性,这样捏造的页面在信誉域名上就不能继承该域名的信任度。 - 测试模型时不仅要测试答案质量,还要测试引用忠实度。有些模型比其他模型更容易捏造参考文献,而“最聪明”的模型并不总是最可靠的。 对于构建或仅仅信任这些工具的人,我得出两个要点: - “模型引用了它”和“来源存在”是完全不同的主张。检查第二个主张。 - 一个自信的判定,如果无法打开并验证来源,那不是事实核查,而是带注释的自动补全。 好奇其他从事检索/验证工作的人是否测量过自己的失效引用率。我怀疑这比任何人承认的要普遍得多,尤其是在当前一波实时的“AI事实核查”工具中。(披露:我构建了一个验证工具,所以这是自利的自言自语,但无论使用什么工具,死链问题都是真实的。)
查看原文

相似文章

AI检测器有多准确?

Reddit r/artificial

一位作家在对自己亲手撰写的影评进行检测时,发现不同AI检测工具给出了截然不同的结果,从而质疑AI检测工具的准确性,凸显当前AI检测器的不可靠性。