我审计了AI事实核查工具引用的来源。大约每18个中就有1个不存在。
摘要
一位作者分享了对其AI事实核查工具引用的审计,发现大约每18个中就有1个是失效或捏造的,并提供了实用修复方法来提高AI系统的可靠性。
我花了相当一段时间构建一个事实核查流程,最终做了一件早就该做的无聊事:我拿系统中引用的所有来源URL进行测试,检查页面是否实际存在。大约每18个中就有1个(215个中有12个)是失效或从未存在过。有顺序看似合理的文章ID,一个并不存在的Wikipedia子域名,以及几个在真实、权威域名上返回404的页面。真正让我担心的部分:其中一些来源被系统评为顶级。因此,判定看起来有充分来源和权威性,但其下的“证据”部分是捏造的。根本原因事后看来很简单。模型在输出JSON时自己编写了引用列表,而这个列表被直接信任。API可以返回实际检索到的来源,但显示的引用是模型写的,没有任何检查确保这些URL在显示前能正常解析。捏造的引用如果在一个真实域名上,就能直接通过,因为域名是可信的,即使具体页面是虚构的。以下是我实际采取的修复方法,对构建此类系统的人可能有用:
- 停止信任模型自身的引用列表。使用检索层实际返回的URL,并将模型添加的内容视为未经验证,除非得到证明。
- 约束模型仅从检索集中引用,并在提取/归因步骤保持低温设置。大多数捏造引用来自于让模型自由联想来源,而不是引用面前的内容。
- 在显示前检查每个URL(是否解析,页面是否仍包含该声明),并丢弃那些无效的。
- 单独评估来源的可靠性,这样捏造的页面在信誉域名上就不能继承该域名的信任度。
- 测试模型时不仅要测试答案质量,还要测试引用忠实度。有些模型比其他模型更容易捏造参考文献,而“最聪明”的模型并不总是最可靠的。
对于构建或仅仅信任这些工具的人,我得出两个要点:
- “模型引用了它”和“来源存在”是完全不同的主张。检查第二个主张。
- 一个自信的判定,如果无法打开并验证来源,那不是事实核查,而是带注释的自动补全。
好奇其他从事检索/验证工作的人是否测量过自己的失效引用率。我怀疑这比任何人承认的要普遍得多,尤其是在当前一波实时的“AI事实核查”工具中。(披露:我构建了一个验证工具,所以这是自利的自言自语,但无论使用什么工具,死链问题都是真实的。)
相似文章
我是一名专业事实核查员。AI的错误比你想象的更频繁
WIRED的一位专业事实核查员分享说,AI并不可靠,估计大约三分之一的AI生成信息是错误的,并主张人类的监督仍然至关重要。
我厌倦了AI统计文章相互循环引用,于是追溯了93个统计数据到原始来源
一位研究者手动追溯了93个AI统计数据到原始来源,揭示了关于企业投资、能源使用、工资溢价和AI生成内容的已核实数据,并发布了附有原始来源链接的结果。
斯坦福研究人员发现,OpenAI和Google的模型在30%的情况下引用错误来源
由James Zou领导的斯坦福研究人员发现,OpenAI、Anthropic和Google的AI模型在约30%的情况下引用错误来源,即使回答大部分正确。该研究突显了文本生成与准确引用之间的关键不匹配,给医学和法律等领域带来风险。
研究人员刚刚在医学论文中发现28个虚假AI引用
研究人员在影响临床指南的医学论文中发现了28个AI生成的虚假引用,凸显了AI幻觉破坏科学诚信和患者护理的风险。
AI检测器有多准确?
一位作家在对自己亲手撰写的影评进行检测时,发现不同AI检测工具给出了截然不同的结果,从而质疑AI检测工具的准确性,凸显当前AI检测器的不可靠性。