我们尝试让AI验证器减少阅读。如何在不悄无声息地遗漏证据的情况下降低成本?

Reddit r/AI_Agents 新闻

摘要

本文描述了在AI验证管道中测试降低阅读成本的方法,同时保持高召回率和少数证据,指出了当前方法的挑战,并邀请社区参与。

我们一直在测试一个验证管道,其中昂贵的部分不再是检索——而是系统必须实际阅读多少证据,我们才能确信没有遗漏重要内容。因此,最近我们一直在尝试减少阅读成本,而不悄悄降低覆盖范围。一些起初看起来显而易见的方法比预期更困难。对于排名检索,我们认为可以较早停止并仍保留大部分有用证据。但在我们的冻结重放案例中,情况并非如此。为了实现完全召回,有些案例需要我们深入到候选集中——大约从407-454个候选中读取290-426个。更有趣的问题是那些只由一个独立读者注意到的证据。在k=50时,最多只有8个中的2个少数证据项得以保留。我们还尝试跳过那些在机制上看起来不太可能包含有用内容的切片。这节省了阅读,但有一个版本跳过了17个切片,后来证明它们包含相关证据,因此不能将其视为安全过滤器。去重的效果也比我们预期的要小。语料库中有大量重复文本,但移除字节完全相同的重复仅将切片量减少了约3.3%,并且在该测试中并未减少阅读会话数量。因此,目前的权衡仍然如下:• 减少阅读 • 保持高召回率 • 不会不成比例地丢失怪异/少数证据 • 不会悄无声息地将“未检查”转化为“无内容”。我们仍在测试其他方法,但我很好奇处理类似系统的人是如何应对这个问题的。如果采样长尾数据不可接受,接下来你会尝试什么?学习路由?更好的停止标准?多阶段审查?还是完全不同的方法?更重要的是:你如何证明决定不阅读的内容确实可以安全跳过?
查看原文

相似文章