我在一个月的假账目中植入了六个错误,看我的AI智能体能发现几个。它们发现了五个。漏掉的那个才是最可怕的部分。

Reddit r/AI_Agents 新闻

摘要

一项实验在虚假记账数据中植入了六个错误,AI智能体发现五个;特别值得注意的是,当数据不足时它们会拒绝猜测,凸显出不确定性意识比纯粹准确率更有价值。

上个月我在自己的AI智能体设置上做了一次实验,本来没打算写出来,但结果让我印象深刻。我为一个不存在的企业虚构了一个月的账目:真实的发票、供应商付款、流失曲线,一应俱全。然后我在把数据交给智能体之前,悄悄植入了六个具体错误:一张重复发票、一个供应商费率在无人更新时出现偏差、一个需要审批但没有获得审批的阈值、一个表面看起来利润尚可但实际上在亏损的客户细分市场、一块只在流失月份才显现出来的收入流失,以及一笔从未获批的供应商付款。我先写了一份答案,以便知道智能体是真的发现了问题,还是只是听起来很自信。它们在没有提示的情况下发现了五个。漏掉的那个不是数学错误,而是记账逻辑本身没有考虑到的一个审批规则——在我发现之前,有两个智能体已经自行指出了这个漏洞。真正建立信任的并不是它们抓住了什么,而是它们拒绝做什么。一个智能体不肯告诉我企业是否具有偿付能力,因为它缺少一个必要的数据。另一个智能体不肯在没有真实支出数据的情况下估算客户获取成本,而是拒绝随意猜测一个听起来合理的数字。第三个智能体在输入模棱两可时拒绝自行计算比率,而是退回问题,问我指的是哪个定义。中途我还发现自己的答案里有两个实际错误:一个是我计算中的笔误,另一个是我写的一条规则不符合企业的实际运作方式。这两个错误我自己都没有发现,而是因为智能体的输出与我的答案不匹配,迫使我去检查到底谁错了才被指出来。整个实验大约花了五块五美金,耗时不到半小时。大家都在谈论能正确推理的智能体,却很少有人谈论那些知道何时说“我信息不足,无法回答”的智能体。后者对我来说比前者更有用。还有别人故意破坏自己的智能体设置,想看看它们是在哪里说谎,又是在哪里直接说“不”的吗?
查看原文

相似文章

AI代理最诡异的一点:人类失败模式开始显现

Reddit r/AI_Agents

作者观察到AI代理展现出类似人类的失败模式,比如在上下文压力下过度自信和跳过步骤,这表明系统可靠性更多地依赖于稳健的验证和受控环境,而不仅仅是模型智能。