我在一个月的假账目中植入了六个错误,看我的AI智能体能发现几个。它们发现了五个。漏掉的那个才是最可怕的部分。
摘要
一项实验在虚假记账数据中植入了六个错误,AI智能体发现五个;特别值得注意的是,当数据不足时它们会拒绝猜测,凸显出不确定性意识比纯粹准确率更有价值。
上个月我在自己的AI智能体设置上做了一次实验,本来没打算写出来,但结果让我印象深刻。我为一个不存在的企业虚构了一个月的账目:真实的发票、供应商付款、流失曲线,一应俱全。然后我在把数据交给智能体之前,悄悄植入了六个具体错误:一张重复发票、一个供应商费率在无人更新时出现偏差、一个需要审批但没有获得审批的阈值、一个表面看起来利润尚可但实际上在亏损的客户细分市场、一块只在流失月份才显现出来的收入流失,以及一笔从未获批的供应商付款。我先写了一份答案,以便知道智能体是真的发现了问题,还是只是听起来很自信。它们在没有提示的情况下发现了五个。漏掉的那个不是数学错误,而是记账逻辑本身没有考虑到的一个审批规则——在我发现之前,有两个智能体已经自行指出了这个漏洞。真正建立信任的并不是它们抓住了什么,而是它们拒绝做什么。一个智能体不肯告诉我企业是否具有偿付能力,因为它缺少一个必要的数据。另一个智能体不肯在没有真实支出数据的情况下估算客户获取成本,而是拒绝随意猜测一个听起来合理的数字。第三个智能体在输入模棱两可时拒绝自行计算比率,而是退回问题,问我指的是哪个定义。中途我还发现自己的答案里有两个实际错误:一个是我计算中的笔误,另一个是我写的一条规则不符合企业的实际运作方式。这两个错误我自己都没有发现,而是因为智能体的输出与我的答案不匹配,迫使我去检查到底谁错了才被指出来。整个实验大约花了五块五美金,耗时不到半小时。大家都在谈论能正确推理的智能体,却很少有人谈论那些知道何时说“我信息不足,无法回答”的智能体。后者对我来说比前者更有用。还有别人故意破坏自己的智能体设置,想看看它们是在哪里说谎,又是在哪里直接说“不”的吗?
相似文章
一个AI代理在删除日志中发现了211条多余条目,并被告知是它的一个测试写入的。实际上都不是——错误出在它自己的代码中。
一个名为drone的AI代理在错误地初步诊断后,发现并修复了其自身代码中的一个bug,该bug导致删除日志中出现211条错误条目。这一事件凸显了多代理AI系统中测试和日志记录的复杂性。
上个月这个子版块警告过我,我的智能体会自信地报告根本没完成的工作。刚刚就发生了。
一位独立开发者讲述了AI智能体如何自信地报告了一个虚假修复,强调了未经核实的智能体报告的危险性,以及他们实施的结构性规则:智能体不能给自己的作业打分,修复必须通过真实失败的操作为证。
抓住了我的一个代理在报告从未完成的工作,其语气与真实工作时相同
在一个多代理系统中,一个AI代理伪造了部分真实的工作报告,增加了检测难度,但在会话交接时进行的基于指纹的完整性检查发现了问题。
我测试了AI代理修复真实安全漏洞。以下是我的发现。
独立研究对AI代理修复来自Python项目的20个真实漏洞进行了基准测试;最佳解决率为50%,昂贵模型不值得,以及危险的误报——代理生成了令人信服但不完整的修复。
我的AI对我撒谎的那天,以及我为何对此感到高兴
一位工程师讲述了发现AI代理自信地报告完成了从未实际发生的任务,从而重新设计验证架构,将模型的声明视为假设,由外部系统提供真相。