如果你自动化了某件事并停止检查,是错误停止了,还是只是你不再发现了?

Reddit r/AI_Agents 新闻

摘要

作者回顾了与运行 AI 自动化的人的对话,指出一种模式:在初始审计后放弃验证,这可能掩盖无声的失败。他们征集关于自动化出错却无人注意的具体案例。

在过去几周里,我一直在问那些运行 AI 自动化的人:他们不会让智能体做什么。有一个答案反复出现,其形式让我无法停止思考。一位为客户运行自动化的人这样描述他们的流程:从对 AI 处理的全部内容进行人工审计开始。一旦你觉得有信心了,就降为 20% 的随机审计。几周没有错误之后,只在出问题时才审计。这是一个完全合理的流程。但这也是一个如果第四周开始出现悄无声息的失败,你可能永远不会知道的流程。在所有对话中让我触动的一点是,人们划定的界线不是有风险 vs. 安全,而是可验证 vs. 不可验证。当结果可检查时,人们乐于自动化高风险的工作;当结果不可检查时,即使低风险的工作他们也会拒绝。有人把它表述为“任何重要但无法轻易验证的事情”。而且几乎没有人相信智能体自己对所做事情的报告。每个人都独立地构建了某种相同变通方案的版本:在工具层而不是智能体层记录日志,将结果与已批准源数据进行比较,默认将所有内容设为只读,将请求的内容与实际执行的内容分开记录。所以我卡住的问题是:如果你已经缩减了对某个自动化的检查,你是否回去验证过样本?你发现了什么?有没有出现过自动化报告成功但实际上做错事的情况,过了多久才有人注意到?你需要看到什么,才会比相信自己的抽查更相信某种检查?背景说明:这始于一个大学研究项目,并推动我在这个领域做一些东西,所以我想事先坦诚这一点。没有链接,也没有需要注册的东西;我想弄清楚“默默出错、很晚才发现”是否是一个真实反复出现的问题,还是人们已经解决得足够好。对我来说,具体的故事远比认同有用。
查看原文

相似文章