如果人类必须逐一检查 AI 自动化的每项输出,那你就没有实现自动化,只是把工作挪了个地方。

Reddit r/AI_Agents 新闻

摘要

一位开发者反思了自己的 AI 自动化项目:准确率达到 95% 仍需人工全面审查,于是重新设计为将不确定的输出送入审查队列,整体上节省了时间。

三月时我顺路去了一个客户的办公室,想看看项目进展如何。办公室经理 Dana 开着两台显示器,左边是 AI 输出,右边是客户的原始邮件,中间放着一本拍纸簿,她正在上面逐行手打勾对比。她抬起头看我,带着一种替陌生人检查作业的疲惫礼貌,然后我意识到,那个陌生人就是我。我已经做了 8 年的产品开发(为创始人做 MVP、完整生产级构建,也经常重建别人遗弃的系统,以及为小企业做自动化)。这个客户是一家供应商,每周大约要做 80 份报价单。我给他们做了一个每个老板都会向我要的东西:一个能读取收到的采购订单并自动起草报价单的系统。测试时准确率达到 95%,演示时会议室里真的响起了掌声。但在现实中,95% 意味着每周有 4 份报价是错的,而且没人知道是哪 4 份。所以 Dana 每天早上都要检查全部 80 份,因为给大客户发错一份报价的损失,比软件省下的所有时间都多。说实话……我第一反应是想为那 95% 辩护。但当我坐下来看她的工时记录时,心里有点沉了下去。她过去每周大约花 8 小时写报价单,现在却要花 6 个半小时去检查……而且漏网之鱼比她以前犯的错更离谱。比如在她绝不会搞错的商品上标错单位,或者给那个从来不打折的客户加了折扣。我实际上只自动化了大约 90 分钟的工作,还把错误变得更怪异,而且我还为此收了钱。解决办法不是提高准确率,而是让系统知道什么时候自己不确定。老客户订购常规商品时,直接通过。任何新的或稍微偏离常规的内容,都会进入审查队列,而不是直接发出去。每周大约有十来份报价单进入这个队列。Dana 会像鹰一样仔细检查这 12 份,其余的直接忽略——而这份‘忽略’才是整个产品的核心。现在我对每个项目都会做一次审计。我计算人工审查机器输出所花费的分钟数。如果这个数字和原来完成任务的时间差不多,那说明工作根本没有离开公司,只是换了张桌子。顺便说一句,Dana 仍然把拍纸簿放在抽屉里。她还不太完全信任我,老实说,这似乎也合理。
查看原文

相似文章

AI正在吞噬AI工程循环(5分钟阅读)

TLDR AI

文章讨论了AI工程循环如何能够完全自动化,但认为将整个循环交给AI会产生'agent slop'(智能体垃圾),因为评估不完善。它建议自动执行某些步骤,同时保留人类判断以处理细微差别。