如果人类必须逐一检查 AI 自动化的每项输出,那你就没有实现自动化,只是把工作挪了个地方。

Reddit r/AI_Agents 新闻

摘要

一位开发者反思了自己的 AI 自动化项目:准确率达到 95% 仍需人工全面审查,于是重新设计为将不确定的输出送入审查队列,整体上节省了时间。

三月时我顺路去了一个客户的办公室,想看看项目进展如何。办公室经理 Dana 开着两台显示器,左边是 AI 输出,右边是客户的原始邮件,中间放着一本拍纸簿,她正在上面逐行手打勾对比。她抬起头看我,带着一种替陌生人检查作业的疲惫礼貌,然后我意识到,那个陌生人就是我。我已经做了 8 年的产品开发(为创始人做 MVP、完整生产级构建,也经常重建别人遗弃的系统,以及为小企业做自动化)。这个客户是一家供应商,每周大约要做 80 份报价单。我给他们做了一个每个老板都会向我要的东西:一个能读取收到的采购订单并自动起草报价单的系统。测试时准确率达到 95%,演示时会议室里真的响起了掌声。但在现实中,95% 意味着每周有 4 份报价是错的,而且没人知道是哪 4 份。所以 Dana 每天早上都要检查全部 80 份,因为给大客户发错一份报价的损失,比软件省下的所有时间都多。说实话……我第一反应是想为那 95% 辩护。但当我坐下来看她的工时记录时,心里有点沉了下去。她过去每周大约花 8 小时写报价单,现在却要花 6 个半小时去检查……而且漏网之鱼比她以前犯的错更离谱。比如在她绝不会搞错的商品上标错单位,或者给那个从来不打折的客户加了折扣。我实际上只自动化了大约 90 分钟的工作,还把错误变得更怪异,而且我还为此收了钱。解决办法不是提高准确率,而是让系统知道什么时候自己不确定。老客户订购常规商品时,直接通过。任何新的或稍微偏离常规的内容,都会进入审查队列,而不是直接发出去。每周大约有十来份报价单进入这个队列。Dana 会像鹰一样仔细检查这 12 份,其余的直接忽略——而这份‘忽略’才是整个产品的核心。现在我对每个项目都会做一次审计。我计算人工审查机器输出所花费的分钟数。如果这个数字和原来完成任务的时间差不多,那说明工作根本没有离开公司,只是换了张桌子。顺便说一句,Dana 仍然把拍纸簿放在抽屉里。她还不太完全信任我,老实说,这似乎也合理。
查看原文

相似文章

What is one AI task you stopped automating because it caused more work than it saved?

Reddit r/AI_Agents

I think we talk a lot about what AI agents can automate, but not enough about what they should not automate. Sometimes a workflow looks perfect on paper, but once it runs in the real world there are too many exceptions, wrong decisions, or manual fixes. Have you ever automated something and later turned it off because it created more work? What went wrong? I’m more interested in real examples than successful demos.

AI正在吞噬AI工程循环(5分钟阅读)

TLDR AI

文章讨论了AI工程循环如何能够完全自动化,但认为将整个循环交给AI会产生'agent slop'(智能体垃圾),因为评估不完善。它建议自动执行某些步骤,同时保留人类判断以处理细微差别。