代理演示看起来很惊艳,因为没人拍那90%的错误处理部分

Reddit r/AI_Agents 新闻

摘要

作者将精心打磨的AI代理演示与生产系统的现实进行对比,指出大多数代理代码用于错误处理和护栏(guardrails),而非核心智能。

我总看到那些流畅的代理演示,然后回到自己的工作中,想起构建这些系统的真实情况。演示是代理在一条别人设定好的快乐路径上干净地执行一次任务。生产环境则是路径不快乐时发生的一切。我的代理大部分代码都花在演示中永远不会出现的事情上:API超时时重试、传递前检查输出格式是否正确、在即将无限循环时自我停止、记录足够的信息以便凌晨2点能找出问题。真正的“智能”可能只占十分之一,其余都是管道工程,防止一个错误步骤污染整个运行。另一件没人展示的事情是:代理会以一种脚本不会的方式静默失败。一个出错的脚本会抛出一个错误。一个出错的代理会自信地做错事,然后告诉你它成功了。所以我最终围绕代理构建了检查机制,其工作量几乎与代理本身相当。我并不是贬低它们,那些能正常工作的代理确实为我节省了时间。但我已经不再信任任何不展示步骤失败时会发生什么的演示。你实际的代理逻辑与围绕它的护栏(guardrails)的比例是多少?
查看原文

相似文章