我觉得没人讨论大多数AI代理在现实世界中失败的真实原因

Reddit r/artificial 新闻

摘要

文章认为,AI代理在生产环境中失败的主要原因是分发不足、缺乏主动性和持久记忆,而非模型能力限制。

我们在这个社区里花了很多时间讨论能力。上下文窗口、推理基准、多步骤工具使用、模型编写代码或通过律师考试的能力。我并不是在否定这些。能力确实重要。但当我看到AI产品在生产中失败时,模型的几乎从来不是问题。我构建和咨询AI代理大约18个月了。我经常看到的失败模式是:用户不会去代理所在的地方。代理有一个漂亮的网页界面。用户访问了两次就停止了。不是因为代理没有帮助。因为打开浏览器标签页是一种需要意图的认知行为,而大多数日常生活不会创造这种意图的正确时机。人类不会为了适应有用的工具而改变自己的行为。有用的工具必须出现在人类已有的行为中。代理本应主动,却只是被动响应。你曾经有过的最聪明的助手不仅仅是回答问题。他们会主动出现。他们会在你提问之前就标记出问题。他们会给你发送你并不知道你需要的东西。大多数AI代理只是带有个性的搜索栏。它们等待。等待在实践中并不是智能。实践中的智能是注意并采取行动。代理对你没有记忆。你告诉它你的偏好、你的背景、你的情况,然后3天后回来,它什么都不知道。这不是模型限制。如果你提供正确的上下文,模型可以记住。这是一个架构选择,大多数团队都做错了,因为他们考虑的是会话而非关系。在生产环境中取得成功的代理,不一定是那些拥有最好模型的代理。它们是那些存在于用户已经使用的WhatsApp、iMessage和Telegram中的代理。它们会在相关事情发生时主动联系。它们会在数周和数月的对话中保持对用户的连贯记忆。现在已有构建这种方式工具。Agno和LangChain用于编排,Photon Codes用于跨渠道消息界面,Langfuse用于追踪和内存调试,Postgres或Supabase用于良好的持久化。这种架构并不神奇。仍然罕见的是将渠道和记忆视为首要约束而非事后考虑的思维方式。我认为AI代理理论上能做的事情与它们在实际生活中为人们所做的事情之间的差距,几乎完全是一个分发和持久性问题,而不是能力问题。我们正在解决错误的问题。
查看原文

相似文章

我在AI项目中经常看到但没人公开讨论的事情

Reddit r/AI_Agents

本文指出,许多AI代理项目在生产环境中失败,并非因为模型质量,而是因为团队在发布前没有明确定义何为失败,忽略了关键边缘案例,导致自信地输出错误结果。

大多数 AI Agent 的失败是组织设计失败,而非模型失败

Reddit r/AI_Agents

文章认为,生产环境中 AI Agent 的失败往往归因于糟糕的组织设计和模糊的责任边界,而非模型本身的局限性。文章提出了一种成熟度模型,区分了 AI 助手、自动化流程和 AI 员工,以指导任务所有权的确立。