在多个行业构建AI智能体后,真正有效的并非我预期之处
摘要
一位从业者反思在多个行业构建AI智能体的经历,发现狭窄、行业特定且不起眼的用例能带来真正价值,而泛泛的“AI运行整个工作流”演示则始终表现不佳。
我现在已经在多个行业构建了智能体(物流、医疗管理、会计、房地产,还有其他几个行业),实际有效与失败的模式并非我最初预期的那样。成功的案例几乎总是狭窄且不起眼的。那个为临床团队节省最多时间的智能体,只是把行政杂活从他们身上移开,让他们不必在下班后做数据录入。在会计领域,有用的那个并不是“做会计”,而是处理重复性的提取工作并标记异常,这样一个人就能覆盖更多的客户。在房地产领域,它只是在两分钟内回复潜在客户,而不是几小时——没什么巧妙之处,就是快速可靠。那些演示效果惊艳的东西(“AI运行整个工作流”的推销)一旦遇到真实世界的混乱,就持续令人失望。狭窄、枯燥、行业特定的那些至今仍在运行。最让我惊讶的是,同样的底层技术在不同行业看起来如此不同。医疗管理中的成功用例与物流中的成功用例几乎没有共同点,尽管底层构建模块是一样的。价值始终在于特定的工作流程,而非通用能力。对于正在构建或购买智能体的人:这是否也是你的经验——狭窄、行业特定的东西胜出,而通用的“什么都能做”的东西令人失望?以及哪个行业最难让一个智能体真正立足?
相似文章
如何创建一个真正有用的AI代理,而不仅仅是演示品?
本文讨论了令人印象深刻的AI代理演示与现实部署之间的差距,聚焦于销售运营等业务流程中的实际挑战,并呼吁分享生产环境下的案例研究。
AI智能体中最无聊的部分:没人构建,人人都需要
一位实践者回顾了在生产环境中部署AI智能体的经历,指出80%的工程精力花费在工作流、所有权和审批流程上,而非模型本身。他强调,共享上下文和路由这些“无聊层”对于产生实际影响至关重要。
有没有人也觉得AI代理在事情变得复杂之前都表现得很惊艳?
对AI代理令人印象深刻的演示和可靠的实际执行之间差距的反思,认为当前代理擅长结构化任务但在不可预测条件下会失败,并指出近期AI角色将主要集中于带人类监督的窄范围自动化。
我为数十个客户构建了AI代理。以下是大多数在生产中失败的原因(而且不是模型的问题)
一位开发者分享了AI代理在生产中失败的三个常见原因:RAG分块不佳、仅针对演示的提示词、以及缺乏回退逻辑,强调模型质量很少是主要问题。
真实用户出现后,AI代理的构建变得奇怪起来
一位经验丰富的开发者反思了AI代理演示与实际性能之间的差距,强调了诸如文档不完善、权限期望过于简单,以及认为概率性软件在生产中会变得确定性的误解等问题。