大多数AI功能失败的原因不在于模型本身

Reddit r/artificial 新闻

摘要

一个用于工单分类的AI功能失败并非模型问题,而是由于管道变更导致的数据过期,这凸显了跨团队集成监控的必要性。

这事我琢磨了一阵,之前负责的一个AI功能在上线后慢慢就废了,我觉得把锅甩给模型通常都是障眼法。具体例子:我们有个智能体处理入站支持工单的初筛,负责任务分派并草拟回复建议给人类审核。上线后头六周表现很棒。工程团队盯着延迟(稳定在2秒以内)和错误率(低于1%);产品团队关注工单解决时间,初期确实有改善。与此同时,支持团队开始悄悄注意到,针对某类工单的回复建议变得莫名模板化——没有崩溃,没有报错,只是质量下降。他们在Slack频道提过几次,但没人把这事串联起来,因为这不属于任何人的职责范围:支持关注质量,工程看的是可用性,产品盯的是下游指标,而那个指标因为退化是渐进式的,当时还没变化。等到真正出问题(解决时间指标终于下滑,大概是两个月后),所有人第一反应都是“模型肯定变了”或者“需要更好的提示词”。实际根因调查发现,智能体用来提取上下文的数据源,因为一次无关的管道变更,悄悄返回了过时信息。根本不是模型的问题。这是“三个团队对同一个系统有三个不同的局部视角,且彼此毫无交集”的问题。见过类似情况——团队用LangSmith、Langfuse甚至内部自建的全定制方案。具体工具不是关键变量。每次缺失的东西比工具更简单:一个共享空间,能让追踪记录、质量投诉和下游指标并列展示,并由能同时处理这三方面的人来审视。可能是我样本太小,但好奇是否有人有同感。你负责的AI功能在上线后到底是怎么死的?真的是模型的问题,还是事后被包装成模型问题的“没人掌握全局”的问题?
查看原文

相似文章

大多数 AI Agent 的失败是组织设计失败,而非模型失败

Reddit r/AI_Agents

文章认为,生产环境中 AI Agent 的失败往往归因于糟糕的组织设计和模糊的责任边界,而非模型本身的局限性。文章提出了一种成熟度模型,区分了 AI 助手、自动化流程和 AI 员工,以指导任务所有权的确立。

大多数公司的人工智能问题不在于模型

Reddit r/artificial

一项分析指出,公司在人工智能方面失败的原因在于它们专注于模型,而非基础层——流程设计、治理、知识架构、人工判断和反馈循环——而这些才是真正的价值来源。文章引用了纳德拉的“令牌资本”概念、苹果可切换模型的Siri,以及显示战略与执行之间存在巨大差距的调查数据。