大多数智能体可观测性感觉像是崩溃录像
摘要
作者认为,当前的智能体可观测性提供了行动轨迹,但缺乏运行时对行动为何被允许的合理性说明,这对于涉及金钱、数据或通信的生产部署至关重要。
我一直看到有人将智能体可观测性视为应对生产风险的解决方案:追踪提示、输出、工具调用,存储一切,重放运行……这很有用,但感觉非常不完整。如果智能体进行退款、发送邮件、更新工单、更改订阅或接触内部数据,那么有趣的问题不仅是它做了什么,尤其是为什么允许它这样做。轨迹可以显示智能体调用了某个工具,但不一定能显示智能体是否有来自可信来源的足够证据、行动是否符合用户意图、或者策略检查是否真正有意义。因此在许多系统中,我们正在构建令人惊叹的高分辨率、可搜索、带时间戳的崩溃录像。在我看来,缺失的一层是运行时合理性说明。也许只有当智能体涉及金钱、客户数据、法律工作流、支持操作或外部通信时,这才成为一个问题,但这不正是大家想要部署它们的地方吗?
相似文章
小众观点:大多数生产环境下的AI代理都在盲目运行,而开发者却浑然不知
一位开发者认为,大多数生产环境下的AI代理缺乏必要的可观测性,例如会话追踪和成本监控,并将其比作在没有监控的情况下部署Web应用。文章质疑代理可观测性是否仍是一个未解决的问题。
有人真的在分析 Agent 的运行轨迹模式,还是我们都在盯着仪表盘猜?
作者质疑为何工程师不对 Agent 的运行轨迹进行自动化的模式分析,认为当前的可观测性工具(如 LangSmith 和 Langfuse)缺乏从 Agent 行为中“连接”并累积知识的关键步骤,这与个人知识管理系统形成鲜明对比。
我们对AI栈的每一层都有可观测性,唯独缺少决定智能体信念的那一层
文章批评了AI智能体记忆层缺乏可观测性,该层决定了智能体的信念,并质疑为何在系统其他可观测性取得进展的情况下,这一层仍是一个黑箱。
多智能体的可观测性在每个框架中都支离破碎——构建了一个工具来解决这个问题
一款新工具旨在解决多智能体框架中可观测性碎片化的问题。
@bentannyhill: Agent 可观测性是实现目的的手段:让您的 Agent 变得更好。但可观测性和评估工具传统上…
Engine 是一种新工具,它将 Agent 可观测性追踪与自动修复和评估连接起来,为工程团队闭环 Agent 改进流程。