我们对AI栈的每一层都有可观测性,唯独缺少决定智能体信念的那一层

Reddit r/AI_Agents 新闻

摘要

文章批评了AI智能体记忆层缺乏可观测性,该层决定了智能体的信念,并质疑为何在系统其他可观测性取得进展的情况下,这一层仍是一个黑箱。

你可以调试你的提示词。你可以切换你的模型。你可以优化你的检索。但这一切底下的记忆层,在大多数产品中都是一个黑箱。当出现问题时,你甚至无法判断是哪一层出了问题。我一直在思考这个问题,它一直困扰着我。以下是我所说的“决定智能体信念”的一些例子: * 一个用户在一月份说他们更喜欢早上的会议。四月份又说是下午。你的智能体今天会采用哪一个,你能否真正检查原因? * 六个月前,一句讽刺的评论被当作字面偏好存储了下来。智能体从此一直按此行事。如果不重新读取所有存储的记忆,你如何发现这个问题? * 一个衍生摘要的存活时间超过了使其成立的基础事实。智能体仍然引用该摘要。你能追溯到这个记忆的来源吗? 令人沮丧的是,我们已经知道如何为系统构建可观测性。我们为数据库、日志和分布式追踪做到了这一点。那么为什么记忆层仍然是一个黑箱?仅仅是因为这个领域还很新,人们仍在优化“它是否能记住东西”吗?很好奇这里各位的想法,尤其是那些在生产环境中运行智能体的人。你们现在是如何调试记忆层的?还是仅仅希望检索看起来正确就继续下去?
查看原文

相似文章

大多数智能体可观测性感觉像是崩溃录像

Reddit r/AI_Agents

作者认为,当前的智能体可观测性提供了行动轨迹,但缺乏运行时对行动为何被允许的合理性说明,这对于涉及金钱、数据或通信的生产部署至关重要。

我认为AI代理将需要一个操作层

Reddit r/artificial

作者认为,随着AI代理变得越来越自主,需要一个治理层来实现控制、可观测性和可审计性,并介绍了Bendex Arc作为解决方案,其组件包括Arc Gate、Arc Replay、Arc Approve和Arc Memory。