无评估可捕捉的智能体失败模式:使用缓存的过时事实
摘要
讨论AI智能体可靠性中的一个盲点:缓存在获取时是真实的事实,但在使用时已经过时,导致一致但不正确的行为。提出将一致性(与源匹配)与时效性(源目前仍然真实)分开,并询问社区如何处理这个问题。
大多数智能体可靠性工具只检查一件事:这个回答是否忠实于给定的上下文?这能捕捉到矛盾点和虚构的引用。它在结构上无法捕捉过时的问题,因为过时的信念本身是完全一致的——只是过时了。具体来说:智能体读取了一个缓存的"contact's title is VP of Engineering",这在上一季度是真实的,但此人换了工作,智能体便根据这个不再成立的职位个性化地发送了消息。没有异常,没有断言失败,没有任何测试可以捕捉到。一致且错误。我认为它处于两个层面之间的盲区。数据工程将其视为摄取时的新鲜度/TTL问题。大语言模型评估将其视为生成时的接地性(groundedness)问题。但一个信念在摄取时足够新鲜,在其上下文中是接地(grounded)的,却仍然可能在行动时刻是错误的,因为世界在此期间发生了变化。我最终采用的结构是时效性(currency)与一致性(consistency)作为两个独立的轴。一致性:回答是否与其源匹配。时效性:源在当前是否仍然真实。接地性检查第一个。几乎没有任何工具在行动时刻检查第二个。这里的人们是如何处理这个问题的?对一切设置TTL并重新获取?在高风险工具调用之前进行验证器检查?仅对写操作设置人在回路中?声明:我从事这个问题的工作,所以我有偏见。主要我想知道其他人是否也这样看,或者认为这不是个问题。
相似文章
有没有其他人的智能代理会自信地“记住”已经变化的内容?
用户描述了一个问题:AI智能代理会自信地从记忆层中检索过时的事实,而不标记变化,并询问社区如何使旧的记忆失效或跟踪事实时效性。
尝试让智能体记忆跨会话持久化所学的经验
本文反思了AI智能体记忆的复杂性,远超简单的存储问题,强调了诸如判断真实性、优先级变化、区分决策与噪音以及何时恰当地呈现上下文等挑战。
AI代理的失败方式鲜有人论及。以下是我亲眼所见。
文章强调了AI代理工作流程中实际的系统级失败,例如上下文泄漏和幻觉细节,认为这些通常是基础设施问题而非模型缺陷。
智能体不会忘记事实。它们忘记的是决策。这是两个不同的问题
讨论AI智能体忘记的是决策而非事实的问题,并提出一个系统:智能体检查已有决策,提出新决策等待批准,并通过门控管理流程以防止漂移和错误级联。
误判鸿沟:当记忆投毒在自主AI系统中看似模型故障
本文识别了多智能体AI流水线中的一种结构性缺陷,即记忆层攻击可能被误判为模型失调,形式化定义了语义规范漂移(SND),并提出反事实组合测试(Counterfactual Composition Testing)和持久记忆信息流控制(Memory-Persistent Information-Flow Control)作为防御措施。