无评估可捕捉的智能体失败模式:使用缓存的过时事实

Reddit r/AI_Agents 新闻

摘要

讨论AI智能体可靠性中的一个盲点:缓存在获取时是真实的事实,但在使用时已经过时,导致一致但不正确的行为。提出将一致性(与源匹配)与时效性(源目前仍然真实)分开,并询问社区如何处理这个问题。

大多数智能体可靠性工具只检查一件事:这个回答是否忠实于给定的上下文?这能捕捉到矛盾点和虚构的引用。它在结构上无法捕捉过时的问题,因为过时的信念本身是完全一致的——只是过时了。具体来说:智能体读取了一个缓存的"contact's title is VP of Engineering",这在上一季度是真实的,但此人换了工作,智能体便根据这个不再成立的职位个性化地发送了消息。没有异常,没有断言失败,没有任何测试可以捕捉到。一致且错误。我认为它处于两个层面之间的盲区。数据工程将其视为摄取时的新鲜度/TTL问题。大语言模型评估将其视为生成时的接地性(groundedness)问题。但一个信念在摄取时足够新鲜,在其上下文中是接地(grounded)的,却仍然可能在行动时刻是错误的,因为世界在此期间发生了变化。我最终采用的结构是时效性(currency)与一致性(consistency)作为两个独立的轴。一致性:回答是否与其源匹配。时效性:源在当前是否仍然真实。接地性检查第一个。几乎没有任何工具在行动时刻检查第二个。这里的人们是如何处理这个问题的?对一切设置TTL并重新获取?在高风险工具调用之前进行验证器检查?仅对写操作设置人在回路中?声明:我从事这个问题的工作,所以我有偏见。主要我想知道其他人是否也这样看,或者认为这不是个问题。
查看原文

相似文章

误判鸿沟:当记忆投毒在自主AI系统中看似模型故障

arXiv cs.AI

本文识别了多智能体AI流水线中的一种结构性缺陷,即记忆层攻击可能被误判为模型失调,形式化定义了语义规范漂移(SND),并提出反事实组合测试(Counterfactual Composition Testing)和持久记忆信息流控制(Memory-Persistent Information-Flow Control)作为防御措施。