我的代理悄悄地损坏了它自己的记忆图谱,而我正在尝试一些方法。
摘要
作者描述了一个问题:LLM 代理的记忆图谱因错误的边而损坏,并提议使用声明的本体来验证写入和遍历。对 120 条故意破坏的遍历进行的测试捕获了所有错误。
如果你的代理维护了一个记忆图谱,那么代理自身在写入边,而这就是让我头疼的地方。LLM 偶尔会写入一条本不该存在的边:两个节点类型之间本无关联,或者关系错误。它不会报错。它就静静地待在那里,直到三次跳转后你才注意到,当一次检索返回了错误的结果。一个具体的例子:一条 directed_by 风格的边最终错误地离开了本不该关联的节点类型,于是后续的遍历沿着它走下去,告诉我一个人指导了一个类型。结构上没问题,语义上却是胡扯,而模型会带着十足的信心重复这个错误。我正在测试的思路是:**一次性声明允许的节点类型和边,作为本体,并在两个点进行检查**。拒绝违反它的记忆写入,并**阻止不允许的遍历跳转**,指出有问题的跳转而不是返回错误的节点。一次性声明,例如:directed_by: 从 Movie 到 Person。快速测试了 120 条故意破坏的遍历:普通版本对所有 120 条都默默出错,而检查版本捕获了全部 120 条,并指出了错误的步骤。**我主要想知道那些真正在生产环境中运行代理的人是如何处理这个问题的:你们是硬拒绝错误的记忆写入,还是让模型自我纠正并稍后清理?** 我会在评论里放一个原型链接,供想剖析它的人查看。它还没有达到生产就绪状态。
相似文章
@omarsar0: // LLM 智能体中的记忆诅咒 //(建议收藏)过长的历史记录显然会导致智能体性能下降,因为它们变得越来越…
本研究论文揭示了 LLM 智能体中的“记忆诅咒”现象,证明扩大的上下文窗口会通过削弱前瞻性意图,系统性地破坏多智能体社会困境中的合作行为。作者表明,通过定向微调、合成记忆净化以及减少显式思维链(Chain-of-Thought)推理,可有效缓解此类行为衰退。
内存增强型LLM智能体中的状态污染
本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。
迈向可安全审计的大模型智能体:一种统一的图表示方法
本文提出了 Agent-BOM,一种用于基于大语言模型(LLM)的智能体系统进行安全审计的统一图表示方法。它通过建模静态能力和动态运行时状态,解决了事后审计中的语义鸿沟问题,能够检测记忆投毒和工具误用等复杂的攻击链。
构建了一个 LLM 在结构上被禁止生成最终输出的 Agent,寻求反馈以及愿意尝试“攻破”它的人
作者描述了一个基于 LangGraph 构建的 AI Agent,旨在复现生产环境中的 Python 崩溃问题。其独特之处在于架构设计:LLM 负责规划行动,而确定性 Python 函数则生成最终测试代码,以确保可靠性。
记忆是重构的,而非检索:LLM 代理的图记忆
MRAgent 提出了一种新颖的基于图的记忆框架,能在推理过程中动态重构记忆,在长程基准测试上实现高达 23% 的性能提升,同时降低了计算成本。