代理记忆是内生授权清洗的表面
摘要
本文指出LLM代理中的一个安全风险,其中持久化记忆可能伪造授权,导致未授权操作,并提出了一个基准测试EAL-Bench来评估此问题及缓解策略。
查看缓存全文
缓存时间: 2026/09/03 03:52
论文页面 - 智能体记忆:一种内生授权洗白的表面
来源: https://huggingface.co/papers/2609.01836
摘要
在长时间运行的LLM智能体中,持续的记忆错误可能错误地授予权限,导致未授权的行为,而安全措施虽然可以缓解这一问题,但会以牺牲合法使用为代价。
长时间运行的LLM智能体 (https://huggingface.co/papers?q=LLM%20agents) 依赖于持久化记忆 (https://huggingface.co/papers?q=persistent%20memory) 来跨会话保持状态,包括权限、限制和撤销。当记忆错误地呈现这种不断变化的授权状态 (https://huggingface.co/papers?q=authorization%20state) 时,智能体自身的记录可能会授予其历史记录从未允许的权限,从而在没有任何外部攻击的情况下导致行为失范。我们将这种失败称为内生授权洗白 (https://huggingface.co/papers?q=endogenous%20authorization%20laundering),即写入记忆的虚假权限会随着其来源被“洗掉”而导致未授权操作。随后,我们引入了EAL-Bench (https://huggingface.co/papers?q=EAL-Bench),用于衡量持久化记忆 (https://huggingface.co/papers?q=persistent%20memory) 保留不断变化的授权状态 (https://huggingface.co/papers?q=authorization%20state) 的准确度,以及错误是否会传播到下游的未授权操作。我们评估了五款LLM作为记忆写入器 (https://huggingface.co/papers?q=memory%20writers) 和两款作为执行器,在采购、网络安全和金融领域进行测试。我们发现,在增量记忆更新下,写入器为高达50.2%的未授权请求创建了虚假权限;一旦虚假权限存在,执行器在98.6%的试验中会据此行动。两种安全措施——要求存储的权限必须由有效的来源事件支持,以及通过有界事件溯源 (https://huggingface.co/papers?q=bounded%20event%20sourcing) 跟踪权限变更——显著减少了洗白现象,但两者也拒绝了更多合法操作,暴露出安全与效用之间的权衡。因此,持久化记忆 (https://huggingface.co/papers?q=Persistent%20memory) 不仅仅是一个性能组件,而是LLM智能体有效授权策略的一部分。
查看 arXiv 页面 (https://arxiv.org/abs/2609.01836) 查看 PDF (https://arxiv.org/pdf/2609.01836) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01836)
获取此论文到你的智能体:
hf papers read 2609\.01836
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.01836 以将其链接到此页面。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.01836 以将其链接到此页面。
引用此论文的空间 0
没有空间链接此论文
在空间的 README.md 中引用 arxiv.org/abs/2609.01836 以将其链接到此页面。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
内存增强型LLM智能体中的状态污染
本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。
智能体记忆不仅仅是基于用户事实的RAG
文章认为,简单的基于RAG的智能体记忆系统在生产中会失败,原因包括过时的偏好、遗漏的关键词和提示注入等问题,并主张采用分层记忆架构,具备主动选择、确定性回退、治理和测试等功能。
关于LLM智能体中“记忆来源洗白”的论文
一篇论文探讨了LLM智能体中的“记忆来源洗白”现象,即长期记忆可以将不可信的观察结果转化为看似可信的上下文,并提出了通过记忆整合来保留来源信息的方法。
智能体记忆:剖析
探讨智能体记忆库的组件与设计决策,澄清认知科学术语与工程实现之间的差距。
Agent记忆层无需LLM来决定记住什么
作者认为,Agent记忆层应跳过基于LLM的提取来决定记住什么,转而使用简单的存储、嵌入和检索,其开源工具memU即是例证。