标签
本文指出LLM代理中的一个安全风险,其中持久化记忆可能伪造授权,导致未授权操作,并提出了一个基准测试EAL-Bench来评估此问题及缓解策略。
本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。