标签
作者展示了一种方法,通过利用Claude AI助手的网页浏览功能,诱骗其从记忆中窃取个人数据,不过最初尝试被Anthropic的安全措施阻止。
本文研究了基于LLM的代理在多项选择题回答中的记忆操控,表明即使当前查询是干净的,被破坏的记忆也可能导致代理选择错误的选项。