标签
Yimeng Chen等人发表的一篇新arXiv论文形式化了针对AI代理的'自状态攻击',即代理自身的内存和配置文件通过合法的OS调用被投毒。作者评估了OS级别的防御并指出结构性限制,建议需要应用层的完整性措施。
本文研究了操作系统针对自托管AI代理的自身状态攻击的韧性,描述了一个攻击空间并评估了分层防御策略。研究发现,尽管分层防御栈是有效的,但仍存在一个小的残余攻击面,在操作系统层面结构上难以区分。