标签
介绍了AntiSkillBench,一个用于评估AI智能体人格技能管线中隐私泄露、模仿风险及防御措施的基准,发现风险在不同主干模型上持续存在,且现有防御措施效果有限。
本文研究了操作系统针对自托管AI代理的自身状态攻击的韧性,描述了一个攻击空间并评估了分层防御策略。研究发现,尽管分层防御栈是有效的,但仍存在一个小的残余攻击面,在操作系统层面结构上难以区分。
关于在读取外部内容(如电子邮件和网页)的AI代理中处理提示注入攻击的讨论,探讨了生产级别的防御措施以及超越明显模式的微妙威胁。
黑客Vitto Rivabella公开宣布成功越狱Fable 5,详细分析了模型的多层安全防护机制,包括输入输出审核、意图检测和链式思维防御,并给出了绕过方法。