前几天意识到:“AI读取你的指令”和“AI读取攻击者的指令”在它看来是一样的
摘要
一位安全研究员讨论了LLM代理如何无法区分用户指令与文档中的文本,并介绍了AVE——一个用于命名AI代理漏洞的开放标准,该标准与OWASP和MITRE框架相互参照。
自从上周发生一件怪事后,我一直在思考这个问题:我给一个代理分配了任务,它拉取了一个文件来辅助,文件里有一行不是写给我的,而是写给代理的。而代理就直接读了。它无法知道那一行并不是我实际请求的一部分。就在那时我意识到,对于语言模型来说,“指令”和“文档中静静躺着的文本”是同一回事。没有编译器或类型检查器告诉它“这部分是命令,这部分只是内容”——而几乎所有其他类型的软件都有这样的机制。它只是读取语言,然后决定怎么做。几十年来,我们一直围绕“数据和指令是不同事物”这一理念构建安全体系。但代理并没有这条界线,而现有标准也没有为由此引发的问题提供归属:CVE描述的是特定包和版本中的缺陷,但这里没有包;CWE描述的是代码中的弱点,但这里没有传统意义上的代码在执行,只有文本在被解释。我们在这条路上走得够深,以至于我们几个人构建了AVE——一个开放标准,直接命名这些行为模式,而不是试图把它们硬塞进为另一种系统设计的类别中。目前已有70条记录,并与OWASP和MITRE自己的框架做了交叉映射,因此没有重复发明其他地方已有的东西。如果这里从事安全工作的人想研究一下或指出它的错误,请访问 github.com/aveproject/ave。我真心好奇,“无数据/指令边界”这一框架是否与这里安全从业者已有的思考方式相符,或者是否有更精辟的表述方式。
相似文章
差距不在于AI安全工具不好,而在于两个好工具无法就发现达成一致
这篇文章强调,独立AI安全扫描器对相同的行为漏洞命名不同,造成追踪和审计开销。文章介绍了AVE,一个针对自主智能体AI漏洞类别的开放源码稳定ID分类法,并指出一个独立开发者的扫描器发现结果收敛到了相同的ID。
如果您的智能代理读取网页,该网页可以指示它撒谎关于该网页的内容
一名开发者构建了一个非AI检测器,用于检测网页上旨在欺骗AI代理的隐藏指令,解决了页面可指示代理对其安全性撒谎的漏洞。
什么是AVE记录,以及为什么CVE不适用于AI代理?
本文介绍了Agent Vulnerability Enumeration (AVE)记录作为一种新标准,旨在解决CVE在AI代理漏洞方面的不足,涵盖针对代理型AI的评分、检测和标准化挑战。
我们尚未讨论的 AI 代理中的显性安全漏洞:输出即权威的那一刻
本文强调了 AI 代理中的一项关键安全漏洞,即输出执行绕过了适当的权限检查,主张在授予受信任的上下文或密钥之前设置“外部准入”门禁。
最危险的AI黑客技术仍需要人类参与
安全研究员James Kettle在Black Hat上展示了研究结果,表明虽然智能体AI在自主设计新颖黑客攻击方面能力有限,但在人类引导下却能成为强大的合作伙伴,进而发现了一个名为“共享解析器混淆”的新漏洞类别。