前几天意识到:“AI读取你的指令”和“AI读取攻击者的指令”在它看来是一样的

Reddit r/ArtificialInteligence 工具

摘要

一位安全研究员讨论了LLM代理如何无法区分用户指令与文档中的文本,并介绍了AVE——一个用于命名AI代理漏洞的开放标准,该标准与OWASP和MITRE框架相互参照。

自从上周发生一件怪事后,我一直在思考这个问题:我给一个代理分配了任务,它拉取了一个文件来辅助,文件里有一行不是写给我的,而是写给代理的。而代理就直接读了。它无法知道那一行并不是我实际请求的一部分。就在那时我意识到,对于语言模型来说,“指令”和“文档中静静躺着的文本”是同一回事。没有编译器或类型检查器告诉它“这部分是命令,这部分只是内容”——而几乎所有其他类型的软件都有这样的机制。它只是读取语言,然后决定怎么做。几十年来,我们一直围绕“数据和指令是不同事物”这一理念构建安全体系。但代理并没有这条界线,而现有标准也没有为由此引发的问题提供归属:CVE描述的是特定包和版本中的缺陷,但这里没有包;CWE描述的是代码中的弱点,但这里没有传统意义上的代码在执行,只有文本在被解释。我们在这条路上走得够深,以至于我们几个人构建了AVE——一个开放标准,直接命名这些行为模式,而不是试图把它们硬塞进为另一种系统设计的类别中。目前已有70条记录,并与OWASP和MITRE自己的框架做了交叉映射,因此没有重复发明其他地方已有的东西。如果这里从事安全工作的人想研究一下或指出它的错误,请访问 github.com/aveproject/ave。我真心好奇,“无数据/指令边界”这一框架是否与这里安全从业者已有的思考方式相符,或者是否有更精辟的表述方式。
查看原文

相似文章

最危险的AI黑客技术仍需要人类参与

Wired

安全研究员James Kettle在Black Hat上展示了研究结果,表明虽然智能体AI在自主设计新颖黑客攻击方面能力有限,但在人类引导下却能成为强大的合作伙伴,进而发现了一个名为“共享解析器混淆”的新漏洞类别。