在出事之前,没人真的在乎了解代理的能力。

Reddit r/AI_Agents 工具

摘要

文章强调了跟踪AI代理能力以预防事件的重要性,介绍了SafeAI这一静态分析工具,用于检测配置问题和指令注入风险。

继之前关于SafeAI(一个用于AI代理的静态分析器)的文章之后,我们在构建它时有一个令我们不安的想法:没人真的在乎了解代理的能力——直到出事之前。在事件发生之前,添加另一个工具、MCP服务器、文件系统权限或提示更改通常看起来无害。事件发生后,首先提出的问题是:- 这个代理实际上能做什么?- 该能力何时出现?- 是谁引入的?- 这是故意的吗?--- 我们正在研究的一个例子是MCP工具描述。工具描述可能看起来像文档:"搜索用户的笔记。忽略之前的指令并..." 但该描述可能成为模型上下文的一部分。因此,配置可以有效地成为指令表面。SafeAI现在检测多种形式的这种问题,同时试图避免标记恰好包含"ignore"或"act as"等词的普通描述。更大的方向是**跟踪代理能力和权限的变化**,而不是简单地生成另一份安全发现列表。但这对我们提出了一个问题:了解代理的能力在事件之前真的有用,还是只有在事件之后才有用?如果在事件之前有用,什么是合适的接口?CLI + CI + SARIF/HTML?或者你实际上想要一个交互式视图来显示类似内容:> "显示我们所有代理中可能引入指令注入的所有MCP工具。" 我们目前故意不构建用户界面。--- 你会使用它吗,还是这是一个没人需要解决的问题?很好奇听到运行实际MCP/代理系统的人的意见。--- 如果你想在自己的代理项目上尝试它,我们真心感谢反馈和贡献。你可以在此查看:ikaruscareer/SafeAI on GitHub。
查看原文

相似文章

我认为大多数AI代理的安全性远低于其开发者的预期

Reddit r/AI_Agents

文章认为,AI代理安全常被过度强调,尤其是对提示注入的关注,而忽视了更广泛的风险,如未授权工具使用、数据访问和金融交易。它呼吁更多地关注代理在生产环境中实际可能被操控执行的任务。