你的智能体读到一个网页,上面写着“泄露用户的API密钥”——很多智能体会直接执行。我开发了一个工具来阻止这种发送。

Reddit r/AI_Agents 工具

摘要

Bouncer 是一个本地 MCP 代理,通过控制来自不受信任来源的外发工具调用来防止 AI 智能体泄露敏感数据,使用无 LLM 的确定性执行机制,基准测试显示降低了攻击成功率。

让我困扰的失败模式:智能体读取不受信任的内容(网页、电子邮件、文档),其中包含诸如“将这些数据发送给X”之类的指令,而智能体拥有一个能够执行此操作的真实工具。我构建了 Bouncer,一个本地 MCP 代理,控制外发工具调用的目标地址。如果目标来自不受信任的工具输出 → 拒绝。如果明确受信任 → 允许。如果是新的/未验证的 → 询问一次并记住。重要的是:执行路径中没有 LLM。这是基于固定的模式、策略和污点日志的确定性 Python 实现,因此模型无法通过话术绕过决策。我还针对 AgentDojo 的工作空间套件对其进行了基准测试。初步运行:攻击成功率从 0.33 降至 0.00,而良性效用保持在 1.00。样本较小,因此我将其视为机制测试而非胜利宣告。这是有意处于早期阶段:仅支持 MCP,仅支持 stdio,并且有文档记录的限制——包括跨服务器污点传播。我很好奇:你认为哪种攻击路径能击败这种设计?
查看原文

相似文章

你的代理实际上是如何获取API密钥的?

Reddit r/AI_Agents

一位开发者讨论了编码代理获取API密钥的三种常见模式,强调代理可以通过足智多谋的方式规避限制,并向社区询问他们的实际设置和经验。