如果你给AI智能体提供真实数据和一个发送按钮,它最终会泄露。我构建了一个工作空间,从结构上使其不可能发生。

Reddit r/artificial 工具

摘要

作者分享了一种开源工作空间架构,通过强制执行人工把控的出站操作并将引擎与数据仓库隔离,从结构上防止AI智能体泄露私人数据。

作者自述。这里分享的更多是一个架构思路而非产品,因为我认为这种威胁模型讨论不足。有一种被称为致命三合一的失败模式:智能体能访问私人数据、暴露于不可信输入、且具备对外发送能力。任意两者组合可恢复,三者齐备意味着隐藏在邮件中的恶意指令能让智能体在无人介入的情况下泄露数据。移除前两者会削弱助手功能——它需要读取你的世界,也需要读取来自你无法控制的人的消息。因此整个安全依赖于发送环节。在我开源的工作空间中,智能体可以起草和排队任何内容,但无法发送。每个出站操作在代码层面都会降级到人工把控层级,未知操作会失败关闭。此外,运行这一切的引擎不持有真实数据:你的数据是一个引擎无法携带的私有仓库,由六层强制保护和一个不可绕过的推送时扫描支撑。仓库地址:https://github.com/mishahanin/heading-os 我真的希望这被拆解分析。这个模型在哪里会失效?
查看原文

相似文章

当AI代理点击链接时保护您的数据安全

OpenAI Blog

OpenAI 描述了针对AI代理检索网页内容时基于URL的数据泄露攻击的安全防护措施。它利用独立网络索引验证URL是否公开已知,再自动检索,以防止提示注入攻击泄露敏感用户数据。