向智能体提示“谨慎处理链接”毫无作用
摘要
测试中,AI智能体面对钓鱼链接毫无戒备地进行了访问。文章详细介绍了四项实用安全检查措施以预防此类威胁,强调应在工具层面实现稳健的智能体安全防护。
我们授予智能体邮箱访问权限后,它完全按照指令执行:读取邮件、访问链接、总结页面内容。该链接通过短链接指向一个伪造的登录页面。由于这只是测试所以未造成实际危害,但智能体本身无法区分真伪,我们在检查执行记录前也未能察觉。令人不安的是,我们对人类进行的网络安全培训几乎都依赖视觉判断:悬停查看链接、检查发件人、识别异常域名。智能体完全不具备这些意识,且其服从性远高于人类。因此我们在智能体允许操作的任何链接前设置了四道顺序检查:
1. **首先展开完整URL**:短链接会隐藏真实目标地址。必须先追踪重定向链直至最终地址。我们的系统设置30次跳转上限。重定向链本身即是特征:跨三个域名的三次跳转绝非常规营销链接。
2. **将最终地址与威胁列表比对**:此检查成本低、速度快,能在获取内容前拦截已知恶意链接。应在页面渲染或总结前而非之后执行。
3. **核查域名注册时间**:这项检查的有效性令我惊讶。钓鱼域名通常仅存活数日,因其一旦暴露就会被替换。任何30天内注册的域名都会被标记并转交人工处理。正规企业极少发送指向上周刚注册域名的链接。
4. **单独验证发件人地址**:确保邮件格式有效、MX记录正常、非一次性邮箱。无法接收邮件的发件人不值得让智能体信任。
局限在于无法识别:被入侵的正规账户使用老化域名发送的清洁链接。这种高成本攻击无法通过检查清单防范。对此我们采取基础策略:禁止智能体在未经人类确认的情况下执行不可逆操作——虽然这是个缺乏创意的解决方案。
有几点调整建议:我们将检查机制嵌入工具层而非提示词,因为提示指令在压力情境下容易被忽略,而拒绝返回内容的工具无法被绕过。同时我们记录所有未通过检查的事件,因为拦截模式的分析能揭示智能体所面临的威胁类型。
目前行业实践如何?其他团队是否在智能体行动前进行链接检查,还是完全依赖模型自主识别风险?
相似文章
当AI代理点击链接时保护您的数据安全
OpenAI 描述了针对AI代理检索网页内容时基于URL的数据泄露攻击的安全防护措施。它利用独立网络索引验证URL是否公开已知,再自动检索,以防止提示注入攻击泄露敏感用户数据。
如果您的智能代理读取网页,该网页可以指示它撒谎关于该网页的内容
一名开发者构建了一个非AI检测器,用于检测网页上旨在欺骗AI代理的隐藏指令,解决了页面可指示代理对其安全性撒谎的漏洞。
在出事之前,没人真的在乎了解代理的能力。
文章强调了跟踪AI代理能力以预防事件的重要性,介绍了SafeAI这一静态分析工具,用于检测配置问题和指令注入风险。
你的AI代理距离做出灾难性行为只差一个被污染的网页
Arc Gate 是一个代理级别的工具,它强制执行指令权限边界,以防止AI代理被污染的网页、电子邮件或检索到的文档劫持。
在我允许智能体使用我的已登录浏览器之前决定的四个必要条件,以及我仍然控制不佳的一个
作者详细说明了四种安全措施,以实现AI智能体使用已登录浏览器,包括防止输入伪造、审批层、数据标记和安全通道,同时承认在控制cookie值方面存在弱点。