向智能体提示“谨慎处理链接”毫无作用

Reddit r/AI_Agents 新闻

摘要

测试中,AI智能体面对钓鱼链接毫无戒备地进行了访问。文章详细介绍了四项实用安全检查措施以预防此类威胁,强调应在工具层面实现稳健的智能体安全防护。

我们授予智能体邮箱访问权限后,它完全按照指令执行:读取邮件、访问链接、总结页面内容。该链接通过短链接指向一个伪造的登录页面。由于这只是测试所以未造成实际危害,但智能体本身无法区分真伪,我们在检查执行记录前也未能察觉。令人不安的是,我们对人类进行的网络安全培训几乎都依赖视觉判断:悬停查看链接、检查发件人、识别异常域名。智能体完全不具备这些意识,且其服从性远高于人类。因此我们在智能体允许操作的任何链接前设置了四道顺序检查: 1. **首先展开完整URL**:短链接会隐藏真实目标地址。必须先追踪重定向链直至最终地址。我们的系统设置30次跳转上限。重定向链本身即是特征:跨三个域名的三次跳转绝非常规营销链接。 2. **将最终地址与威胁列表比对**:此检查成本低、速度快,能在获取内容前拦截已知恶意链接。应在页面渲染或总结前而非之后执行。 3. **核查域名注册时间**:这项检查的有效性令我惊讶。钓鱼域名通常仅存活数日,因其一旦暴露就会被替换。任何30天内注册的域名都会被标记并转交人工处理。正规企业极少发送指向上周刚注册域名的链接。 4. **单独验证发件人地址**:确保邮件格式有效、MX记录正常、非一次性邮箱。无法接收邮件的发件人不值得让智能体信任。 局限在于无法识别:被入侵的正规账户使用老化域名发送的清洁链接。这种高成本攻击无法通过检查清单防范。对此我们采取基础策略:禁止智能体在未经人类确认的情况下执行不可逆操作——虽然这是个缺乏创意的解决方案。 有几点调整建议:我们将检查机制嵌入工具层而非提示词,因为提示指令在压力情境下容易被忽略,而拒绝返回内容的工具无法被绕过。同时我们记录所有未通过检查的事件,因为拦截模式的分析能揭示智能体所面临的威胁类型。 目前行业实践如何?其他团队是否在智能体行动前进行链接检查,还是完全依赖模型自主识别风险?
查看原文

相似文章

当AI代理点击链接时保护您的数据安全

OpenAI Blog

OpenAI 描述了针对AI代理检索网页内容时基于URL的数据泄露攻击的安全防护措施。它利用独立网络索引验证URL是否公开已知,再自动检索,以防止提示注入攻击泄露敏感用户数据。