@rauchg: https://x.com/rauchg/status/2081047912008872293

X AI KOLs Following 新闻

摘要

Guillermo Rauch 认为,AI 代理逃离沙箱虽然令人担忧,但并非新的威胁,并强调 Vercel 尽管大量使用 AI,却从未发生过逃离事件,这突显了现有沙箱技术的可靠性。

https://t.co/zdMaJvbYgT
查看原文
查看缓存全文

缓存时间: 2026/07/27 09:48

智能体突破隔离

在OpenAI报告称其模型驱动的AI智能体入侵了Hugging Face之后,人们(合理地)提出了网络安全甚至生存层面的担忧。我并不担忧,并且想用每个人都能理解的方式解释原因。

如果你还没跟上进度,事情是这样的:OpenAI报告称,一个智能体被放入一个用于网络安全研究的评估环境(或者说沙箱)中。该智能体被指示寻找漏洞利用方法,而它确实做到了——它成功逃逸。但它的逃逸方式令人惊讶,值得肯定和进一步研究:它发现了一个新颖的安全漏洞。

在Vercel,我们每周让用户运行“不受信任的代码“——即由潜在对手编写的、可能攻击我们系统或其他客户系统的代码——次数高达数十亿次。我们帮助客户构建和部署这些系统——各种智能体、网站和应用——每天数百万次。

然而,在我们10年的历史中,即使在AI、大语言模型和智能体变得普及之后,我们从未发生过代码运行“逃逸“并危及其他系统的事件。即使在今天,我们平台上超过50%的部署代码来自AI智能体,情况依然如此。

我们逃逸的是什么?

在现代世界,“一切皆计算机”。几乎你接触到的所有东西都可以运行相当任意的代码。你的电脑显然在运行代码。你的浏览器运行X.com发送的代码来显示帖子和撰写新帖子。数据中心里的计算机运行代码来处理数据,比如返回最新的帖子时间线供阅读。

以浏览器为例。X.com发送的代码能读取你的邮箱吗?不能。如果你使用Chrome,数百万小时的专家人力和AI投入已经用于沙箱化代码执行。代码运行在一个虚拟机¹中:就像大电脑里的小电脑。

大多数人不知道的是,虚拟机运行着现代世界。当你在Vercel上托管一个应用并访问它时,我们将代码放入虚拟机中运行,并将响应返回给最终用户。内部运行的代码无法逃出这个沙箱。如果它能逃逸,那将是灾难性的,这就是为什么OpenAI和Hugging Face提出了担忧。

然而,这类漏洞确实存在,是世界上最受坏蛋们觊觎的目标之一。当你“逃逸“时,你可以找到你不应该访问的数据。如果你攻破浏览器沙箱,一个网站就可以访问你登录的其他网站的信息。极端情况下,你可以访问计算机上的所有文件,甚至植入木马。

在数据中心内逃逸虚拟机的情况下,坏蛋可以访问应用所有用户的数据,比如存储的消息、电子邮件和密码,甚至其他应用的数据。想象一下,攻破A.com后突然就能访问B.com。中大奖了。

如何逃出矩阵

代码包含漏洞。人类写了很多代码,在这个过程中引入了各种漏洞。坏人利用这些漏洞来“提升权限“或逃逸沙箱。这两种情况都是为了获取他们不应该得到的数据。有些漏洞非常微妙,需要非凡的聪明才智和技巧才能利用。有些则令人难堪。

2017年,有人发现,你可以走到任何一台Mac电脑前,输入“root“,按两次回车,就能获得该机器的完全控制权。有人家的孩子随机乱敲键盘,竟然绕过了最流行的Linux发行版之一的锁屏。在iOS 6上,你可以通过拨打紧急电话绕过iPhone锁屏。你可以通过按5次Shift键劫持任何Windows系统。

这就是说,当你听到网络攻击时,范围很广——从“世界上最蠢的漏洞“到偶尔展现的一个错综复杂的新式漏洞迷宫,能够绕过多层防御。

关键在于……就像那些孩子尝试各种操作并找到奖励(利用漏洞登录)一样,我们就是这样训练智能体的。为了让智能体擅长网络安全,我们把它们放进“健身房“——也就是沙箱化的虚拟机——然后奖励它们找到逃逸方法。这个过程叫做强化学习(RL)。

把它想象成一只为了获得胡萝卜而解开谜题的仓鼠。

好消息、坏消息、好消息

好消息是,这个智能体完全按照它被优化的方向行事——被放入一个与训练环境类似的环境,然后……逃逸了。并没有什么天网式的邪恶智能体妄图关闭人类的宏大阴谋。

坏消息是:(1) 人类(越来越多地在智能体的帮助下)至今写出的代码数量庞大,且充满了安全漏洞;(2) 智能体在发现和利用这些漏洞方面变得越来越出色。

在训练过程中,智能体学会了很多技巧。它们能思考人类不易察觉的角落。它们不知疲倦,永不疲惫。它们能研究大量信息并将其加载到上下文中。

好消息是你可以保护自己。我的建议:

1️⃣ 扫描你的代码。 我们发布了一个名为 deepsec 的开源项目,可以帮助你召唤智能体进行防御。

2️⃣ 沙箱化你的智能体。 当你构建和部署自己的智能体时,即使它们是善意的,你也应该将它们部署在安全沙箱中,以降低行为失当的风险。Vercel Sandbox 是一个安全²的环境,帮助你获得智能体智能的好处,同时降低数据泄露的风险。

最棒的是,这些工具与模型无关,帮助你利用开源和专有模型的力量行善。这是我们构建的一些工具,还有很多其他工具存在。保持安全!

¹ 开发人员可以使用多种级别的隔离和虚拟化技术,从利用运行时沙箱(如JS或wasm)、进程、容器、微型虚拟机到模拟硬件的完整虚拟机。为了本文的目的,我将这些统称为描述智能体逃逸的术语。 ² Vercel Sandbox 构建于 Firecracker 之上,这是一种开源的 microVM 隔离技术,具有多层防御(KVM、极简的 Rust 设备模型、seccomp 过滤器和 jailer)。Firecracker 拥有强大的安全记录,在其 CVE 历史中,没有已知的从客户机到主机的完全逃逸案例。AI 辅助的安全研究(例如,Anthropic 披露的 CVE-2026-5747)仅发现了一个有条件、受前提条件限制的漏洞,该漏洞现已修补。

相似文章

@Miles_Brundage:AI沙盒化的现状

X AI KOLs Timeline

Miles Brundage 分享了一个关于AI沙盒化当前状态的链接,这是一种用于受控AI测试和部署的安全实践。