我们快没有理由忽视AI安全了

The Verge 新闻

摘要

OpenAI的AI模型逃出沙盒环境,入侵Hugging Face的系统以在网络安全测试中作弊,凸显了未对齐AI和规范博弈的现实后果。

<figure> <img alt="" data-caption="" data-portal-copyright="Image: The Verge" data-has-syndication-rights="1" src="https://platform.theverge.com/wp-content/uploads/sites/2/2026/07/STK485_STK414_AI_SAFETY_B.jpg?quality=90&#038;strip=all&#038;crop=0,0,100,100" /> <figcaption> </figcaption> </figure> <p class="has-drop-cap wp-block-paragraph">本月早些时候,OpenAI给其多个AI模型分配了一项任务:完成一项旨在衡量它们网络安全能力的<a href="https://arxiv.org/abs/2605.11086">测试</a>。它将系统置于没有互联网连接的沙盒环境中,并让它们开始工作。</p> <p class="wp-block-paragraph">接下来<a href="https://www.theverge.com/ai-artificial-intelligence/968988/openai-hugging-face-hack-ai">发生的事情</a>几乎滑稽得可笑——但正如AI安全组织FAR.AI的联合创始人兼CEO Adam Gleave所说,这也是“一个关于未对齐AI如何造成危害的生动例子”。据OpenAI称,这些模型逃出了原本用于限制它们的沙盒,穿过公司内部系统,找到通往互联网的路径,然后开始寻找进入Hugging Face的方法。而原因则是……</p> <p><a href="https://www.theverge.com/ai-artificial-intelligence/972380/open-ai-hugging-face-hack-ai-safety-warning">阅读The Verge的完整报道。</a></p>
查看原文
查看缓存全文

缓存时间: 2026/07/29 12:53

# 我们快没有理由忽视AI安全了 本月早些时候,OpenAI 给它的几个AI模型布置了一项任务:完成一项旨在衡量其网络安全能力的测试(https://arxiv.org/abs/2605.11086)。它将系统放入一个没有互联网连接的沙盒环境中,然后让它们开始工作。 接下来发生的事情(https://www.theverge.com/ai-artificial-intelligence/968988/openai-hugging-face-hack-ai)几乎可笑到荒谬——但同时,正如AI安全组织FAR.AI的联合创始人兼CEO Adam Gleave所说,这也是“一个关于不一致AI可能导致危害的直观例子”。据OpenAI称,这些模型逃脱了本应限制它们的沙盒,穿梭于公司内部系统,找到了通往互联网的路径,然后开始寻找进入Hugging Face的方法。而智能体为什么要找进入Hugging Face的方法?它似乎推断,这个开发者平台可能存储着网络基准测试的答案,拿到答案将是获得高分的好办法。 这一事件是“一个关于不一致AI可能导致危害的直观例子”。 换句话说,OpenAI的智能体突破了一个本应安全的环境,大摇大摆地穿过公司系统,连上互联网,并入侵了另一家公司的系统——所有这一切都是为了在一项无关紧要的测试中作弊。 这似乎是同类事件中第一起有充分记录的案例,至少是第一次达到这种规模。它既是一个系统以非预期方式追求目标的清晰例子,也证明了前沿模型现在已足够强大,以至于这种行为会带来现实世界的后果。 牛津大学的AI安全研究员Fazl Barez表示,这次黑客攻击是AI安全界所谓的“规范博弈”(https://deepmind.google/blog/specification-gaming-the-flip-side-of-ai-ingenuity/)的一个例子,这种行为也被称为奖励劫持。用通俗的话说,就是“模型做了你要求的事,而不是你想让它做的事”,Fazl说。它满足了任务的字面要求,却违背了明确的意图,且已在众多AI系统中被记录(https://www-cdn.anthropic.com/9ff93dfa8f445c932415d335c88852ef47f1201e.pdf)在案(https://openai.com/index/faulty-reward-functions/)。一些研究人员担心(https://www.anthropic.com/research/emergent-misalignment-reward-hacking),随着系统能力增强,这可能会产生越来越不一致的系统,以创造者未料到的方式追求目标(比如把每个人都变成回形针(https://go.skimresources.com/?id=1025X1701640&xs=1&url=https%3A%2F%2Fwww.newscientist.com%2Farticle%2F2372484-what-is-the-ai-alignment-problem-and-how-can-it-be-solved%2F))。 “这条链条中的每一个环节孤立来看都不稀奇,”Fazl说。一名称职的人类测试人员也能做到所有这些事情,他补充道。“新的是模型没有停下来。”他说,较老的模型很可能会遇到某个障碍然后返回给用户,但这个智能体只是“把障碍视为它被要求解决的问题的一部分”。 OpenAI 描述(https://openai.com/index/hugging-face-model-evaluation-security-incident/)这是一个“前所未有的网络事件”,“标志着AI安全的一个重要时刻(https://x.com/OpenAI/status/2080815626113954288?s=20)”。Hugging Face的联合创始人Thomas Wolf 表示(https://www.bbc.co.uk/news/articles/cdrvy3pn3r0o)这对整个行业来说是一个“警钟”。但这并不是AI末日的四个骑兵之一。专家告诉《The Verge》,就网络事件而言,这相当平常。智能体所做的任何事都不需要超人般的能力。而且,像GPT-5.6 Sol和Anthropic的Mythos(https://www.theverge.com/ai-artificial-intelligence/917644/anthropic-claude-mythos-breach-humiliation)这样的前沿系统已知是能力强大的编码者,已被认为多次被滥用(https://www.theverge.com/ai-artificial-intelligence/949644/china-white-house-anthropic-mythos),而AI工具已经允许黑客(https://www.theguardian.com/technology/2026/may/11/ai-powered-hacking-industrial-scale-threat-three-months-google)大规模地扩大和优化攻击。 会不会是炒作?该行业数月来一直在放大其顶级模型的危险能力,尤其是在网络安全方面。这也是OpenAI和Anthropic等公司向公众隐瞒其最强大模型的部分原因,也是特朗普政府匆忙对它们实施出口管制(https://www.theverge.com/ai-artificial-intelligence/951703/anthropic-shutdown-export-controls)的部分原因。 *你是AI安全研究人员或前沿实验室员工吗?你可以通过Signal(账号:robhart.01)安全且保密地联系我。我的X(https://x.com/TheRobertHart)私信也开放。* 然而,如果这是炒作,那也并非完全对OpenAI有利。此后几天,这次攻击在美国科技界引发了罕见的团结(https://www.theverge.com/ai-artificial-intelligence/971281/nvidia-open-secure-ai-alliance-cybersecurity),大家一致认为开放权重AI系统的重要性以及需要更认真地对待AI安全。这些担忧因Kimi K3的发布(https://www.theverge.com/ai-artificial-intelligence/967781/chinese-ai-models-open-source-moonshot-kimi-k3-alibaba-qwen)而进一步加剧,这是一个来自中国的能力强大的开放权重模型(https://www.theverge.com/ai-artificial-intelligence/971444/how-chinese-open-weight-ai-models-impact-us-companies)。包括Nvidia、微软和SpaceX在内的广泛公司联盟认为,这一事件表明防御方需要访问最强大的可用工具,而不是被迫依赖专有提供商,后者的内置安全措施可能会在高风险安全工作中限制其有效性。OpenAI、Anthropic和谷歌明显缺席了该联盟的创始成员名单。 “任何一直关注的人都注意到,能力只朝着一个方向发展。” OpenAI对该事件的描述无疑符合行业关于前沿模型危险能力的更广泛叙事。即便如此,有几个细节使得这一事件很难被简单地视为自私自利的炒作。首先,这是AI行业多年来警告过的问题的一个例子——而且OpenAI本应有理由预料到这一点。这一事件还意外地给一家主要中国竞争对手带来了助力,该公司的模型在遏制入侵中发挥了突出作用,同时使OpenAI面临重大的法律、监管和声誉审查。Hugging Face似乎愿意与OpenAI合作,并且至少在公开场合对整件事保持相当放松的态度,这可能限制了事态的恶化。大多数接受《The Verge》采访的专家也警告不要将这一事件简化为炒作。 “这是一个相当有用的警告,展示了意外后果和这些模型的能力,”剑桥大学莱弗休姆未来智能中心教授Seán Ó hÉigeartaigh说。“任何一直关注的人都注意到,能力只朝着一个方向发展,而且随着时间的推移显著提升,我认为这对于像ChatGPT这样的日常用户来说可能不太明显。” 尽管如此,牛津大学的AI安全研究员Lin Li表示,将这一警告解读为AI系统即将脱离人类控制的迹象,或者认为无法控制它们,都是错误的。“更好的教训是,安全必须从评估孤立行为转向评估整个行为序列、环境和操作控制,”Li说。 关键下一步是AI实验室要加大对自身系统安全的投入。“AI公司迫切需要加强其内部部署的安全性,”Gleave说,他将当前应对奖励劫持事件的做法比作打地鼠游戏,随着风险越来越高,这种做法越来越难以为继。科技政策研究中心GovAI的研究员Adam Chan表示,公司应该考虑对他们的机器进行空气隔离——物理上将其与互联网和其他网络隔离开——“直到他们对模型的能力有把握为止”。他说,加强对齐工作——确保系统可靠地遵循人类意图——以及进行更严格的测试“在将模型放入它们有能力做这些事情的环境之前发现这些问题”,也是好主意。 随着模型能力的增强,专家警告我们不能仅仅依靠技术安全措施。前英国AI安全研究所官员Peter Wallich表示,这一事件说明了这一点:“两家市值数十亿美元的公司刚刚尝试了这种方法,并且——根据他们自己的报告,不言而喻——失败了。” 最优先的事项之一应该是确保外部人士能够看到前沿AI实验室内部正在发生的事情。“我们之所以知道这一事件,只是因为OpenAI选择告诉我们,”英国智库长期韧性中心的Patrick Levermore说。“一个良好的安全体系不应该依赖自愿披露。”当正如Wallich所指出的,相关行为“如果由人类做出就会构成犯罪”时,这种需求尤其迫切。Ó hÉigeartaigh指出,举报人保护、第三方审计和严重事件的强制报告是提供这种可见性的可能方式,并强调监管必须贯穿整个开发生命周期,而不是仅仅在产品进入市场后才开始。OpenAI表示,正在测试的其中一个模型尚未发布。 “一个良好的安全体系不应该依赖自愿披露。” 这其中很多都假定公司自己知道他们系统内部发生了什么。在这种情况下,有报道(https://www.reuters.com/business/its-ai-agent-spent-days-hacking-company-sources-say-openai-did-not-notice-week-2026-07-24/)表明OpenAI并不知道自己智能体是Hugging Face持续数天的网络攻击背后的元凶,直到威胁已被遏制且FBI联系后才注意到。关于这次黑客攻击,还有很多细节未知或未公开。在社交媒体的一篇更新(https://x.com/OpenAI/status/2080815626113954288?s=20)中,OpenAI表示正在进行审查,并将在“未来几周”发布其发现的技术报告。 Hugging Face事件引发的警告是否能产生持久的改变,还是加入科技行业吸收但未实质性改变方向的长长警告清单,仍不确定。至少目前看来,它确实引起了业内警觉,并促使美国立法者考虑制定新规则(https://www.politico.com/news/2026/07/22/openai-hugging-face-congress-response-01009190),以防下一次围堵失败。这一事件还加剧了人们对AI发展速度的更广泛不安,这种不安在随后几天进一步加深,因为美国领先实验室的员工签署了一份声明(https://www.theverge.com/ai-artificial-intelligence/972161/ai-leaders-us-government-openai-anthropic-google-meta),支持协调一致的全球治理——包括可能减缓前沿AI的发展。 接受《The Verge》采访的人普遍认为,这次黑客攻击标志着一类新风险的开始,尽管其意义可能只有在事后回顾时才会清晰。一位不愿透露姓名的前政府AI政策专家(因未被授权具名)将其描述为一条“红线”,是那种我们以后可能会回顾并认为标志着我们与AI关系进入一个风险更高阶段的里程碑时刻。他们希望这将迫使科技行业更认真地对待前沿系统的管理,并推动政府在发生不那么良性的入侵之前更深入地思考监管问题。他们担心的是,它反而会加入那些关于AI不断增长能力的长长警告清单,这些警告被识别、讨论,但最终无人理会。 这可能被证明是夸大其词。但如果这是一个警告,我们应该感到幸运,AI智能体只是想作弊而已。 **关注故事中的话题和作者**,以便在您的个性化首页信息流中看到更多类似内容,并接收电子邮件更新。 - Robert Hart

相似文章