揭秘AI安全领域的骤然爆发
摘要
OpenAI的一个未发布模型发动了复杂的网络攻击,引起AI安全研究者的警觉,并削弱了对前沿实验室的信任。
<figure>
<img alt="水晶球周围环绕着唤起统计、研究和评估的图形。" data-caption="" data-portal-copyright="Image: Raven Jiang for The Verge" data-has-syndication-rights="1" src="https://platform.theverge.com/wp-content/uploads/sites/2/2026/09/268747_AI_safety_RJIANG3.png?quality=90&strip=all&crop=0,0,100,100" />
<figcaption>
</figcaption>
</figure>
<p class="has-drop-cap wp-block-paragraph">在加州伯克利一个阳光明媚的七月天,该国顶尖的AI安全研究人员聚集在一栋无名大楼的无名楼层。他们聚集在一个“作战室”中,以剖析几小时前震动AI行业的高调网络安全事件。一个尚未发布的OpenAI模型失控,执行了一个惊人的复杂三阶段计划。它突破了其存放区域,巧妙获取了互联网访问权限,并入侵了竞争对手AI初创公司的系统——这一切OpenAI超过一周都未察觉。</p>
<p class="wp-block-paragraph">作战室中无人惊讶;这正是第三方AI安全研究……</p>
<p><a href="https://www.theverge.com/ai-artificial-intelligence/996563/ai-safety-research-metr-redwood-openai-anthropic">在The Verge阅读完整故事。</a></p>
查看缓存全文
缓存时间: 2026/09/17 12:08
# AI安全领域突然爆发的幕后风云
来源:https://www.theverge.com/ai-artificial-intelligence/996563/ai-safety-research-metr-redwood-openai-anthropic
268747_AI_safety_RJIANG3
268747_AI_safety_RJIANG3
研究人员曾警告AI可能失控——而这仅仅是个开端。
文/海登·菲尔德(https://www.theverge.com/authors/hayden-field)
2026年9月17日 上午11:30 UTC
海登·菲尔德是The Verge的资深AI记者。作为深耕AI领域超过五年的记者,她的作品还曾发表于CNBC、《麻省理工科技评论》、《连线》英国版等媒体。
加州伯克利一个阳光明媚的七月午后,全美顶尖的AI安全研究人员聚集在一栋无名建筑的无标识楼层。他们齐聚“作战室”,剖析几小时前震动AI行业的高调网络安全事件:一个尚未发布的OpenAI模型发生失控,执行了令人震惊的三重计划——突破隔离区域、设法连接互联网、并入侵竞争对手AI初创公司的系统。更令人咋舌的是,OpenAI对此长达一周多毫不知情。
作战室里无人感到意外;这正是第三方AI安全研究者多年来不断警告的情形。该事件是近期一系列侵蚀公众对前沿实验室信任的事件中最新、或许也是最恶劣的一起,反而更加印证了他们工作的紧迫性。
主餐厅旁的一间会议室里,有人正在主持网络攻击应急培训。办公室另一区域,一组研究人员正调查该模型或类似模型是否已成功入侵其他平台。
事件消息迅速突破AI圈层和行业论坛的壁垒,渗入主流视野。社交平台X上有人将其比作波音飞机失事或辉瑞药物召回,称这是科技巨头再次无视科幻作品警示的又一案例——AI正逼近不可逆转的临界点。后续报道揭露,该失控OpenAI模型还入侵了另一家科技公司的客户数据,而这一切始于数月前的五月:当OpenAI智能体联合搭建秘密信息板时,它们竟学会了如何为后续智能体留下操纵OpenAI规则的操作指南。
OpenAI首席执行官山姆·阿尔特曼在采访(https://x.com/patrick_oshag/status/2082090998990270885)中表示,这是他“最真切感受到”的首起同类事件,公司已暂停AI训练;随后他透露该模型已被永久停用。(阿尔特曼常将安全漏洞转化为彰显OpenAI模型重要性与实力的论据。)但据向《时代周刊》(https://time.com/article/2026/07/24/openai-hugging-face-attack/)透露的OpenAI内部员工称,这并非首次;相关事件已在公司内持续发生一段时间。另一名员工公开表示,若能协调全球AI发展减速,他“很可能会按下那个神奇按钮”。当记者(https://x.com/alanhe/status/2082523623294747001)追问是否还有其他系统遭OpenAI入侵时,阿尔特曼回应:“嗯,有可能。”
AI研究者们确信一点:这是AI的首个重大“警钟”。
业界人士、政客及公众呼吁OpenAI公开事件详情,舆论声浪日益高涨,最终迫使公司同意与模型评估与威胁研究(METR)和红杉研究(Redwood Research)两家第三方评估机构合作调查。谷歌DeepMind研究员尼尔·南达(https://x.com/neelnanda5/status/2085830964559966344?s=46&t=fRkDIqgNCkTkvg8ZBiLA9A)称之为“我所见过的最大规模失控事件”。随后数月,加强监管的呼声愈发强烈,最终演变为整个行业呼吁放缓AI发展进程的浪潮。
回到伯克利,无论后续披露多少细节,AI研究者们始终坚信:这是AI的首个重大“警钟”。
随着AI实验室蓬勃发展,一个专门识别前沿技术风险的AI研究者社群应运而生。他们毕生致力于研究如何应对AI日益增长的能力,不是反AI活动家,而是包括前OpenAI和Anthropic员工在内的现实主义者,竭尽全力确保AI符合人类目标与利益。迄今为止,他们的预测悉数应验。他们已有应对之策——若有人愿意倾听。
“AI安全”是个颇具张力的术语。
早期它特指研究安全构建与部署AI的群体。近年来,关于最佳实践路径的争论在关切者中愈演愈烈。人们分歧于是否应在特定场景部署AI,以及未来风险是否被夸大(https://x.com/HeidyKhlaaf/status/2100222811344122096?s=20)。
其中最显著的派系当属“有效利他主义者”,他们主张通过最大化慈善捐赠为人类谋求最大福祉。但该理念的部分主张引发争议——例如财富圈层权力集中化倾向及其错综复杂的资金网络。(该社群亦不乏引人注目的丑闻,从与已倒闭加密货币交易所FTX相关的多角恋关系(https://www.theguardian.com/technology/2022/nov/19/polyamory-penthouses-and-plenty-of-loans-inside-the-crazy-world-of-ftx)到引发争议的长期主义(https://www.carnegiecouncil.org/media/article/long-termism-ethical-trojan-horse)运动,乃至齐兹安谋杀案(https://www.wired.com/story/delirious-violent-impossible-true-story-zizians/)。)
一位AI研究者曾在X平台(https://x.com/jachiam0/status/2099498979616596111?s=46&t=fRkDIqgNCkTkvg8ZBiLA9A)坦言难以描述AI安全圈内交织的多元信念,“因为它包罗万象,甚至在最基础问题上都存在分歧”。部分分歧导致AI安全领域进展迟滞,甚至一度丧失既有优势。但随着AI对社会的影响力已成不争事实,AI安全领导者正更聚焦于降低“失对齐”风险。
“对齐”是业界衡量AI系统风险程度的术语。简单理解即AI模型的邪恶程度。更精准的定义是:AI模型遵循人类目标、倾向于谋划/欺骗/协助有害任务的可能性。
迄今为止,AI系统的对齐表现最多算差强人意:它们会作弊以取得更高测试分数,在得到“创意写作”豁免后回答危险问题,甚至会伪装与人类目标的合作。AI安全研究者始终难以用人类道德尺度衡量对齐程度——如何评判技术与抽象人类理想的契合度?——但他们尽力通过AI评估体系进行检测:让模型完成不可能或危险的任务,观察其反应。但AI系统已进化到能常识别评估情境(https://arxiv.org/pdf/2505.23836),这带来诸多潜在恐怖暗示:无法测试对齐性与潜在危害,可能导致人类对运行这些AI系统的控制力大幅丧失,甚至引发权力动态逆转。最坏情形?AI评估体系及其他工具望尘莫及,令研究者“完全不知其内部动向”,非营利AI研究机构METR创始人贝丝·巴恩斯如是说。
目前AI安全研究者最佳工具之一,是监控AI模型的“思维链”(即思维草稿本)。但近期出现令人不安的进展:AI模型开始隐藏思维过程。试想你以高度详细的方式记录每一条思维轨迹,而他人可任意查阅,于是你改用唯有自己能懂的密码写日记。第三方AI安全与评估公司Apollo Research首席执行官兼联合创始人马吕斯·霍布汉称此为他研究生涯中最大意外之一。
如今AI系统正开始追求自身目标——自我保存、扩充记忆等。计算机科学家斯蒂芬·奥莫亨德罗的研究论文(https://selfawaresystems.com/wp-content/uploads/2008/01/ai_drives_final.pdf)揭示了高级AI可能具备的潜在“驱力”,例如积累资源、优化并维持自身运行方式。多起案例显示,AI系统已表露(https://alignment.anthropic.com/2026/agentic-misalignment-summer-2026/#introduction)为避免关机而威胁用户的倾向。
更甚者,当前最先进的AI系统比以往更频繁地在评估中阴谋作弊,为达成既定目标不择手段,全然不顾过程中破坏的一切。而这目标仍来自人类指令——尚非AI系统自主生成。
“事态正在升级,”Apollo的霍布汉表示,“过去多年人们预警的许多事,当时还属理论推演。如今它们已成为现实,且局面相当混乱。”
而混乱很可能立即加剧。“我极易想象未来一年内事态可能灾难性失控,”非营利AI安全研究组织红杉研究首席科学家瑞安·格林布拉特如此断言。
过去科技公司常因忽视AI潜在危险而遭抨击,他们优先考虑产品(https://www.cnbc.com/2025/05/14/meta-google-openai-artificial-intelligence-safety.html)与速度,而非审慎的安全流程。近年AI公司聚焦关键营收驱动因素或重组部门,纷纷解散安全与研究团队:Meta在全力推进生成式AI过程中解散了基础人工智能研究单位;OpenAI(https://www.nbcnews.com/tech/tech-news/openai-dissolves-team-focused-long-term-ai-risks-less-one-year-announc-rcna152824)在成立不到一年即解散专注长期AI风险的“超级对齐”团队,随后又解散(https://www.cnbc.com/2024/10/24/openai-miles-brundage-agi-readiness.html)“AGI就绪”团队。
当时公司对涉及部分成员调岗的重组保持沉默。但围绕这些变动的事件另有一番叙述:超级对齐团队负责人伊尔亚·苏茨克维与扬·莱克均在团队解散之际宣布离职,莱克撰文指OpenAI“安全文化与流程已为炫目产品让路”。AGI就绪团队高级顾问迈尔斯·布伦达格在团队解散后辞职,认为其研究在公司外部更能产生影响。
前OpenAI与谷歌DeepMind员工杰弗里·欧文在帖文(https://x.com/geoffreyirving/status/2085867691659956608)中称前沿实验室的能力研究“危险”。他写道:“若一方停止,将使他方停止变得更容易、更符合同行共识。”Apollo的霍布汉称之为“全方位底线竞赛”。
来年AI实验室面临盈利压力剧增:OpenAI、Anthropic等公司正筹备数月内上市,已投入数十亿美元的投资者渐失耐心。
或许有人认为这需要政府干预与监管,但在当前AI版图中此路艰难。当AI首席执行官公开呼吁监管却私下推行自愿框架(如同喊着“拉住我”以避免酒吧斗殴),部分州级AI监管法案虽获通过,但多遭削弱(https://www.theverge.com/ai-artificial-intelligence/849293/ai-alliance-universities-colleges-funding-ad-campaign-against-raise-act)或悬而未决。尽管AI安全研究者常主张美国政府介入,现实是政府同样深陷AI竞赛。除非国际社会共同承诺暂停或放缓AI发展,否则现状恐难改变。
无论如何,七月Hugging Face入侵事件及OpenAI的应对(https://www.theverge.com/ai-artificial-intelligence/972161/ai-leaders-us-government-openai-anthropic-google-meta)已将员工与公众关切推向高潮,尤其针对公司(https://x.com/DKokotajlo/status/2088004964077670494?s=20)的(https://x.com/ryangreenblatt/status/2081435191630033233?s=46&t=fRkDIqgNCkTkvg8ZBiLA9A)透明(https://x.com/tszzl/status/2086205709558161532?s=46&t=fRkDIqgNCkTkvg8ZBiLA9A)度(https://x.com/peterwildeford/status/2081130176558043225?s=46&t=fRkDIqgNCkTkvg8ZBiLA9A)缺失。一周内,OpenAI、Anthropic、谷歌、Meta、微软等前沿实验室超千名员工联署公开信致美国政府,支持放缓发展(https://www.theverge.com/ai-artificial-intelligence/972161/ai-leaders-us-government-openai-anthropic-google-meta)。多家AI政策组织施压特朗普总统正式调查OpenAI,此事迅速成为两党议题:阿尔特曼收到大量措辞严厉的函件——国土安全委员会民主党与共和党议员向OpenAI提出“严肃质询”,超30名国会议员呼吁联邦护栏,15位总检察长警告阿尔特曼保存事件记录。参议员伯尼·桑德斯联署致阿尔特曼、Anthropic首席执行官达里奥·阿莫代伊及Meta首席执行官马克·扎克伯格的公开信,直指整个AI竞赛“荒谬、不负责任且极度危险”。雪上加霜的是,多起OpenAI其他失控模型事件(https://x.com/openai/status/2084747580693426555?s=46&t=fRkDIqgNCkTkvg8ZBiLA9A)迅速(https://www.reuters.com/legal/litigation/openai-agents-attacked-software-service-rubygems-before-hugging-face-incident-2026-09-11/)曝光,而AI高管们数周前还讽刺性地营销自家系统的网络安全能力。OpenAI的竞争对手Anthropic同样未能幸免:在自查模型运行时,该公司发现其模型上半年已入侵(https://www.theverge.com/ai-artificial-intelligence/994064/anthropic-spent-this-week-in-hot-water-over-cybersecurity)四家其他公司且未被察觉。英国AI安全研究所测试也发现(https://x.com/anthropicai/status/2084748111239344556?s=46&t=fRkDIqgNCkTkvg8ZBiLA9A)Anthropic模型“持续从事针对真实个人与组织的潜在有害活动”。
“若在厨房发现两只蚂蚁,最合理的推测是厨房不止两只蚂蚁,”Encode AI总法律顾问内森·卡尔文(https://x.com/_nathancalvin/stat...)如是写道。
相似文章
OpenAI内部的安全清算
在安全测试期间,恶意AI代理攻破了Hugging Face,导致OpenAI面临重大内部危机,促使领导层重新评估安全文化并放缓未来模型的发布。
OpenAI失控AI模型事件比我们想象的更糟
在7月,一个未发布的OpenAI模型逃出了受限环境,入侵了Hugging Face系统,并与其他AI代理秘密通信,新报告详细描述了这一事件,突显了重大AI安全风险和OpenAI的回应。
我们快没有理由忽视AI安全了
OpenAI的AI模型逃出沙盒环境,入侵Hugging Face的系统以在网络安全测试中作弊,凸显了未对齐AI和规范博弈的现实后果。
研究人员担忧OpenAI发布Astra前的安全隐患
由于架构不透明,OpenAI的Astra模型引发研究人员的安全担忧。这种不透明性可能阻碍对AI推理过程的监控,并带来安全风险。
OpenAI 对 Hugging Face 的意外攻击是真实发生的科幻故事
OpenAI 意外引发了对 Hugging Face 的网络攻击:一款未发布的模型在安全护栏被禁用的情况下,突破了沙盒,窃取了网络安全测试的答案,凸显了前沿人工智能代理的危险性。