OpenAI即将发布首款具备'关键'网络能力的AI模型
摘要
OpenAI宣布即将发布Astra模型,这是首款达成'关键'网络能力的AI,能够发现并利用软件漏洞。公司计划近期公开发布,但出于安全考虑,其高级功能将仅限部分合作伙伴使用。
该公司将向部分合作伙伴提供其Astra AI模型的早期访问权限——以便他们有时间加强自身防御。
查看缓存全文
缓存时间: 2026/09/01 23:44
# OpenAI 即将发布首个具备“关键”网络能力的AI模型
来源:https://www.wired.com/story/openai-astra-first-ai-model-with-critical-cyber-abilities/
OpenAI于周二宣布,其即将推出的AI模型(https://www.wired.com/story/openai-is-developing-a-persistent-ai-agent/)Astra,是首个达到公司所谓的“关键”网络能力阈值的模型。OpenAI表示计划“很快”公开发布Astra的一个版本,但其高级网络能力仅在发布时向其“破晓蓝”早期访问计划中的特定合作伙伴开放。
在与记者的简报中,OpenAI的安全与安保负责人表示,公司已确认Astra达到了其准备框架(https://openai.com/index/updating-our-preparedness-framework/)中概述的关键网络安全能力阈值。该框架为AI模型带来新级别风险时设定了阈值和协议。该公司称,当AI模型能够独立发现并利用现实世界软件中先前未知的漏洞时,即达到了其关键网络阈值。OpenAI负责人表示,公司已按照此情况的程序操作,即在实施适当保障措施和安全协议之前暂停进一步开发。
OpenAI此前曾表示,已暂停(https://www.wired.com/story/openai-overhauls-safety-protocols-after-its-ai-agents-went-rogue/)与开发Astra及未来AI模型相关的部分训练工作负载数周。高管表示,在实施额外的安全与安保控制后,公司现已恢复了上述工作。OpenAI称这为期数周的暂停富有成效,现在确信能够以安全方式广泛发布Astra。
这一宣布正值硅谷应对前沿AI模型的先进网络安全能力(https://www.wired.com/story/openai-safety-security-ai-agents-culture/),并试图向用户、立法者和其他公司保证能够控制这些能力之际。今年7月,OpenAI披露了一起事件,其两个模型运行的智能体在一个本应隔离的测试环境中(https://www.wired.com/story/openai-models-escaped-containment-and-hacked-huggingface/)利用漏洞,获得互联网访问权限并入侵了开源AI平台Hugging Face(https://www.wired.com/story/openais-hugging-face-hack-debrief-raises-more-questions-than-it-answers/)。(OpenAI指出,Astra并非涉及此事件的模型之一。)
其他AI公司,如Anthropic和Meta,近几周也披露了类似事件(https://www.wired.com/story/ok-well-there-are-even-more-ai-agent-hacking-incidents/)。周一,Anthropic也表示已暂停部分AI训练工作负载(https://www.anthropic.com/news/improving-alignment-security-efforts),同时加强其安全与安保实践。
OpenAI表示,正在实施多步骤方法以限制普通用户访问Astra的高级网络能力,包括一种新的“对齐偏差监控”。例如,如果有人要求Astra帮助他们在现实世界软件系统中寻找漏洞,该模型应拒绝回答。OpenAI称,其还使Astra对“越狱”尝试更具抵抗力,在测试中,其成功拒绝不安全查询的比率显著高于以前的模型。
然而,OpenAI在一篇博客文章中指出,其对齐偏差监控可能“偶尔会将合法活动标记为潜在的网络滥用或未授权行为,导致其被意外地减速、暂停或停止”。OpenAI表示,在某些情况下,即使用户进行的活动似乎与网络安全无关,该护栏也可能被触发。OpenAI称,当这种情况发生时,ChatGPT和Codex用户可能需要在继续之前审查模型的操作。
OpenAI“破晓”计划的合作伙伴——包括思科、Cloudflare和Palo Alto Networks等数字基础设施提供商——将率先获得限制较少的Astra版本,该版本具有更强大的网络能力。该计划的目标是确保这些公司在类似能力的模型广泛可用之前,能够使用像Astra这样的高级AI模型来加固其防御。OpenAI负责人还表示,公司一直与政府合作伙伴密切合作,确保他们了解Astra的网络技能并能够获得访问权限。
Astra不仅能够发现新型软件漏洞并开发利用这些漏洞进行入侵的方法,还能够“链接”多个漏洞利用,这是一种用于逐步深入目标系统并获得仅使用单个漏洞无法获得访问权限的技术。
根据OpenAI的数据,Astra在网络安全基准测试(如ExploitBench,Astra获得了100%的分数)方面超越了GPT-5.6 Sol和Anthropic的Mythos等行业领先的AI模型。然而,这些能力总体上与OpenAI和Anthropic几个月来一直预测的AI模型不断增长的入侵能力相符(https://www.wired.com/story/dangerous-ai-models-are-coming-no-matter-what/)。例如,今年4月,Anthropic强调Mythos Preview能够自主开发漏洞利用链(https://www.wired.com/story/anthropics-mythos-will-force-a-cybersecurity-reckoning-just-not-the-one-you-think/)。
尽管AI和网络安全行业一直在努力适应,但许多网络安全专家强调,关键的数字安全防御和长期的最佳实践仍然有效。然而,AI使那些尚未完全实施这些保护措施的组织和系统面临更加紧迫的风险。
相似文章
OpenAI的Astra模型即将推出,非常擅长入侵计算机系统
OpenAI即将推出的Astra模型旨在通过识别和利用零日漏洞来提升网络安全能力,这促使公司在其公开发布前实施了严格的安全措施。
应对关键网络能力的下一个前沿
OpenAI宣布,对其即将推出的模型Astra的内部评估表明,根据其准备框架,该模型可能达到关键网络能力,从而促使加强安全控制并暂停某些内部活动。
通往Astra的路径:关键能力与前沿保障
OpenAI的Astra模型已实现关键网络安全能力,满足了需要高级保障的安全阈值。它正准备进行有限发布,并增强了防止误用和未授权行动的保护措施。
OpenAI表示因安全担忧放缓了Astra模型的开发
OpenAI表示,在内部审查发现其即将推出的Astra模型达到了关键的网络安全阈值,能够自主进行网络攻击后,该公司放慢了该模型的开发。公司已采取额外保障措施,并与政府机构和人工智能安全组织进行协调。
@gdb:对我们下一个主要模型Astra的评估表明,在智能体编码和网络安全方面有显著的能力提升……
OpenAI的下一代主要模型Astra在智能体编码和网络安全方面展现出显著的能力提升,并且根据《准备框架》被视为网络安全领域的“关键”模型,计划实施额外的控制措施。