美国主要AI实验室现需接受发布前政府安全审查
摘要
美国政府已与所有国内主要AI实验室达成自愿性发布前安全审查协议,这标志着联邦对前沿模型开发的监管迈出重要一步。该政策旨在强大的AI系统公开发布前主动评估国家安全风险。
这很可能是美国及多数其他国家开始限制最佳AI仅限获批用户使用前的第一步……开启了政府对AI管控的进程……这与当前缺乏真正监管的AI现状形成鲜明对比。这种情况即将改变。
查看缓存全文
缓存时间: 2026/05/08 13:30
# 美国主要AI实验室现已接受发布前政府安全审查
来源:https://www.secureworld.io/industry-news/us-ai-labs-government-security-reviews
2026年5月6日(周三)| 太平洋夏令时下午3:39
美国政府悄然拿下了AI行业多年抵制的东西:在模型发布前获得审查席位。商务部人工智能标准与创新中心(CAISI)周二(https://www.nist.gov/news-events/news/2026/05/caisi-signs-agreements-regarding-frontier-ai-national-security-testing)宣布,Google DeepMind、微软和Elon Musk的xAI已同意向该中心提供其未发布版本的AI模型,用于部署前的安全与能力评估。据路透社(https://www.reuters.com/legal/litigation/microsoft-xai-google-will-share-ai-models-with-us-govt-security-reviews-2026-05-05/)和彭博社(https://www.bloomberg.com/news/articles/2026-05-05/ai-firms-agree-to-give-us-early-access-to-evaluate-their-models)率先报道。加上Anthropic和OpenAI现有的——以及最近重新谈判的——协议,现在每个美国主要前沿AI实验室都已参与自愿性的发布前政府评估。
CAISI迄今已完成超过40次模型评估,包括对未发布的最先进系统的评估。值得注意的是,开发者有时会交出安全护栏被调低的模型版本,专门供该中心探查国家安全风险。这些宣布出炉的前一天,《纽约时报》(https://www.nytimes.com/2026/05/04/opinion/ai-national-security-risk-politics.html)首次报道,特朗普政府正考虑通过行政命令单独设立强制性发布前审查流程——而Anthropic的Mythos模型被引为催化剂。自愿性协议与任何强制性框架将并行运行,尽管两者之间的互动关系尚未明确。
相关文章:[Anthropic的Claude Mythos标志着AI驱动网络安全的新时代——以及一场无人准备好应对的竞赛](https://www.secureworld.io/industry-news/anthropics-claude-mythos-signals-a-new-era-in-ai-powered-cybersecurity-and-a-race-no-one-is-ready-for)
时机的选择是刻意的,即便政策机制仍在厘清中。在多年的自我监管和缺乏力度的自愿安全承诺之后,美国政府正在为世界上最强大的AI系统建立一个一致的部署前审查流程。最终是否对安全有利——还是主要对被审查的公司有利——在很大程度上取决于该流程内部的具体操作。
## **一个历史复杂的中心**
在评估CAISI扩展协议的意义之前,有必要了解CAISI究竟是什么——以及围绕它的动荡。该中心最初于2023年在拜登政府领导下成立,名为AI安全研究所。特朗普政府去年将其更名,商务部长Howard Lutnick将这一品牌重塑描述为摆脱他所谓的"以国家安全为幌子的监管"。
该中心仍然缺乏永久的法律地位。其任命的主任Collin Burns——曾任职于Anthropic和OpenAI的研究员——上任仅四天就被迫离职,原因是白宫官员对其与Anthropic的关系表示担忧,而该政府正与该家公司存在持续争端。(这场争端本身有其独特之处:五角大楼于3月将Anthropic列为供应链风险,原因是该公司拒绝降低自主武器上的安全护栏,尽管一名联邦法官后来称这一指定"奥威尔式"。)Burns为此已横跨全国搬迁,并放弃了Anthropic的股权以担任该职位。
在Burns被驱逐后接任的CAISI主任Chris Fall谈到新协议时说:"独立、严谨的测量科学对于理解前沿AI及其国家安全影响至关重要。"
这一背景至关重要。一个领导层不稳定、没有永久法律地位、与至少一家被评估公司关系复杂的监督机构,并非制度力量的体现。这并不意味着这项工作没有价值。但这确实设定了审查标准,框架的支持者们应当欢迎这一标准,而非回避。
### **没人想重蹈覆辙的互联网类比**
CAISI的核心理念中隐含着一个老生常谈的警示故事:早期的互联网是为弹性和开放性而设计的,几乎没有考虑其安全漏洞最终会被如何武器化。结果是数十年的间谍活动、大规模数据泄露和根深蒂固的网络犯罪生态系统,安全团队至今仍在与之斗争。互联网的设计者并非鲁莽;他们当时构建的是针对不同于后来显现的威胁模型的系统。
AI面临着类似的风险状况。前沿模型是不透明的、强大的,并且正以安全社区来不及评估的速度被集成到关键系统中。CAISI代表着一次刻意的努力,以避免重蹈覆辙——在仍有时间对发现的问题采取行动时,对变革性技术进行安全审查。
Black Duck网络安全治理主管Ronald Lewis直言不讳:该倡议反映了"在变革性技术在其影响被充分理解之前就部署时所产生国家安全风险的、来之不易的认识"。
问题不在于这一论断是否正确——它几乎肯定是正确的。问题在于正在建立的审查流程是否足够实质化以匹配风险。
#### **发布前审查是合理的安防实践——只要执行得当**
CAISI背后的原则并不新鲜。将安全评估左移——移至开发生命周期的更早期,在漏洞变得根深蒂固之前——是网络安全领域的基础概念。新意在于将其如此大规模地应用于AI系统。路透社的报道证实,评估包括红队演练。例如,Anthropic与该中心的早期合作揭示,声称已进行人工审核或替换字符等技术可以绕过安全机制——这些漏洞随后被该公司修补。
挑战在于,AI模型呈现出的评估面与传统软件不同。它们是概率性的、上下文敏感的,并且可以在开发过程中未预料到的对抗条件下出现不可预测的行为。有意义的评估需要清晰的框架,而非临时性的测试。
Noma Security首席信息安全官Diana Kelley指出,任何有效的审查都需要"基于清晰、一致的框架,并与既定的指导方针保持一致,如NIST的AI风险管理框架(https://www.secureworld.io/industry-news/nist-ai-risk-management-framework)和CISA的安全设计原则(https://www.secureworld.io/industry-news/cisa-secure-by-design-uncertainty)",并且必须"避免成为瓶颈或走过场"。Kelley补充道:"目标应该是切实降低风险,而不仅仅是为监督而监督。"
这一区别至关重要。一个只给出批准印章而不提出可行动发现的审查流程,并不会让AI系统更安全——它只是制造了监督的表象。CAISI的可信度最终将取决于其评估是否改变了发布内容和发布方式,而非评估了多少模型。
##### **OT集成是鲜少被谈论的风险**
当前的CAISI框架主要聚焦IT领域:评估面向信息处理系统的软件层能力和风险。这是正确的起点,但并非风险的终点。随着AI代理越来越多地集成到操作技术(OT)中——楼宇自动化、工业控制系统、物理安全基础设施——攻击面的扩展超出了以软件为中心的评估所能捕捉的范围。
Viakoo的Viakoo Labs副总裁John Gallagher指出了这一新出现的担忧,他表示,如果AI代理正在管理一个物理网络,确保它没有被投毒或操控以禁用安全协议,就变成了一个关键的OT安全问题,而不仅仅是软件问题。模型本身的完整性变得对基础设施至关重要。Gallagher将这一点直接类比于欧洲监管框架,如NIS2和《网络弹性法案》,这些框架已开始要求硬件制造商遵循安全设计标准。AI现在正被拉入同样的合规引力场。
对于管理大规模物理基础设施的组织而言,其含义是具体的:他们部署的AI工具将越来越需要证明符合仍在制定的联邦标准。提前达到这一要求——而不是事后补充合规性——是更可取的做法。
###### **自愿参与背后的真正驱动力**
这些协议的自愿性质值得审视。前沿AI公司将其未发布的模型提交政府审查,并非纯粹出于公益或善意。其中的策略考量更为复杂。
通过与CAISI合作,谷歌、微软、xAI和Anthropic等公司所做的不仅仅是满足监督要求:它们正在帮助定义在国家层面"安全的AI"是什么样子。这种定义具有商业下游效应。当AI模型被当作需要像关键基础设施一样进行压力测试的系统来对待时,它就会全面提升感知到的威胁格局——并扩大对AI驱动安全解决方案、审计和评估的需求。
Ronald Lewis直接指出了这一张力,他指出,自愿参与CAISI"服务于双重目的:它表明了责任感和与政府合作的态度,同时在一个恐惧、不确定性和复杂性一直是强大商业驱动力的安全市场中刺激了需求。"
这并非反对该框架的论据。这是一个提醒,要清醒地评估它。由被监管实体部分参与塑造的自愿流程,往往会反映出这些实体与公共利益两方面的利益。从业者和政策制定者都应该对CAISI的产出设置高标准,正是因为其中的激励并非纯粹利他。
**别让前沿模型的光环掩盖当下的风险**
当前时刻还存在一个最终风险:人们对Anthropic的Mythos、Project Glasswing(https://www.secureworld.io/industry-news/anthropic-claude-mythos-finds-exploits-zero-days)以及其他登上头条的前沿开发项目的关注,可能造成一种印象,即最重要的AI安全威胁都在未来。但事实可能并非如此。
安全研究人员已经证明,功能较弱、广泛可用的语言模型已经能够以与那些备受关注的系统相当的可信度识别软件漏洞。针对企业环境的攻击者并不会等待前沿模型的访问权限——他们正在使用已经可用的工具。Lewis直截了当地列出了优先事项:"对于商业领袖来说,重中之重必须是应对当下的风险,并不断进化防御措施,以匹配攻击者已经能够获取的AI能力——而不是那些仍在地平线上的假设性威胁。"
CAISI框架是一个有意义的结构性发展,如果强制性审查流程随之而来,它将加速一个已经开始的转变:前沿AI从纯粹的技术赌注转向受监管的战略性行业。正如Acalvio CEO Ram Varadarajan所说:"地缘政治一致性和国家安全许可将变得与原始算力一样,对一个前沿实验室的估值至关重要。" 然而,对于安全从业者而言,更直接的义务更简单:不要让前沿吸引所有注意力;今天需要防御的威胁已经部署到位。
关注*SecureWorld News*,获取更多网络安全与AI新闻。
相似文章
美国施压Meta同意AI审查,因安全担忧加剧(OpenAI、Anthropic、Google和xAI已同意)
美国政府正敦促Meta同意进行独立的AI安全审查,此前OpenAI、Anthropic、Google和xAI已在安全担忧加剧之际做出承诺。
白宫计划在OpenAI和Anthropic模型发布前进行AI安全审查
白宫正筹备一项行政命令,旨在建立一套自愿框架,要求AI开发者在公开发布前提交先进模型进行政府安全测试,重点针对国家安全风险。
美国施压Meta同意AI审查,安全担忧加剧(6分钟阅读)
特朗普政府正在敦促Meta自愿提交其AI模型进行联邦审查,因为Meta仍然是唯一未达成此类协议的美国主要AI开发商。
Open AI 在美国政府审查请求后推迟了 GPT-5.6。AI 监管会成为新常态吗?
OpenAI 在美国政府要求审查后推迟了 GPT-5.6 的分阶段发布,引发了关于政府审查前沿 AI 模型是否会成为标准实践的讨论。
@levie:我们现在有了事实上的AI监管。目前尚不清楚为什么从现在开始,具有特定能力水平的模型……
特朗普政府已要求OpenAI因安全担忧而分阶段发布GPT-5.6,由政府逐个客户批准访问,标志着美国事实上AI监管的新时代。