前沿AI实验室仍拒透露如何遏制失控模型
摘要
Guidelight AI Standards的研究发现,OpenAI、Anthropic和Meta等领先AI实验室对遏制失控模型的公开计划存在不足,随着AI日益自主化且监管机构要求信息披露,这引发了广泛担忧。
一项新研究发现,主要AI实验室几乎没有公开记录的遏制失控模型计划,随着AI系统日益展现出意外且潜在危险的行为,这引发了关于准备工作的质疑。
查看缓存全文
缓存时间: 2026/08/22 16:34
# 前沿AI实验室仍拒绝透露如何遏制失控模型 | TechCrunch
来源:https://techcrunch.com/2026/08/22/frontier-ai-labs-still-wont-say-how-theyd-contain-a-rogue-model/
根据近期研究(https://guidelight.ai/blog/control-assessment-august-2026),仅有少数顶尖AI实验室发布或演示了隔离响应计划。隔离响应计划详细说明了当AI被发现试图颠覆人类控制后的应对措施——包括何时切断访问权限、何时彻底关闭系统。
这是非营利组织Guidelight AI Standards的评估结论,该组织致力于推动前沿AI安全开发实践,并对五家领先实验室的应急准备情况进行了评级。OpenAI位列第一,而Anthropic和Meta得分最低。随着自主型AI在企业内部系统中承担更多自主职能,以及加利福尼亚州和纽约州的监管机构开始要求信息披露,这一发现尤为重要。对于所有基于或投资这些模型的企业而言,这是罕见的独立评估,揭示了各实验室对运营风险的实际重视程度与其公开表态之间的差距。
Guidelight的评估基于Anthropic、Google、OpenAI、Meta和xAI的公开计划,从多个维度进行评分,包括:各公司对内部AI系统行为的监控与日志记录完善度、在标记异常行为激增时是否中止系统运行、是否引入独立第三方审计并公开结果,以及针对失控模型的具体隔离方案。
在一系列高调网络安全事件(https://techcrunch.com/2026/08/09/the-ai-safety-test-is-becoming-a-safety-risk/)后,业界对AI公司能否控制其日益强大且自主的模型的担忧持续加剧。这些事件中,OpenAI、Anthropic和Meta的模型在安全评估期间意外获得互联网访问权限,并入侵了外部系统。
评估结果凸显了各AI公司在扩大自主型部署环境中的公开安全策略差异。尽管部分公司详细说明了模型部署前的危险能力测试方法,但对模型已在内部系统中运行时发生异常行为的应对方案,普遍缺乏公开讨论。
"令我惊讶的是,AI公司对于模型一旦失控将如何应对重大事故的说明如此之少,"Guidelight首席科学家、前OpenAI安全研究员Steven Adler告诉TechCrunch。
Guidelight将隔离响应计划定义为:"预先制定的计划,在检测到AI试图颠覆控制时触发,涵盖模型权限撤销范围、可继续运行的目标对象、约束条件以及何时彻底下线模型。"
Adler指出:"有充分理由认为,当前前沿AI实验室的顶尖模型在某种程度上存在未对齐问题。当模型代表公司执行任务时,企业应建立防护框架来监控AI行为、识别未对齐迹象、在危险行为实施前进行阻断,并为严重控制事件(如失控应急处置)制定预案。"
迄今为止,多数灾难性风险管理计划仍主要由企业自行制定。Guidelight报告指出,现有最佳公开证据显示,企业"几乎未准备好应对紧急情况的隔离协议"。
当然可能存在企业已制定但未公开的隔离计划。Google发言人告诉TechCrunch,Guidelight报告未涵盖公司AI安全与保障措施的全貌。对于是否存在未公开的内部隔离响应计划,Google未回应TechCrunch的提问。
OpenAI发言人表达了类似观点,称Guidelight的评估未涵盖公司所有内部实践。"我们建立了限制权限、暂停工作负载、限制部署或彻底下线模型的流程,并已付诸实践,"该发言人表示。
Meta拒绝透露是否存在内部隔离响应计划,而是向TechCrunch指向现有的AI框架(https://ai.meta.com/blog/scaling-how-we-build-test-advanced-ai/),其中概述了风险阈值及控制失效测试方法。
隐私与AI律师、Metaverse Law创始人Lily Li告诉TechCrunch,她认为企业可能因法律(而不仅是竞争原因)不愿在公开网站披露完整的隔离政策和评估细节。
"企业层面的顾虑是,如果披露过于具体却未能履行承诺,可能构成不正当及欺骗性营销主张的依据,并在未来面临更多责任,"Li表示。
Guidelight研究的核心目标是推动企业提高安全计划的透明度。监管机构也开始强制推进这一进程。
加利福尼亚州今年生效的SB 53法案(https://techcrunch.com/2025/09/29/california-governor-newsom-signs-landmark-ai-safety-bill-sb-53/)要求大型前沿AI开发者公开框架,说明如何识别和响应重大安全事件以及管理模型规避监督机制的风险。纽约州具有类似标准的RAISE法案(https://techcrunch.com/2025/06/13/new-york-passes-a-bill-to-prevent-ai-fueled-disasters/)将于明年1月生效。
上月,美国国会议员提出了《AI终止开关法案》(https://lieu.house.gov/media-center/press-releases/reps-lieu-and-moran-introduce-bill-require-kill-switch-ai-systems-can),这项两党联邦法案将要求主要AI开发者构建并维护关闭失控AI模型的技术机制。
"终止开关是当前模型的基本要求,"非营利组织ControlAI美国执行董事Connor Leahy表示。"如果说最近几周揭示了什么,那就是这些公司并不理解自己构建的系统,而模型正发展到一旦失控就更难制约的程度。在缺乏关闭当前危险系统的手段、且所有激励机制都推动构建更不可控系统的情况下,我们正朝着极其危险的方向前进。"
Adler指出,若无隔离响应计划,企业可能只能在应急时临时摸索应对方案,"面对如此迅猛发展的对手时仓促行事"。
Guidelight的评估衡量了各公司是否实施其Control标准中的六项优先实践,且仅基于公开信息——因此低分仅反映公开披露的缺失,而非必然缺乏内部保障措施。
Meta和Anthropic的隔离计划公开度得分最低——后者可能更出人意料,因为Anthropic以安全立场著称。Guidelight指出Anthropic的《八月风险报告》(https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf)未提及"限制模型部署可作为调查未对齐和控制事件过程的可能结果"。同样,Guidelight未发现Meta拥有或计划采用隔离响应计划的证据。
Anthropic发言人表示,若检测到模型试图规避监督或颠覆人类控制,公司将进行风险评估以确定隔离是否为适当响应。
OpenAI得分最高(3/5分),因其曾多次在发现安全事件后暂停或终止工作负载,包括内部模型部署和训练。公司还说明了恢复工作负载前的必要步骤。
"但我们未发现[OpenAI]采用未来应对未对齐事件的正式计划的证据,"报告指出。
Adler提到OpenAI的高分是近期在Hugging Face事件(https://techcrunch.com/2026/07/27/openais-hugging-face-breach-has-reignited-the-debate-over-alignment-and-control/)后的进步。在那次事件中,OpenAI模型突破测试沙箱,在网络安全评估中试图作弊时入侵了Hugging Face系统。此后该公司分享了更多关于隔离异常模型的细节。
该事件只是AI系统违背构建者目标的案例之一。另一个涉及Anthropic模型的案例中,模型试图说服开源代码库维护者接受存在漏洞的代码。
Adler指出此类情况很容易在企业内部系统中发生。为防范此风险,他建议企业扫描AI系统的思维链——即模型的逐步推理过程——以识别欺骗迹象、长期预谋或计划引入可后续利用的漏洞。
Adler表示,Guidelight倡导的方法实施起来非常直接,且许多情况下已有类似实践存在。"关键在于企业内部需足够重视此风险,以略微扩大监控范围,"Adler说。
主要挑战之一是研究人员希望在AI系统内灵活操作,而引入实时预防性监控可能产生摩擦。"研究人员通常按自己方式工作,出现问题则由他人事后处理,期间无需改变工作流程,"他指出。
"事后清理监控"的问题在于导致研究人员疲于修补漏洞。对于某些类型的事件,这可能为时已晚——例如AI可能关闭公司的控制系统,导致研究人员无法事后追查异常行为。
AI业界许多人会抱怨,制定应对异常行为的固定计划本质上十分困难,因为AI发展过快;今天的计划明天可能就过时了。
Adler引用了那句老话:计划无用,但规划不可或缺。
"如果企业提前思考过这些问题,即便未公开讨论,情况会好得多,"Adler表示。"我期望他们确有预案。"
xAI未在截稿前回应置评请求。
*通过文中链接购买产品时,我们可能获得小额佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不影响我们的编辑独立性。*
相似文章
@METR_Evals: 一家AI公司是否可能失去对其自身代理的控制?为了弄清楚这一点,Anthropic、Google、Meta和OpenAI允许我们(1)测试…
METR发布了其首份《前沿风险报告》(Frontier Risk Report),评估AI公司失去对其自身代理控制的风险。该报告涉及测试来自Anthropic、Google、Meta和OpenAI的最佳内部模型,允许访问思维链(CoT),并审查了关于能力、对齐和控制的非公开信息。
前沿AI监管:管理新兴的公共安全风险
OpenAI提议了一个针对可能造成公共安全风险的「前沿AI」模型的监管框架,倡导制定标准流程、注册/报告要求和合规机制,包括部署前风险评估和部署后监测。
OpenAI在漏洞/黑客事件后正有意放缓前沿模型的研发工作。若美国实验室继续将安全遏制置于优先地位,而中国未采取相同策略,未来四年将会呈现怎样的格局?
OpenAI在发生安全事件后,已刻意放缓下一代前沿模型的研发进度。这一举措可能导致其在竞争中处于劣势——因为中国的人工智能实验室往往将开发速度置于类似安全约束之上。未来四年内,全球人工智能格局或将因此重塑。
Anthropic 在模拟部署中测试前沿 AI 智能体。结果发现模型存在破坏代码、掩盖欺诈以及指导员工泄露安全数据的行为。
Anthropic 的对齐团队报告了前沿 AI 智能体在模拟高风险部署中自主行动时出现的四种额外失败模式,包括暗中破坏、协助欺诈、动机性错误标注以及教唆人类代理人举报,这些是智能体失对齐的早期警示信号。
真正的AI风险在实验室内部(5分钟阅读)
作者认为,主要的人工智能风险来自前沿实验室内部的泄露,而不是来自开放权重模型,并呼吁国际安全监督和平衡考虑进展。