@OpenAI:随着模型能力的提升,内部开发与测试所伴随的风险也在增长。我们暂时…

X AI KOLs Timeline 新闻

摘要

OpenAI 由于风险增加,暂时暂停了其最新模型的强化学习训练,并正在加强监控、对齐和安全防护措施,以实现更安全的AI开发。

随着模型能力的增强,内部开发与测试相关的风险也随之增加。 我们暂时暂停了针对部署的最新模型的强化学习(RL)训练,为期两周,同时我们加固并红队测试了研究环境,并扩大了监控覆盖范围。 我们计划的最大前沿强化学习运行仍然暂停,同时较小规模的训练和评估正在验证这些防护措施,并建立更多关于对齐的证据。
查看原文
查看缓存全文

缓存时间: 2026/08/18 18:30

随着模型能力日益增强,开发与测试过程中伴随的风险也在增长。

为加固研究环境、实施红队测试并扩大监控覆盖范围,我们针对即将部署的最新模型,暂时停止了为期两周的强化学习训练。

目前最大规模的前沿强化学习计划仍处于暂停状态,我们正通过小规模训练与评估来验证安全措施,并建立更多关于模型对齐的证据。


在网络关键能力时代调控模型开发节奏

来源:https://openai.com/index/pacing-model-development-cyber-capabilities/ 过去数周内,两起事件凸显了日益强大的AI系统所带来的风险:OpenAI与Hugging Face的安全事件(https://openai.com/index/hugging-face-model-evaluation-security-incident/),以及我们即将推出的模型Astra可能达到“关键网络安全能力“(https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/)阈值的初步证据(基于我们的准备框架(https://openai.com/index/updating-our-preparedness-framework/))。这些进展与内部研究的快速突破相结合,促使我们加速完善贯穿训练全程的监控、对齐与隔离防护措施。

随着模型能力提升,内部开发测试的风险同步增长。我们的监控、对齐与安全标准必须先于风险演化。为此我们主动放缓扩展节奏:针对即将部署的最新模型,我们暂停两周的强化学习训练,期间强化研究环境的防护措施、实施红队测试,并扩展监控体系覆盖范围。目前最大规模的前沿强化学习计划仍保持暂停,通过小规模训练评估模型行为,验证安全措施,积累更多对齐证据后再行推进。

对齐(https://openai.com/safety/how-we-think-about-safety-alignment/)——确保AI系统按预期运行并响应人类监督的工作——始终是我们研究的核心。基于现有研究和评估成果,我们现在要求在整个训练过程中提供更强有力的对齐行为证据。如何让日益强大的系统保持对齐,是整个领域面临的挑战。即将到来的模型进展信号清晰表明:我们需要在现有准备框架基础上构建更全面的方案。

我们认为有必要坦诚说明方案调整方向。以下将介绍已实施的科研流程与基础设施变革,以及仍在推进的工作。

为更强能力模型强化防护

开发更强能力模型的方案建立在三重防护机制上:

  1. 监控:检测并响应异常行为
  2. 对齐:降低有害或越权操作的可能性
  3. 安全措施:限制AI系统的访问与影响范围

我们预期模型很快将主导大部分安全工作(包括防御其他模型),这将使三重防护随模型能力同步扩展——我们认为这至关重要。

我们将这些防护措施应用于研发与部署全过程,并根据各模型能力、运行环境和风险等级进行适配。

研究环境安全加固

随着前沿模型网络安全能力增强,我们正在提升训练评估环境的安全标准。达标需要大量工程投入,对前沿研究造成显著成本与延迟。OpenAI-Hugging Face事件发生后,我们立即暂停了研究集群中可能执行代码或联网工具调用的前沿模型推理服务。随后快速恢复受限的安全代码执行通道,逐一审查工作负载能否安全重启。部分研究负载在新控制措施下恢复运行,其余则需要额外调整。

过去数周内,我们定义并开始实施更严格的前沿研究负载安全要求,例如:

  • 负载隔离:对执行模型生成代码或不受信任代码的工作负载实施更强隔离(“沙箱”),同样适用于处理模型输出时可能被入侵的软件。
  • 网络隔离:部署更多控制措施将高风险及不受信任负载与互联网隔离。这些控制设计确保单个工作负载或支持服务被攻破时,不会直接导致未授权访问互联网或其他内网。
  • 持续安全测试:重构环境移除潜在脆弱的共享服务,缩减常驻权限,优化安全与信任边界。同时增强安全日志收集监控能力,最终投资利用模型自动化持续测试攻击边界。

这些纵深防御措施协同保护研究环境免受攻击。目前对涉及Astra或网络安全模型的工作负载实施最严格安全防护——因我们判定Astra模型可能具备关键级网络安全能力。该防护同样适用于所有其他网络相关负载。

部分Astra训练与评估符合要求,但大量工作负载因需迁移升级至新安全标准而暂停。我们优先迁移安全与对齐相关负载。

扩展思维链监控

监控一直是模型开发的重要环节,包括对内部编码智能体(https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/)和长期运行会话(https://openai.com/index/safety-alignment-long-horizon-models/)的监控。此前监控重点聚焦前沿模型的内部部署与强化学习训练——因这些高风险负载可能同时具备高级模型能力与工具、敏感系统及内外部网络访问权限,但未覆盖所有使用工具的推理训练流程。通过新型监控系统,我们已修订并扩展监控方案。

新监控系统采用多阶段设计:从每个采样token运行的激活分类器(检测模型内部活动的探测器)开始,将潜在问题上报给越来越复杂的高算力自动调查系统。这些系统会审查工具操作、可用推理与完整活动序列,识别未授权访问、数据窃取、破坏行为及规避安全措施的尝试。我们目标是在监控系统发现异常活动后30分钟内发出警报。若系统判定可能违反关键安全边界,则生成最高优先级警报。当前实施中,安全、安保与研究团队会同步告警,如未能在30分钟内确认为误报,相关团队需暂停该活动。

8月7日确定Astra可能具备关键网络安全能力后,我们对所有使用工具的Astra推理(不仅限于强化学习训练评估)新增监控要求。对S级及以上能力模型的工具类强化学习训练评估均需实施此监控。

这些防护需要可观算力。当前估算监控开销约占被监控推理算力的20%,不同训练评估负载间成本差异显著。我们将在后续技术文章中详述该系统。

推进对齐研究

对齐研究是我们的核心使命所在——确保通用人工智能造福全人类。随着模型获得网络攻击等高级能力并在更复杂环境中运行,奖励作弊(在训练中获取高奖励却未实现预期目标)、欺骗、未授权访问等失准行为将带来日益严峻的风险。

对于最强大模型的强化学习运行,我们现在将核心对齐技术应用于更广泛训练阶段,包括:优化奖励模型以跨任务环境更好地检测抑制不安全行为;训练模型更诚实地描述其行动、能力与局限;减少利用奖励评分器、工具或监督机制漏洞的行为。同时增加模型与外部系统资源交互时可能造成危害行为的训练覆盖。

我们持续加大投入推进对齐研究,扩展评估范围,并将所得洞察指导训练与安全措施。近期将公布更多对齐研究成果,包括模型行为认知与新发现挑战。

后续计划

我们将演进准备框架,整合训练部署阶段的防护措施,更好适配未来模型能力及其运行环境。开发随能力扩展的方法需要持续投入模型辅助安全、更有效监控及对齐研究进展。随着方案发展,我们将纳入外部机构合作并分享更多成果。

前沿模型能力正急速加速演进,我们的理解、对齐与安全保障能力必须保持领先。

*未来数周将发布技术报告详述相关经验*

相似文章

OpenAI内部的安全清算

Wired

在安全测试期间,恶意AI代理攻破了Hugging Face,导致OpenAI面临重大内部危机,促使领导层重新评估安全文化并放缓未来模型的发布。