OpenAI o3-mini 系统卡

OpenAI Blog 模型

摘要

OpenAI 发布了 o3-mini 系统卡,记录了其通过强化学习训练的高级推理模型的安全评估和风险评估。该模型在某些基准测试中达到了最先进的安全性能,在 OpenAI 的《准备框架》下总体被列为中等风险。

本报告概述了为 OpenAI o3-mini 模型开展的安全工作,包括安全评估、外部红队测试和《准备框架》评估。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:48

# OpenAI o3-mini 系统卡 来源:https://openai.org/index/o3-mini-system-card/ OpenAI o 模型系列采用大规模强化学习进行训练,使用思维链推理。这些先进的推理能力为提高我们模型的安全性和鲁棒性提供了新的途径。特别是,我们的模型可以在应对潜在不安全提示时,通过深思熟虑的对齐方式来推理我们的安全政策。这使 OpenAI o3-mini 在生成非法建议、选择刻板印象回应和抵御已知越狱等风险的某些基准测试中达到了最先进性能的水平。训练模型在回答前纳入思维链具有释放实质性益处的潜力,同时也增加了源于更高智能水平的潜在风险。 根据 Preparedness Framework(https://cdn.openai.com/openai-preparedness-framework-beta.pdf), OpenAI 安全顾问团队(SAG)建议将 OpenAI o3-mini(缓解前)模型分类为中等风险总体水平。它在劝导、CBRN(化学、生物、放射性和核)以及模型自主性方面评分为中等风险,在网络安全方面评分为低风险。只有缓解后评分达到中等或以下的模型才能被部署,只有缓解后评分达到高等或以下的模型才能继续开发。 由于编码和研究工程性能的提升,OpenAI o3-mini 是第一个在模型自主性方面达到中等风险的模型。然而,在设计用于测试与自我改进相关的真实 ML 研究能力的评估中,它的表现仍然不佳,而这是高等风险分类所需的。我们的结果突出强调了构建稳健对齐方法、进行广泛压力测试及其有效性,以及维持严格风险管理协议的必要性。 本报告概述了为 OpenAI o3-mini 模型所进行的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评估。

相似文章

OpenAI o3 和 o4-mini 系统卡

OpenAI Blog

OpenAI 发布了 o3 和 o4-mini 模型的系统卡,这些模型具有先进的推理能力,结合了工具集成(网络浏览、Python、图像分析等),并根据 OpenAI 的 Preparedness Framework v2 在生物、网络安全和 AI 自我改进等领域进行了安全性评估。

OpenAI o1 系统卡

OpenAI Blog

OpenAI 发布了 o1 系统卡,详细介绍了 o1 和 o1-mini 模型的安全评估和准备框架评估。这些模型采用思路链推理,并通过大规模强化学习进行训练,以提高安全性和稳健性。

OpenAI o3-mini

OpenAI Blog

OpenAI 发布 o3-mini,一款成本高效的推理模型,具备强大的 STEM 能力,现已在 ChatGPT 和 API 中可用,支持函数调用、结构化输出和三个推理力度级别。该模型在数学和编码方面与 o1 性能相当,同时更快且更便宜,免费计划用户首次获得推理模型的访问权限。

OpenAI o3 和 o4-mini 发布

OpenAI Blog

OpenAI 发布了最新的推理模型 o3 和 o4-mini,可以自主访问和组合所有 ChatGPT 工具(网络搜索、代码执行、图像分析、图像生成)。o3 在编程、数学和科学基准测试中达到业界最先进水平,主要错误比 o1 少 20%,而 o4-mini 则提供成本和速度优化的高效推理能力。