gpt-oss-safeguard 技术报告
摘要
OpenAI 发布了 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b,这两个开放权重推理模型专为基于策略的内容分类而设计,具有完整的思维链推理能力。技术报告提供了基准安全评估,展示了模型在 Apache 2.0 许可证下的内容标签任务能力。
gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 是两个开放权重推理模型,在 gpt-oss 模型的基础上进行了后训练,能够根据提供的策略进行推理,从而对该策略下的内容进行标签化。在本报告中,我们阐述了 gpt-oss-safeguard 的能力,并在以基础 gpt-oss 模型作为基准的基础上,对 gpt-oss-safeguard 模型进行了基线安全评估。有关基础 gpt-oss 模型的开发和架构的更多信息,请参阅原始 gpt-oss 模型的模型卡。
查看缓存全文
缓存时间:
2026/04/20 14:53
# gpt-oss-safeguard 技术报告
来源: https://openai.com/index/gpt-oss-safeguard-technical-report/
OpenAI - gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 的性能和基准评估
gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 是两个开放权重的推理模型,基于 gpt-oss 模型进行了后训练,用于根据提供的政策进行推理,以便标记相关内容。这两个模型在 Apache 2.0 许可证和我们的 gpt-oss 使用政策下提供。这些仅支持文本的模型是与开源社区反馈共同开发的,与我们的 Responses API 兼容。这些模型可定制,提供完整的链式思维 (CoT),可以使用不同的推理能力(低、中、高),并支持结构化输出。
在本报告中,我们介绍了 gpt-oss-safeguard 的功能,并基于底层 gpt-oss 模型作为基准,提供了针对 gpt-oss-safeguard 模型的基准安全评估。有关底层 gpt-oss 模型的开发和架构的更多信息,请参阅原始 gpt-oss 模型卡 (https://openai.com/index/gpt-oss-model-card/)。
我们建议使用这些模型来根据提供的政策对内容进行分类,而不是作为最终用户交互的核心功能;原始 gpt-oss 模型更适合那些应用。下面提供的安全指标描述了 gpt-oss-safeguard 模型在对话设置中的功能。gpt-oss-safeguard 模型不是为此用途设计的,但由于它们是开放模型,任何人都可能以这种方式使用这些模型。由于这种可能性,我们希望验证它们在此类使用中是否符合我们的安全标准;本报告分享了这些测试的结果。我们还分享了对对话设置中多语言性能的初步评估;请注意,这并不直接评估在使用提供的政策进行内容分类期间的性能。
gpt-oss-safeguard 模型是其 gpt-oss 对应模型的微调版本,训练时没有任何额外的生物学或网络安全数据。因此,我们确定了之前关于估计开放权重大语言模型最坏情况风险 (https://openai.com/index/estimating-worst-case-frontier-risks-of-open-weight-llms/) 的工作适用于这些新模型。
相似文章
OpenAI Blog
OpenAI 发布 gpt-oss-safeguard,这是用于安全分类任务的开源权重推理模型,提供 120B 和 20B 两种规格,采用 Apache 2.0 许可证。这些模型使用链式思维推理,在推理时根据开发者提供的策略对内容进行分类,实现灵活且可解释的内容审核。
OpenAI Blog
OpenAI 发布了 gpt-oss-120b 和 gpt-oss-20b,这是两款采用 Apache 2.0 许可证的开权重推理模型,专为智能体工作流设计,具有强大的指令跟随、工具使用和思维链能力。该发布包括全面的安全评估,确认即使在对抗性微调下,这些模型也不会达到生物、化学或网络风险的高能力阈值。
OpenAI Blog
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b,两款最先进的开放权重语言模型,采用 Apache 2.0 许可证,性能与专有模型相当,可针对消费级硬件和边缘设备进行优化。两款模型均展现出强大的推理和工具使用能力,并进行了全面的安全评估。
OpenAI Blog
OpenAI发布了GPT-5.4 Thinking,这是GPT-5系列中最新推出的推理模型,具备增强的安全缓解措施,尤其值得一提的是,该模型是首个实现全面网络安全保护措施的通用模型。
OpenAI Blog
OpenAI发布了基于提示的安全策略和开放权重的gpt-oss-safeguard模型,帮助开发者构建适合青少年的AI体验,涵盖图形内容、有害行为和危险活动等风险。