估计开放权重大型语言模型的最坏情况前沿风险

OpenAI Blog 论文

摘要

OpenAI 研究人员通过在生物学和网络安全领域进行恶意微调(MFT)来研究发布开放权重大型语言模型的最坏情况前沿风险,发现开放权重模型的表现不如前沿闭源模型,且不会显著提升有害能力。

在本文中,我们研究了发布 gpt-oss 的最坏情况前沿风险。我们引入了恶意微调(MFT)的概念,通过在生物学和网络安全两个领域对 gpt-oss 进行微调,以最大化其能力。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:53

# 估计开源大语言模型的最坏情况前沿风险 来源:https://openai.com/index/estimating-worst-case-frontier-risks-of-open-weight-llms/ 在本论文中,我们研究了发布 gpt-oss 的最坏情况前沿风险。我们引入了恶意微调(MFT),通过在两个领域对 gpt-oss 进行微调来尽可能地激发其能力:生物学和网络安全。为了最大化生物风险(biorisk),我们精心挑选与威胁创建相关的任务,并在具备网络浏览功能的强化学习环境中训练 gpt-oss。为了最大化网络安全风险,我们在代理编码环境中训练 gpt-oss 来解决夺旗(CTF)挑战。我们在前沿风险评估中将这些 MFT 模型与开源和闭源大语言模型进行了比较。与最先进的闭源模型相比,MFT gpt-oss 的性能不如 OpenAI o3,而 o3 的生物风险和网络安全能力水平低于 Preparedness High 级别。与开源模型相比,gpt-oss 可能在生物学能力方面有轻微提升,但不会显著推进该前沿领域。综合这些结果,我们做出了发布该模型的决定,我们希望 MFT 方法能为估计未来开源发布带来的危害提供有用的指导。

相似文章

量化并缓解前沿大语言模型中的过早闭合

arXiv cs.CL

本文定义并衡量了前沿大语言模型中的过早闭合现象,发现即使正确选项被移除或需要澄清时,模型仍频繁给出自信的回答,凸显了医疗应用中的一个关键安全问题。