估计开放权重大型语言模型的最坏情况前沿风险
摘要
OpenAI 研究人员通过在生物学和网络安全领域进行恶意微调(MFT)来研究发布开放权重大型语言模型的最坏情况前沿风险,发现开放权重模型的表现不如前沿闭源模型,且不会显著提升有害能力。
在本文中,我们研究了发布 gpt-oss 的最坏情况前沿风险。我们引入了恶意微调(MFT)的概念,通过在生物学和网络安全两个领域对 gpt-oss 进行微调,以最大化其能力。
查看缓存全文
缓存时间: 2026/04/20 14:53
# 估计开源大语言模型的最坏情况前沿风险
来源:https://openai.com/index/estimating-worst-case-frontier-risks-of-open-weight-llms/
在本论文中,我们研究了发布 gpt-oss 的最坏情况前沿风险。我们引入了恶意微调(MFT),通过在两个领域对 gpt-oss 进行微调来尽可能地激发其能力:生物学和网络安全。为了最大化生物风险(biorisk),我们精心挑选与威胁创建相关的任务,并在具备网络浏览功能的强化学习环境中训练 gpt-oss。为了最大化网络安全风险,我们在代理编码环境中训练 gpt-oss 来解决夺旗(CTF)挑战。我们在前沿风险评估中将这些 MFT 模型与开源和闭源大语言模型进行了比较。与最先进的闭源模型相比,MFT gpt-oss 的性能不如 OpenAI o3,而 o3 的生物风险和网络安全能力水平低于 Preparedness High 级别。与开源模型相比,gpt-oss 可能在生物学能力方面有轻微提升,但不会显著推进该前沿领域。综合这些结果,我们做出了发布该模型的决定,我们希望 MFT 方法能为估计未来开源发布带来的危害提供有用的指导。
相似文章
@lqiao:开放权重是防御者的优势。来自 @depthfirstlabs 的 dfs-large1 在漏洞发现方面达到前沿模型水平…
一则推文重点介绍了 DepthFirst Labs 的新网络安全模型 dfs-large1,该模型在漏洞发现方面达到前沿模型水平,基于开放的 GLM-5.2 模型构建,并在 Fireworks AI 上通过强化学习进行后训练,认为开放权重是防御者的优势。
开源权重LLM在准确性上已迎头赶上(21分钟阅读)
一个新的基准ClinReg在真实的监管和临床试验任务上评估LLM,发现开源权重模型现在在准确性上与闭源模型相当,而成本仅为其一小部分。
开源权重大语言模型与闭源大语言模型之间的差距
使用Artificial Analysis Intelligence Index和其他基准测试分析开源权重与闭源大语言模型之间的差距,发现在某些指标上差距正在缩小,但在其他指标上保持稳定。
开放权重AI模型正在逼近前沿水平,安全差距依然存在。
SaferAI的一份报告发现,来自中国Z.ai的开放权重模型GLM-5.2正在缩小与领先前沿模型的能力差距,但在危险的网络和生物安全测试中失败,凸显了开放权重模型日益扩大的安全差距。
量化并缓解前沿大语言模型中的过早闭合
本文定义并衡量了前沿大语言模型中的过早闭合现象,发现即使正确选项被移除或需要澄清时,模型仍频繁给出自信的回答,凸显了医疗应用中的一个关键安全问题。