推出 GPT-5.3-Codex

OpenAI Blog 模型

摘要

OpenAI 推出 GPT-5.3-Codex,这是一款先进的智能编程模型,融合了前沿编程能力、推理能力和专业知识,在 SWE-Bench Pro 和 Terminal-Bench 上实现了最先进的性能,同时比前代模型快 25%。

GPT-5.3-Codex 是一个基于 Codex 的原生智能体,它将前沿的编程性能与通用推理能力相结合,以支持长期的、现实世界中的技术工作。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:50

# 介绍 GPT-5.3-Codex 来源: https://openai.com/index/introducing-gpt-5-3-codex/ 我们推出了一款新模型,进一步释放 Codex 的能力: GPT‑5.3‑Codex,这是迄今为止能力最强的代理型编程模型。该模型同时提升了 GPT‑5.2‑Codex 的前沿编程性能以及 GPT‑5.2 的推理和专业知识能力,并且速度提升了 25%。这使得它能够承担涉及研究、工具使用和复杂执行的长期任务。就像一位同事一样,你可以在 GPT‑5.3‑Codex 工作时与其互动和引导,而不会丢失上下文。 GPT‑5.3‑Codex 是我们的第一款在自身构建过程中发挥了关键作用的模型。Codex 团队使用早期版本调试自己的训练流程、管理自身部署、诊断测试结果和评估——Codex 在加速自身开发方面的能力让团队惊叹不已。 借助 GPT‑5.3‑Codex,Codex 从一个能够编写和审查代码的代理,转变为一个几乎能完成开发者和专业人员在计算机上所能做的任何事情。 GPT‑5.3‑Codex 在 SWE-Bench Pro 和 Terminal-Bench 上创下了新的行业最高水平,并在 OSWorld 和 GDPval 上展现出强劲性能——这四个基准用于衡量编程、代理能力和真实世界能力。 GPT‑5.3‑Codex 在 SWE-Bench Pro 上达到了最先进的性能,这是一项对真实世界软件工程能力的严格评估。SWE-bench Verified 只测试 Python,而 SWE-Bench Pro 覆盖四种语言,抗污染能力更强,更具挑战性、多样性和行业相关性。它还在 Terminal-Bench 2.0 上远超之前的最先进水平,该基准衡量 Codex 这类编程代理所需的终端技能。值得注意的是,GPT‑5.3‑Codex 在实现这一性能时消耗的 token 数量少于任何之前的模型,让用户可以构建更多内容。 将前沿编程能力、美学改进和压缩技术相结合,产生了一款能够完成出色工作的模型,可以连续数天从零构建高度实用的复杂游戏和应用。为了测试模型的 web 开发能力和长期代理能力,我们要求 GPT‑5.3‑Codex 为我们构建两款游戏: Codex 应用发布时的赛车游戏第二版 (https://openai.com/index/introducing-the-codex-app/),以及一款潜水游戏。通过使用“开发 web 游戏”技能以及预先选择的通用后续提示(如“修复 bug”或“改进游戏”),GPT‑5.3‑Codex 在数百万 token 的范围内自主迭代了这些游戏。观看预告片并亲自玩游戏,看看 Codex 能做什么。 与 GPT‑5.2‑Codex 相比,GPT‑5.3‑Codex 在您要求其制作日常网站时也能更好地理解您的意图。简单或不明确的提示现在默认会生成功能更丰富、默认设置更合理的网站,为您提供一个更强大的起点画布,将您的想法变为现实。 例如,我们要求 GPT‑5.3‑Codex 和 GPT‑5.2‑Codex 构建以下两个着陆页。GPT‑5.3‑Codex 自动将年度计划显示为折扣后的月度价格,使折扣显得清晰而有意图,而不是乘以年度总价。它还制作了一个自动切换的推荐轮播图,包含三条不同的用户引述,而不是一条,结果页面默认感觉更完整、更具生产就绪状态。 软件工程师、设计师、产品经理和数据科学家所做的工作远不止生成代码。GPT‑5.3‑Codex 旨在支持软件生命周期中的所有工作——调试、部署、监控、编写 PRD、编辑文案、用户研究、测试、指标等等。其代理能力超越了软件领域,帮助您构建任何您想构建的东西——无论是幻灯片还是分析电子表格中的数据。 借助与我们之前 GDPval 结果中使用的类似的自定义技能,GPT‑5.3‑Codex 在由GDPval (https://openai.com/index/gdpval/) 衡量的专业知识工作上表现出强劲性能,可与 GPT‑5.2 媲美。GDPval 是 OpenAI 于 2025 年发布的一项评估,衡量模型在 44 个职业的明确定义的知识工作上的表现。这些任务包括制作演示文稿、电子表格和其他工作成果。 以下是该代理生成的一些工作示例。 OSWorld 是一个代理型计算机使用基准,要求代理在可视化桌面计算机环境中完成生产力任务。GPT‑5.3‑Codex 展示了比之前的 GPT 模型强得多的计算机使用能力。 在 OSWorld-Verified 中,模型使用视觉来完成各种计算机任务。人类得分为 ~72%。 综合这些在编程、前端、计算机使用和真实世界任务上的结果,表明 GPT‑5.3‑Codex 不仅擅长单个任务,更标志着向一个单一的通用代理迈出了一步,该代理能够在真实世界技术工作的整个范围内进行推理、构建和执行。 随着模型能力变得更强,差距从代理能够做什么转向人类如何更容易地与多个并行工作的代理进行交互、指导和监督。Codex 应用程序使管理和指导代理变得更加容易,现在有了 GPT‑5.3‑Codex,互动性更强。借助新模型,Codex 提供频繁更新,让您随时了解关键决策和进展。不再需要等待最终输出,您可以实时交互——提问、讨论方法、并引导解决方案。GPT‑5.3‑Codex 会讲述它在做什么,响应反馈,并让您从头到尾都参与其中。 在应用程序中启用工作时的引导功能: 设置 > 通用 > 后续行为。 最近 Codex 的快速改进建立在 OpenAI 所有团队跨越数月或数年的研究项目成果之上。这些研究项目正在被 Codex 加速,OpenAI 的许多研究人员和工程师描述他们今天的工作与仅仅两个月前相比发生了根本性变化。即使是 GPT‑5.3‑Codex 的早期版本也展示了卓越的能力,使我们的团队能够使用这些早期版本改进训练并支持后续版本的部署。 Codex 在非常广泛的任务中都有用,因此很难完整列举它帮助团队的所有方式。举几个例子: 研究团队使用 Codex 监控和调试此次发布的训练运行。它加速了研究,不仅仅是调试基础设施问题: 它帮助跟踪整个训练过程中的模式,对交互质量进行深入分析,提出修复方案,并构建丰富的应用程序,让人类研究人员能够精确理解模型行为与之前模型的差异。 工程团队使用 Codex 优化和调整 GPT‑5.3‑Codex 的测试框架。当我们开始看到奇怪边缘情况影响用户时,团队成员使用 Codex 识别上下文渲染错误,并根因定位低缓存命中率。GPT‑5.3‑Codex 在整个发布过程中持续帮助团队,动态扩展 GPU 集群以适应流量激增,并保持延迟稳定。 在 alpha 测试期间,一位研究人员想了解 GPT‑5.3‑Codex 每轮能完成多少额外工作以及由此带来的生产力差异。GPT‑5.3‑Codex 提出了几个简单的正则表达式分类器来估计澄清请求的频率、用户正面和负面回应、任务进展,然后可扩展地在所有会话日志上运行这些分类器,并生成包含结论的报告。使用 Codex 进行构建的人们更满意,因为该代理能更好地理解他们的意图,每轮进展更多,提出更少的澄清问题。 由于 GPT‑5.3‑Codex 与其前辈差异巨大,alpha 测试的数据呈现出许多不寻常且反直觉的结果。团队中的一名数据科学家与 GPT‑5.3‑Codex 合作,构建了新的数据管道,并以比我们标准仪表盘工具更丰富的方式可视化结果。结果与 Codex 共同分析,它在三分钟内简洁地总结了数千数据点中的关键见解。 单独来看,所有这些任务都是 Codex 如何帮助研究人员和产品构建者的有趣示例。综合来看,我们发现这些新能力显著加速了我们的研究、工程和产品团队。 近几个月来,我们在网络安全任务上的模型性能取得了显著提升,惠及开发者和安全专业人员。与此同时,我们一直在准备加强的网络保障措施 (https://openai.com/index/strengthening-cyber-resilience/),以支持防御性用途和更广泛的生态系统韧性。 GPT‑5.3‑Codex 是我们根据准备框架 (https://openai.com/index/updating-our-preparedness-framework/) 分类为网络安全相关任务“高能力” (https://openai.com/index/gpt-5-3-codex-system-card/) 的第一个模型,也是我们第一个直接训练以识别软件漏洞的模型。虽然我们没有确凿证据表明它可以端到端地自动化网络攻击,但我们采取预防性方法,并部署了迄今为止最全面的网络安全安全堆栈。我们的缓解措施包括安全训练、自动监控、高级功能的可信访问,以及包括威胁情报在内的执行管道。 由于网络安全本质上是双用途的,我们采取基于证据的迭代方法,加速防御者发现和修复漏洞的能力,同时减缓滥用。作为其中的一部分,我们推出了网络安全可信访问 (https://openai.com/index/trusted-access-for-cyber/),这是一个加速网络防御研究的试点项目。 为防止滥用,我们系统检测到具有较高网络风险的一些请求可能会从 GPT‑5.3‑Codex 自动路由到 GPT‑5.2。我们正在继续完善这些保障措施。进行安全研究或认为其请求被错误分类的开发人员可以通过我们的网络安全可信访问计划申请完全访问权限,或使用 /feedback 命令报告问题。 我们正在投资生态系统保障措施,例如扩展安全研究代理 Aardvark (https://openai.com/index/introducing-aardvark/) 的私有测试版,作为 Codex 安全产品与工具套件的首个产品;并与开源维护者合作,为广泛使用的项目(如 Next.js)提供免费代码库扫描——上周,一名安全研究人员使用 Codex 发现了漏洞并披露 (在新窗口中打开) (https://vercel.com/changelog/summaries-of-cve-2025-59471-and-cve-2025-59472)。 在 2023 年启动的 100 万美元网络安全资助计划的基础上,我们还将承诺提供 1000 万美元的 API 额度,以利用我们最强大的模型加速网络防御,特别是针对开源软件和关键基础设施系统。从事善意安全研究的组织可以通过我们的网络安全资助计划 (https://openai.com/index/openai-cybersecurity-grant-program/) 申请 API 额度和支持。 GPT‑5.3‑Codex 可通过付费 ChatGPT 计划获得,适用于您使用 Codex 的所有地方: 应用程序、CLI、IDE 扩展和网页。我们正在努力尽快安全地启用 API 访问。 通过此次更新,我们现在还使 GPT‑5.3‑Codex 对 Codex 用户运行速度提升了 25%,这得益于我们基础设施和推理栈的改进,带来更快的交互和更快的结果。 GPT‑5.3‑Codex 是共同设计、训练并在 NVIDIA GB200 NVL72 系统上服务的。我们感谢 NVIDIA 的合作伙伴关系。 借助 GPT‑5.3‑Codex,Codex 正在超越编写代码,将代码作为操作计算机和端到端完成工作的工具。通过推动编程代理的能力前沿,我们也在解锁更广泛的知识工作类别——从构建和部署软件到研究、分析和执行复杂任务。最初专注于成为最佳编程代理,现已发展成更通用的计算机协作伙伴的基础,既扩展了能够构建的人群,也扩展了 Codex 所能实现的可能性。

相似文章

GPT-5.2-Codex 介绍

OpenAI Blog

OpenAI 发布了 GPT-5.2-Codex,这是一个先进的代理型编码模型,针对复杂软件工程任务进行了优化,在长上下文理解、Windows 支持和网络安全能力方面有所改进。该模型在 SWE-Bench Pro 和 Terminal-Bench 2.0 上取得了最先进的性能,现已向付费 ChatGPT 用户开放,API 访问将在未来几周内提供。

GPT-5.3-Codex 系统卡

OpenAI Blog

OpenAI 发布了 GPT-5.3-Codex,这是目前最强大的代理型编码模型,结合了前沿的编码性能与高级推理能力,具备交互式长时间任务执行功能,并在网络安全领域引入了新颖的高能力安全防护措施。

利用 GPT-5.1-Codex-Max 构建更多

OpenAI Blog

OpenAI 推出 GPT-5.1-Codex-Max,这是一款新的智能代理编码模型,具有改进的推理能力、token 效率,以及通过“压缩”机制在数百万个 token 上保持连贯工作的能力。该模型更快速、更智能,可以持续运行数小时甚至数天的长时间任务,代表了 AI 辅助软件工程的重大进步。

GPT-5 系统卡补充:GPT-5-Codex

OpenAI Blog

# GPT-5 系统卡补充:GPT-5-Codex 来源:[https://openai.com/index/gpt-5-system-card-addendum-gpt-5-codex/](https://openai.com/index/gpt-5-system-card-addendum-gpt-5-codex/) GPT-5-Codex 是 GPT-5 的一个版本,针对 Codex 中的代理编码进行了优化。与其前身 codex-1 一样,该模型采用强化学习方法在各种环境中的真实编码任务上进行了训练,以生成与人类编码风格和 PR 偏好相近的代码,并精确遵循指令

Codex 升级功能介绍

OpenAI Blog

OpenAI 发布 GPT-5-Codex,这是 GPT-5 的优化版本,专为代理软件工程任务设计,可通过 API 和 Codex 集成开发环境获取,具有改进的代码审查功能和长形式任务执行能力。