评估在代码上训练的大型语言模型

OpenAI Blog 论文

摘要

OpenAI 推出了 Codex,这是一个在 GitHub 代码上微调的 GPT 模型,在 HumanEval(一个用于从文档字符串进行代码合成的新基准)上实现了 28.8% 的功能正确性,远超 GPT-3(0%)和 GPT-J(11.4%)。该论文表明重复采样可以将性能提升至 70.2%(采样 100 次),并讨论了代码生成系统的局限性和更广泛的影响。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:55

# 评估在代码上训练的大型语言模型 来源:https://openai.com/index/evaluating-large-language-models-trained-on-code/ ## 摘要 我们介绍了 Codex,一个在 GitHub 公开代码上微调的 GPT 语言模型,并研究了其 Python 代码生成能力。Codex 的一个独特的生产版本支撑着 GitHub Copilot。在 HumanEval 上(一个我们发布的新评估集,用于衡量从文档字符串合成程序的函数正确性),我们的模型解决了 28.8% 的问题,而 GPT-3 解决了 0%,GPT-J 解决了 11.4%。此外,我们发现从模型中进行重复采样是为困难提示生成有效解决方案的一种令人惊讶的有效策略。使用这种方法,我们每个问题采样 100 次,解决了 70.2% 的问题。对我们模型的仔细调查揭示了其局限性,包括在处理描述长操作链的文档字符串和将操作绑定到变量方面的困难。最后,我们讨论了部署强大代码生成技术的潜在更广泛影响,涵盖安全性、保障和经济学方面。

相似文章

OpenAI Codex

OpenAI Blog

OpenAI Codex 是 GPT-3 的后代,在自然语言和数十亿行源代码上训练,能够跨 15 种以上编程语言生成可运行代码,具有比 GPT-3 多 3.5 倍的上下文内存,现已通过 API 以私密测试版形式提供。

推出 GPT-5.3-Codex

OpenAI Blog

OpenAI 推出 GPT-5.3-Codex,这是一款先进的智能编程模型,融合了前沿编程能力、推理能力和专业知识,在 SWE-Bench Pro 和 Terminal-Bench 上实现了最先进的性能,同时比前代模型快 25%。

Codex 升级功能介绍

OpenAI Blog

OpenAI 发布 GPT-5-Codex,这是 GPT-5 的优化版本,专为代理软件工程任务设计,可通过 API 和 Codex 集成开发环境获取,具有改进的代码审查功能和长形式任务执行能力。

利用 GPT-5.1-Codex-Max 构建更多

OpenAI Blog

OpenAI 推出 GPT-5.1-Codex-Max,这是一款新的智能代理编码模型,具有改进的推理能力、token 效率,以及通过“压缩”机制在数百万个 token 上保持连贯工作的能力。该模型更快速、更智能,可以持续运行数小时甚至数天的长时间任务,代表了 AI 辅助软件工程的重大进步。

GPT-5 系统卡补充:GPT-5-Codex

OpenAI Blog

# GPT-5 系统卡补充:GPT-5-Codex 来源:[https://openai.com/index/gpt-5-system-card-addendum-gpt-5-codex/](https://openai.com/index/gpt-5-system-card-addendum-gpt-5-codex/) GPT-5-Codex 是 GPT-5 的一个版本,针对 Codex 中的代理编码进行了优化。与其前身 codex-1 一样,该模型采用强化学习方法在各种环境中的真实编码任务上进行了训练,以生成与人类编码风格和 PR 偏好相近的代码,并精确遵循指令