Datadog 使用 Codex 进行系统级代码审查
摘要
Datadog 将 OpenAI 的 Codex 集成到其代码审查流程中,发现它能检测出人类审查员遗漏的 22% 的历史事件,展现出相比传统静态分析工具更强的系统级推理能力。
OpenAI 和 Datadog 品牌图形,左侧为 OpenAI 字样,右侧为 Datadog 标志,中间为白色背景上的抽象棕色毛绒纹理面板。
查看缓存全文
缓存时间: 2026/04/20 14:50
# Datadog 使用 Codex 进行系统级代码审查
来源:https://openai.com/index/datadog/
Datadog(在新窗口中打开)(https://www.datadoghq.com/)运行着全球使用最广泛的观测平台之一,帮助公司监控、故障排查并保障复杂分布式系统的安全。当出现故障时,客户依赖 Datadog 快速定位问题,这意味着可靠性必须在代码进入生产环境之前就内建好。
对于 Datadog 的工程团队而言,这让代码审查成为高风险的关键环节。这不仅仅是捕捉错误,更是要理解变更如何在相互关联的系统中产生连锁反应——这正是传统静态分析和基于规则的工具常常力不从心之处。
为了应对这一挑战,Datadog 的 AI 开发体验(AI DevX)团队采用了 OpenAI 的编程代理 Codex,它将系统级推理引入代码审查,能够发现人类在大规模审查中难以察觉的风险。
“节省时间确实重要,”Datadog AI DevX 团队负责人 Brad Carter 表示,“但在我们这样的规模下,预防事故更具说服力。”
传统上,Datadog 的有效代码审查高度依赖资深工程师——他们足够了解代码库、其历史以及架构权衡,从而能够发现系统性风险。但这种深度背景很难规模化,早期的 AI 代码审查工具并未解决这一问题;许多工具表现得像高级的 linter,只标记表面问题而忽略了更广泛的系统细微差别。Datadog 的工程师经常觉得这些建议太肤浅或噪音太大,而忽略它们。
Datadog 开始试点 OpenAI 的编程代理 Codex,将其集成到实际开发工作流中。在公司最大且使用最频繁的代码仓库之一,每个拉取请求都由 Codex 自动审查。工程师对 Codex 的评论给予点赞或点踩,并在团队间分享非正式反馈。许多人指出,Codex 的反馈值得一读,这与之前那些产生噪音或浅薄建议的工具不同。
为了测试 AI 辅助审查是否不仅能指出风格问题,Datadog 构建了一个事故回放的测试框架。团队没有使用假设场景,而是回溯了历史事故。他们重建了导致事故的拉取请求,对每个请求运行 Codex,仿佛它是原始审查的一部分,然后询问负责这些事故的工程师,Codex 的反馈是否会产生影响。
结果:Codex 发现了超过 10 个案例,约占 Datadog 所审查事故的 **22%**,在这些案例中,工程师确认 Codex 提供的反馈会产生影响——这比评估中的任何其他工具都要多。
由于这些拉取请求已经通过了代码审查,回放测试表明 Codex 揭示了审查者当时未能发现的风险,它补充了人工判断,而非取代之。
Datadog 的分析显示,Codex 始终能够标记那些仅从直接 diff 中不易察觉、且无法通过确定性规则捕获的问题。
工程师描述 Codex 的评论不仅仅是“机器人噪音”:
- Codex 指出了与 diff 中未涉及的模块的交互
- 它识别了跨服务耦合区域中缺失的测试覆盖
- 它强调了带来下游风险的 API 合约变更
> “对我来说,Codex 的评论就像是我共事过的最聪明的工程师,而且有无限时间来查找错误。它能看到我大脑无法同时掌握的关联。”
> ——Brad Carter,Datadog 工程经理
这种将审查反馈与真实可靠性结果联系起来的能力,正是 Codex 在 Datadog 评估中脱颖而出的原因。与静态分析工具不同,Codex 将拉取请求的意图与提交的代码变更进行比较,在整个代码库和依赖项上进行推理,执行代码和测试以验证行为。
“它是第一个真正似乎在程序的更大上下文中考虑 diff 的工具,”Carter 表示。“这既新颖又令人大开眼界。”
对许多工程师而言,这种转变彻底改变了他们与 AI 审查的互动方式。“我开始将 Codex 的评论当作真正的代码审查反馈,”Datadog 高级软件工程师 Ted Wexler 表示。“不是我会快速浏览或忽略的内容,而是值得关注的内容。”
评估之后,Datadog 更广泛地在工程团队中部署了 Codex。如今,**超过 1,000 名工程师** 经常使用它。
反馈大多以有机方式涌现,而非通过正式的工具内指标。工程师在 Slack 上分享有用的见解、建设性评论以及 Codex 帮助他们从不同角度思考问题的时刻。
虽然节省时间的效果显著,但团队一致指出,工作方式发生了更有意义的转变。
> “Codex 改变了我对代码审查应有的看法。它不是要复制我们最优秀的人工审查者,而是要发现人类在孤立审查变更时难以看到的关键缺陷和边缘情况。”
> ——Brad Carter,Datadog 工程经理
对 Datadog 来说,更广泛的影响在于代码审查本身定义方式的改变。团队不再将审查视为捕捉错误或优化周期时间的检查点,而是将 Codex 视为一个核心可靠性系统,扮演着合作伙伴的角色:
- 揭示超出单个审查者上下文范围的风险
- 强调跨模块和跨服务的交互
- 提升大规模发布的信心
- 让人工审查者专注于架构和设计
这一转变与 Datadog 领导层对工程优先级的定位一致,即可靠性和信任与速度同等重要,甚至更重要。
“我们是其他一切崩溃时企业依赖的平台,”Carter 表示。“预防事故能够增强客户对我们的信任。”
相似文章
数据科学团队如何使用 Codex
本指南来自 OpenAI Academy,解释了数据科学团队如何利用 Codex 加速分析工作流程,包括根本原因分析、业务影响报告以及处理模糊请求。
@gdb:Codex 现在可以对每个 GitHub 拉取请求执行安全审查,并将发现内联显示。这是整体计划的一部分…
OpenAI 正在推出 Codex 安全审查的研究预览版,该功能可自动审查 GitHub 拉取请求中的安全问题,并内联显示发现,这是利用 AI 模型提高代码安全性的计划的一部分。
面向工程团队的 Codex
OpenAI 推出了面向工程团队的 Codex,这是一款 AI 工具,可自动执行从问题创建到代码审查的编码任务,同时让工程师保持掌控。
Codex Security:现处于研究预览阶段
OpenAI 推出 Codex Security,这是一款现处于研究预览阶段的自主应用程序安全工具。它能高置信度识别复杂漏洞并提供可操作的修复方案,同时与传统的安全工具相比,显著减少误报和噪音。
NTT DATA Group 借助 Codex 将事件分析时间缩短至 30 分钟
NTT DATA Group 使用 OpenAI 的 Codex 将事件分析从三天缩短至 30 分钟,展示了 AI 在企业工作流中的代理能力,并推动了工程团队之外的更广泛采用。