代理人工智能时代的科学计算

OpenAI Blog 新闻

摘要

OpenAI 分享了一份实地报告,介绍如何使用像 Codex 和 Claude Code 这样的 AI 代理来协助科学计算项目,展示了在软件开发和维护方面的显著加速,同时将研究人员的角色转变为验证和编排。

一份新的实地报告展示了科学家如何利用 AI 编码代理来现代化科学计算,加速基因组学及其他领域的软件开发和发现。
查看原文
查看缓存全文

缓存时间: 2026/07/28 18:27

# 主体型人工智能时代的科学计算 来源:https://openai.com/index/scientific-computing-agentic-ai/ 科学计算是学术界和工业界现代研究的核心支柱。然而,用于分析科学信息的软件却难以跟上数据快速生成的步伐。许多广泛使用的研究工具最初只是作为研究论文附带的代码而生,由小型学术团队构建,这些团队工程经验有限,且几乎没有时间进行打包、测试、优化或长期维护。其结果是,科学基础设施常常依赖缓慢、脆弱的流程,需要不断维护。这些制约因素阻碍了科学发现的进程。 AI 代理正在开始改变这一局面。通过降低工程工作的成本并承担繁琐的实现任务,它们可以帮助研究人员更快地原型化想法,开展之前不切实际的项目,并更轻松地长期维护软件。因此,科学软件变得更加高效且维护得更好,使研究人员能够将更多时间用于发现。 我们分享一份探索性的现场报告,涵盖八个主要由 AI 代理辅助的科学计算项目,这些项目主要聚焦生命科学领域;其中五个项目仅使用 Codex,三个项目则结合使用了 Codex 和 Claude Code。该报告汇集了每个项目团队撰写的案例研究,并总结了反复出现的主题。这些项目涵盖从日常维护和针对性优化,到大规模语言迁移和针对 GPU 的原生重写。贡献者报告显示,AI 代理显著加快了软件开发与维护的速度,在某些情况下,帮助小型团队承担了原本需要更多时间或专业工程支持的工作。但他们也强调了建立所产生工具的明确长期责任和管理所面临的持续挑战。 贡献者一致描述了一种研究人员角色从“实现”向“验证与编排”的转变:定义要构建什么,确定如何衡量正确性,并决定项目何时可以发布。在这种新兴模式下,研究人员仍然掌控科学方向和质量标准,但 AI 代理的辅助提供了速度上的提升。 ## 案例研究 #### **现代化了一个广泛使用的基因组数据解析库** cyvcf2 是一个用于读写基因组变异文件的 Python 库。GPT‑5.5 用现代化统一流程替换了该库的旧版构建和打包系统,旨在让库更易于安装、测试和发布。 > *借助编码代理,快速前进相当容易;但要在科学领域走得更远,目前仍需专家的指导、理解、品味和关怀。* > > —Brent Pedersen ## 反复出现的主题 尽管项目范围差异巨大,但它们表明编码代理正使得工程劳动和专业知识在科学计算中不再成为主要制约因素。现在,瓶颈在于验证 AI 代理的输出,这仍然依赖于人类判断。 在多个案例中,AI 代理能有效处理具体、范围明确的任务,但无法可靠地判断其工作是否具有科学有效性或符合预期。事实上,即使工作中存在明显错误,AI 代理也常常表现出自信。因此,人类评审者需要找到可靠的方法来验证结果。最有效的方法是使用外部参考或可测量的验收目标,例如精确的输出一致性、与现有工具的等价性、适当的统计行为,或使用模拟数据预先确定的答案。 另一个反复出现的主题是,这些项目通常分阶段进行,采用反馈驱动的迭代方式,而非一次性完成。贡献者将宏观目标拆解为较小的变更,然后使用中间基准和测试系统来评估并优化 AI 代理的工作。AI 代理通常能快速给出初步实现,但解决边缘情况和细微的数字差异则耗时更长。完成实现的“最后一公里”往往需要最多的工作。 总体而言,这些案例研究表明,AI 代理正在让研究人员减少花在实现上的时间,将更多精力用于指导科学工作。人们定义目标,将复杂项目分解为可管理的模块,并判断结果是否科学有效。通过缓解长期存在的工程约束,AI 代理扩展了研究人员能够构建的内容,同时让他们能够专注于最重要的科学问题和决策。 ## 长期管理仍然至关重要 研究软件中的维护缺口长期拖慢了迭代速度,并限制了可重复性和可靠性。已发表的关于“研究代码(opens in a new window)(https://doi.org/10.1038/s41597-022-01143-6)”和“组学工具(opens in a new window)(https://doi.org/10.1371/journal.pbio.3000333)”的研究发现,已发布的软件往往无法在新的计算环境中正常安装或按文档运行,迫使研究人员花费大量时间进行配置和调试。即使是常规的改进也能为研究人员节省时间并降低计算需求,而基于性能的重构和重写则能带来更大的收益。 但是,更低的实现成本也使得产生大量类似的改写版本变得更容易,这分散了用户群体,并分散了维持任何一个工具可靠性所需的专家注意力。因此,长期管理和归属认定至关重要。成熟的科学软件携带了未文档化的约定、兼容性要求和用户信任,仅仅翻译源代码是无法复现这些的。 案例研究展示了几条可能的出路。对 MHCflurry 和 cyvcf2 的改动已合并回其原始上游项目,而 rustar‑aligner 则转移到新的社区管理之下,因为原项目已被废弃。如果能够与现有维护者协调,应尽早开始。当需要独立实现时,必须有明确的负责人和可信的维护计划。缺乏这些,今天的现代化重写就可能变成明天被遗弃的代码,而非可靠的科研基础设施。 ## 迈向更持久的科学软件 这份现场报告是回顾性和探索性的,但案例研究指出了科学软件开发方式的实际转变。像 Codex 这样的编码代理可以显著降低维护、迁移、优化和新实现的成本。其长期科学价值仍然取决于人类在构建什么、如何验证以及由谁维护方面的决策。更深层的变化不仅仅是研究人员能够产出更多软件,而是他们能够将更多精力用于定义、验证和管理这些工具。 这些案例研究表明,AI 代理已经能够加速科学计算中的迭代速度。随着编码代理的改进,研究人员将能够减少花在维持分析流程运行上的时间,将更多精力投入到推动各自领域的发展上。

相似文章

智能代理如何改变工作

OpenAI Blog

OpenAI报告称,智能代理AI,特别是其Codex产品,正在改变工作方式,通过支持更长期的任务并成为跨部门(包括非技术部门)的主要AI工具,且在非开发者中迅速普及。

科学领域的代理型AI实验

arXiv cs.AI

本文介绍了两个代理型AI框架:DeepTS/DeepCollector和DeepScribe,它们利用混合本地-云端架构和大语言模型,自动化科学工作流程,包括时间序列数据整理以及将物理讲座转化为结构化报告。

Cisco 和 OpenAI 用 AI 智能体重新定义企业工程

OpenAI Blog

Cisco 与 OpenAI 合作,将 Codex 从代码补全工具转变为企业级 AI 工程智能体,能够大规模自主执行工作流,显著提升生产力:构建时间缩短 20%,缺陷修复吞吐量提高 10-15 倍。