科学AI的自动化数据就绪
摘要
本文介绍了REDI,这是一个开源框架,通过统一的五阶段流水线(摄取、预处理、转换、结构化、输出)将原始科学数据集自动转换为AI就绪数据,并配有配套工具SetGo以实现FAIR合规性,在多个科学领域进行了评估。
arXiv:2607.02771v1 Announce Type: new
Abstract:领导计算设施管理着大规模科学数据集,这些数据集在作为AI训练数据之前通常需要大量转换。然而,现有框架没有完全统一自动化转换、就绪性评估、来源追踪和智能体原生部署。我们提出了REDI,这是一个开源框架,通过统一的五阶段流水线(摄取、预处理、转换、结构化、输出)弥补了这一差距,每个阶段都配备了可重现性和可部署为智能体可调用技能的工具;配套工具SetGo自动化了FAIR合规性和目录发布。在气候、蛋白质组学、材料科学和核聚变领域进行了评估,REDI将所有数据集从原始转换为AI就绪,输出结果经过领域专家参考验证,初步结果显示在Frontier上气候案例实现了接近理想的并行扩展至100个节点。来源追踪性能剖析显示文件I/O是流水线的主要成本,格式选择是一阶优化杠杆。这些结果表明REDI是一个跨领域平台,为科学AI提供自动化数据就绪,将数据准备瓶颈转化为可重现、可重用的社区资产。
查看缓存全文
缓存时间: 2026/07/07 04:34
# 科学AI的自动化数据就绪 来源:https://arxiv.org/html/2607.02771 Sean R\. Wilkinsonhttps://orcid.org/0000-0002-1443-7479, Valentine G\. Anantharajhttps://orcid.org/0000-0002-9356-1311, Jong Youl Choihttps://orcid.org/0000-0002-6459-6152, Ketan Maheshwarihttps://orcid.org/0000-0003-3800-662X, Marshall McDonnellhttps://orcid.org/0000-0002-3713-2117, Massimiliano Lupo Pasinihttps://orcid.org/0000-0002-4980-6924, Polina Shpilkerhttps://orcid.org/0000-0002-6761-7326, Renan Souzahttps://orcid.org/0000-0002-1794-808X, Patrick Widenerhttps://orcid.org/0000-0002-5882-0816, Sarp Oralhttps://orcid.org/0000-0001-8745-7078, and Wesley Brewerhttps://orcid.org/0000-0002-3639-3956 ###### 摘要 领导级计算设施管理的大规模科学数据集,在用作AI训练数据之前,通常需要经历大量的转换。然而,目前没有任何一个现有框架能够完全统一自动化转换、就绪度评估、溯源追踪和智能体原生部署。我们提出REDI,一个开源框架,通过一个统一的五阶段流水线(摄取、预处理、转换、结构化、输出)解决了这一空白,每个阶段都配备了用于可重现性的工具,并可作为智能体可调用的技能进行部署;配套工具SetGo自动化FAIR合规性和目录发布。在气候、蛋白质组学、材料科学和核聚变四个领域的评估中,REDI将所有数据集从原始状态转换为AI就绪状态,输出结果经过领域专家参考验证,初步结果显示在Frontier上对气候案例实现了接近理想的并行扩展到100个节点。带溯源分析的性能剖析显示,文件I/O是流水线的主要成本,而格式选择是一阶优化杠杆。这些结果确立了REDI作为一个跨领域平台,为科学AI提供自动化的数据就绪能力,将数据准备瓶颈转化为可重现、可复用的社区资产。 ## I 引言 人工智能(AI)日益被认为是科学发现中的变革性能力,部分原因在于它能够支持数据驱动建模、替代仿真、不确定性量化,以及在越来越多的科学领域内开发基础模型。用基于学习的方法增强传统的仿真和实验工作流,有潜力在多个尺度和模态上加速发现。然而,实现这一潜力关键取决于可计算科学数据的可用性。具体来说,它需要的数据集不仅被归档或保存,而且还要经过结构化、验证和语义增强,以便能够被大规模AI工作流直接使用。随着科学仪器和实验产生日益庞大且复杂异构的数据,从原始数据到AI就绪资产的转变已成为科学生命周期中一个新兴且具有挑战性的组成部分。为此,我们提出了数据集成就绪引擎(REDI),111REDI源代码:https://doi.org/10.11578/dc.20260702.1一个通过统一的五阶段流水线(即摄取、预处理、转换、结构化、输出)自动化AI数据就绪的开源框架。据我们所知,REDI是第一个在科学计算的感知生命周期架构内集成了自动化转换、就绪度评估、溯源追踪和验证的框架。 REDI运行数据转换 REDI评估就绪度评估 SetGo元数据就绪 原始数据 Δ\\Deltaredi discover profile, schema infer, inventory AI就绪数据 redi validate iterate to ground truth match iterate if quality threshold not met 摄取 下载、加载、流式处理 预处理 网格重映射、匿名化、对齐 转换 特征化、归一化、编码 结构化 张量化、为图或序列构建结构 输出 序列化、分区、保存 领域感知指标 完整性、重复性、异常值、类别平衡 Delta报告 流水线前后对比、溯源链接、PROVENANCE\_CARD\.md 特征相关性、隐私、k–匿名性、差分隐私 FAIR合规性 可发现、可访问、可互操作、可重用 治理 溯源、许可、可重现性 发布 可追溯性、推送至目录 图1:REDI-SetGo迭代式数据就绪生命周期。原始数据通过REDI经历一系列转换,然后通过内置的`redi assess`命令进行领域感知的就绪度评估。最后,元数据分析和发布到CKAN(综合知识存档网络)、Hugging Face和OpenMetadata等目录由SetGo处理。 “Δ”表示从原始到AI就绪的状态改善;在AI就绪数据集发布之前,可能会进行多次优化迭代。 ### I-A 数据就绪挑战 术语“数据就绪”本质上是依赖于上下文的,因为不同的计算工作流对数据结构、语义和验证有截然不同的要求。因此,有必要问:“为达到什么目的而数据就绪?”在这项工作中,我们主要关注数据就绪相对于为训练科学AI模型(特别是基础模型[1 (https://arxiv.org/html/2607.02771#bib.bib1)])准备数据。在这个范围内,我们将“AI就绪数据”定义为机器可读的数据集,这些数据集(a)已经过领域合适的清理、验证和特征工程,并且(b)包含足够的元数据以支持可重现的模型训练和评估。 科学数据管理长期以来强调数据生命周期各阶段的监管,包括获取、整理、保存、访问和重用。遵循FAIR数据原则[2 (https://arxiv.org/html/2607.02771#bib.bib2)]的框架为让数据可发现、可访问、可互操作和可重用提供了基本指导。尽管FAIR合规性是必要的基础,但对于AI驱动的科学来说并不足够[3 (https://arxiv.org/html/2607.02771#bib.bib3)]。符合FAIR原则的数据可能仍然不适合AI/ML的使用,原因是缺乏结构、表示不一致、用于特征提取的元数据不足,或者与模型训练要求不匹配。反之,已经用于特定训练的数据可能仍然缺乏更广泛重用所需的元数据。我们的工作通过协同工具来解决这些问题:REDI管理数据转换,而SetGo[4 (https://arxiv.org/html/2607.02771#bib.bib4)]确保元数据就绪。 AI数据就绪(DRAI)[5 (https://arxiv.org/html/2607.02771#bib.bib5)]通过明确解决AI工作流的下游计算和统计要求,扩展了传统的数据质量和监管概念。这包括在模式一致性、特征完整性、溯源可追溯性、治理约束以及针对领域期望的验证方面的就绪度。在缺乏标准化就绪度定义和流程的情况下,科学团队经常开发临时的预处理流水线,这些流水线难以重现、审计或跨项目和设施推广。 ### I-B 数据准备的成本与复杂性 缺乏标准化、自动化的就绪度工作流会带来严重的实际后果。从事AI模型开发的实践者一致报告,项目70%–80%的工作量用于准备训练和推理数据,而不是模型开发和科学解释[6 (https://arxiv.org/html/2607.02771#bib.bib6)]。另一个互补的问题是,当已发布的数据看起来已经是AI就绪时,在缺乏标准化工作流的情况下,准备步骤往往没有文档记录,使得结果难以重现或审计。REDI通过两种方式解决了这些不足:当准备步骤缺失时自动执行准备,以及当准备步骤已经发生时提供溯源和透明度。值得注意的是,在2026年,美国国家科学、工程和医学院(NASEM)指出数据准备和清理“最有可能通过AI加速”[7 (https://arxiv.org/html/2607.02771#bib.bib7)],然而在领导级规模上预处理科学数据的计算成本仍然很大程度上未被刻画。本文通过实证性能分析直接填补了这一空白。此外,当预处理成本被刻画时,占主导地位的瓶颈在不同领域和数据体制下差异显著,这对领导级规模的优化有直接影响。 从数据生命周期的角度来看,这种预处理负担代表了数据生产和数据重用之间的一个关键摩擦点。每一个新的AI应用往往都会重建类似的准备步骤,这可能导致重复劳动、不一致的假设,以及对衍生结果的信任度降低。认识到这个问题,NASEM报告的作者呼吁建立“统一的数据生态系统,其中可发现、共享和版本控制的存储库配备标准化的预处理程序和深入的元数据”[7 (https://arxiv.org/html/2607.02771#bib.bib7)]。 数据生命周期是复杂且微妙的。数据被修改、共享、分支、重用和改作他用,每一个这样的行为都意味着需要重新考虑数据准备。人类操作员、人类编写的代码以及日益增多的LLM生成的代码都可能引入错误、不一致以及长期存在且难以发现的问题。数据的重用和改作他用可能暴露数据生命周期维护中未曾预料到的副作用。协作的增加和数据更广泛的可用性与这些因素相结合,使得数据就绪成为一个循环的过程。这在通过REDI框架的迭代数据流中得到了体现(图1 (https://arxiv.org/html/2607.02771#S1.F1)),如果未达到足够的就绪质量阈值,数据集会被重新考虑。该过程的最终输出是一个精炼的AI就绪数据集,可以发布供通用使用,并可能成为新的数据组合的基础,这些组合也是REDI优化(refinement)的候选对象。这种周期性性质进一步推动了标准化、感知生命周期、可自动化的数据就绪流水线的发展,这些流水线可以弥合FAIR数据监管与操作性AI部署之间的差距。 ### I-C 本工作的贡献 本工作的核心贡献是REDI的设计与实现,作为一个跨领域、感知生命周期的自动化数据转换和就绪框架。以下提供更多细节。 - **一个统一的、跨领域的数据就绪框架**。尽管存在针对特定领域数据准备的框架(例如,用于计算流体动力学(CFD)的PhysicsNeMo-Curator[8 (https://arxiv.org/html/2607.02771#bib.bib8)]和用于气候科学的Anemoi-datasets[9 (https://arxiv.org/html/2607.02771#bib.bib9)]),但目前没有通用的框架能为跨异构科学领域和计算工作流的数据就绪提供统一的操作模型。REDI通过实现一致且可解释的就绪度评估、常见预处理任务的可重用性,以及为新兴的多领域基础模型[10 (https://arxiv.org/html/2607.02771#bib.bib10),11 (https://arxiv.org/html/2607.02771#bib.bib11),12 (https://arxiv.org/html/2607.02771#bib.bib12)]提供共享的预处理基础设施,填补了这一空白。 - **领域感知的自动化转换**。REDI根据检测到的数据类型、格式和科学上下文,动态决定预处理操作,包括用于生物信息学数据集的可识别个人身份信息(PII)匿名化、气候数据的网格重映射和坐标标准化,以及用于材料建模的基于图的编码等。输出以标准化、可互操作的格式(Zarr、NPZ、ADIOS)生成,以支持FAIR原则。 - **智能体集成**。虽然REDI是一个独立框架,但它也可以在Claude Code和OpenAI Codex等智能体编程环境中作为数据就绪技能运行,实现自动化流水线构建和执行,并具备完整的溯源、版本控制和可重现性。 - **端到端的数据用于AI工厂**。REDI作为完整数据就绪生命周期的转换核心运行,并辅以内置的`redi assess`命令用于领域感知的质量评估,以及SetGo用于元数据就绪、FAIR合规性验证和自动化目录发布。 - **跨领域实证验证**。我们在气候科学(ClimaX)、蛋白质组学(OpenFold)、材料科学(HydraGNN)和核聚变(XGC1)领域,将REDI与专门的、特定领域的预处理流水线进行了比较评估。在所有案例中,REDI实现了就绪度相当的输出,同时显著降低了预处理复杂性和手动工程工作量。 本文的其余部分结构如下:第二部分 (https://arxiv.org/html/2607.02771#S2) 描述了相关研究工作,涵盖推动REDI发展的各个主题领域;第三部分 (https://arxiv.org/html/2607.02771#S3) 描述了REDI的架构、操作模式以及与SetGo的集成;第四部分 (https://arxiv.org/html/2607.02771#S4) 介绍了用于评估REDI的科学领域和数据集;第五部分 (https://arxiv.org/html/2607.02771#S5) 展示了关于discover模式行为、就绪度评估、流水线性能以及初步并行可扩展性的实证结果;第六部分 (https://arxiv.org/html/2607.02771#S6) 总结了更广泛的发现、局限性和未来工作。 ## II 背景 四个相互关联的问题推动了REDI的发展:表征从原始数据到AI就绪数据所需的概念(readiness vocabulary);在领导级规模下限制流水线设计的高性能计算(HPC)存储特性;仅孤立解决此生命周期问题的碎片化工具现状;以及在缺乏结构化就绪指导时由智能体AI工作流引入的新型故障模式。以下小节分别概述每个领域。 ### II-A 科学生命周期与就绪等级 考虑到科学数据生产的规模以及联邦资助研究固有的公共问责制,美国能源部(DOE)的用户设施和领导级计算中心面临着对溯源、验证、治理和长期监管的严格要求[13 (https://arxiv.org/html/2607.02771#bib.bib13)]。FAIR数据原则[2 (https://arxiv.org/html/2607.02771#bib.bib2),14 (https://arxiv.org/html/2607.02771#bib.bib14)]已在DOE计划和设施中被广泛采用;然而,仅FAIR合规性不足以实现AI就绪:一个数据集可以完全符合FAIR原则,但在作为训练数据服务之前,仍然需要大量的归一化、格式转换或特征工程。与单任务流水线不同,科学基础模型[15 (https://arxiv.org/html/2607.02771#bib.bib15),16 (https://arxiv.org/html/2607.02771#bib.bib16),10 (https://arxiv.org/html/2607.02771#bib.bib10),11 (https://arxiv.org/html/2607.02771#bib.bib11),17 (https://arxiv.org/html/2607.02771#bib.bib17)]的跨领域预训练要求一致的预处理约定:不同的归一化方案、坐标系或特征编码会在训练期间被默默继承,并将微妙的矛盾引入学习到的表示中,事后很难检测。因此,一个强制执行跨领域一致就绪操作的共享预处理基础设施不仅是方便的,而且是结构上的需求。 表征这种从原始到AI就绪的进展需要明确的就绪度分类法。Lawrence[6 (https://arxiv.org/html/2607.02771#bib.bib6)]通过将数据集组织为Band C(可访问)、Band B(可用)和Band A(对特定用途有用),引入了基础性数据就绪等级。
相似文章
AutoResearch AI:迈向AI驱动的科学发现研究自动化
一篇综述论文,探讨了AI从特定任务助手到工作流级研究自动化工具的转变,将AutoResearch定义为AI驱动的科学工作流自动化的光谱,并分析了自主性、可重复性和问责制方面的挑战。
面向AI时代的营养数据基础设施:为智能体介导的研究实现FAIR可操作化
本文介绍了营养数据服务(NDS),这是一种保留来源的基础设施,将FAIR原则付诸实践,用于AI智能体介导的营养研究,解决了数据身份、搜索和交叉映射的挑战。与开放网络重建相比,它展示了强大的基准测试结果和更高的可重复性。
Ressearch AI
Ressearch AI 是一个 AI 驱动的工作区,旨在实现可重现的科学研究。
迈向AI研究的端到端自动化
一篇介绍AI科学家(The AI Scientist)的论文,该系统自动化了从想法生成到同行评审的整个研究生命周期,展示了人工智能在科学贡献方面日益增长的能力。
AutoResearch AI:迈向人工智能驱动的研究自动化以实现科学发现
本综述审视了人工智能驱动的研究自动化(AutoResearch)这一新兴领域,分析了AI系统如何从孤立的任务辅助转向完整的工作流级别的科学发现。它定义了从人类引导的‘Vibe Research’到AI主导系统的光谱,并提出了五个评估科学可信度的维度。