用于多相输运和热系统数据驱动建模的开放多模态数据集与开源软件

arXiv cs.LG 论文

摘要

本文介绍了用于可复现的AI驱动热流体研究的开放多模态数据集和开源软件包,提出了时空维度框架及SeqReg等序列回归工具。

arXiv:2605.23037v1 公告类型:新论文 摘要:数据驱动建模正成为多相输运、电子散热、声学诊断和热流体数字孪生的核心方法,但碎片化的数据集和难以解码、复用或基准测试的原始仪器文件限制了进展。本文介绍了由纳米能源与数据驱动发现(NED3)实验室开发的开放多模态数据集和开源软件包生态系统,旨在支持可复现的AI驱动热流体研究。我们提出了一个空间加时间维度框架(记为S+TD),根据测量或模拟场的维度对数据集进行分类,包括0+0D点值、0+1D时间序列、1+0D剖面、2+0D图像、2+1D视频、3+0D体积场以及多模态组合。我们整理了公开的NED3数据集,涵盖沸腾图像、声学和热测量数据、高速视频、红外热成像、热阻测量数据、CFD生成场、设计文件以及声发射数据。我们还介绍了配套的软件包,包括BubbleID、SeqReg、CFDTwin、IRISApp、decode-wfs、AELab和FlowLab,这些软件支持计算机视觉、序列回归、代理建模、红外分析、波形解码、声发射分析和多模态诊断。特别强调了SeqReg,这是一个用于0+1D、1+1D和2+1D数据的通用序列回归库,其应用包括非侵入式热通量估计。最后,我们讨论了未来社区在构建可互操作的热流体数据库以及策划连接数据集、元数据、解码器、基线、基准和物理可解释模型的AI/ML工具库方面的努力。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:59

# 面向多相传热输运系统数据驱动建模的开放多模态数据集与开源软件  
来源:https://arxiv.org/html/2605.23037  
Christy Dunlap, Hari Pandey, Stephen Pierson, Daniel Curl, Braden Stevens, Mohammad Ishraq Hossain, Annapurna Parjuli, Chinmaya Joshi, 和 Han Hu  
Department of Mechanical Engineering, University of Arkansas, Fayetteville, AR 72701, USA  
通讯作者:Han Hu, hanhu@uark\.edu  
草稿日期:2026年5月21日  

###### 摘要  
数据驱动建模正成为多相输运、电子冷却、声学诊断和热流体数字孪生的核心驱动力,但进展受限于碎片化的数据集以及难以解码、复用或基准测试的原始仪器文件。本文介绍了一个由多模态数据集和开源软件包组成的开放生态系统,用于可重复的、AI驱动的热流体研究。我们提出了一种“空间+时间维度”框架(记为S+TD),用于按测量或模拟场的维度对数据集进行分类,包括0+0D点值、0+1D时间序列、1+0D剖面、2+0D图像、2+1D视频、3+0D体场以及多模态组合。我们整理了公开的NED3数据集,涵盖沸腾图像、声学和热测量、高速视频、红外热成像、热阻测量、CFD生成场、设计文件和声发射数据。同时,我们介绍了配套的软件包,包括BubbleID、SeqReg、CFDTwin、IRISApp、decode-wfs、AELab和FlowLab,它们支持计算机视觉、序列回归、代理建模、红外分析、波形解码、声发射分析和多模态诊断。其中特别重点介绍SeqReg,这是一个通用的序列回归库,适用于0+1D、1+1D和2+1D数据,应用场景包括非侵入式热通量估计。最后,我们讨论了未来社区建立可互操作的热流体数据库及精选AI/ML工具库的努力方向,以连接数据集、元数据、解码器、基线、基准测试和物理可解释模型。  

关键词:开源数据集;多模态传感;序列回归;多相输运;沸腾传热;时空数据  

## 1 引言  
热流体系统越来越多地运行在瞬态、多尺度、多物理行为主导性能的工况下。沸腾传热、冷凝、电子冷却、流动沸腾、介电流体浸没冷却、电气化系统中的局部放电以及数据中心热管理都涉及耦合的输运过程,这些过程在宽广的长度和时间尺度上演化。在许多此类系统中,最具工程兴趣的量——如局部热通量、界面动力学、临界热通量前兆、两相流态、热阻和冷却系统可靠性——无法从单一标量测量中推断出来。它们需要温度、压力、声学、光学、红外、几何和仿真衍生信息的组合。  

数据驱动方法提供了一条从这些异构测量中提取有用结构信息的途径。计算机视觉可以将高速沸腾图像转换为气泡统计、界面轮廓、脱离频率和汽相区域描述符。声学和声发射测量可以提供气泡成核、脱离、流型转变、沸腾迟滞或局部放电的非侵入式特征。红外热成像可以揭示空间分辨的温度场和热梯度。CFD和降阶仿真数据集可以支持代理模型和数字孪生,用于快速设计探索。当传统点传感器无法解析局部瞬态物理过程,或侵入式诊断会干扰被测过程时,这些能力尤为宝贵。  

实际障碍在于,现代热流体实验很少产生单一的干净表格。相反,一次实验可能生成高速视频、热电偶历史、热通量估计、麦克风录音、水听器波形、声发射事件、红外相机文件、压力历史、CAD文件、表面图像,以及描述几何、流体、操作条件、采样率、传感器位置和同步信息的元数据。这些信号通常使用不同的原生格式、不同的时钟、不同的数据速率和不同的处理层级。有些存储在供应商特定的格式中,需要专有软件才能开始分析。因此,许多潜在有用的数据集在不同实验室之间仍然难以复现、基准测试或整合。  

开放数据集和开源软件共同解决了这一障碍。没有处理工具的数据集可能技术上是公开的,但实际对许多用户不可访问。没有公开可用基准数据的软件包可能难以验证、比较或用于教学。因此,NED3实验室将开放数据集和开源包视为耦合的研究基础设施。该实验室的软件页面描述了用于数据采集、整理、分析以及设备或系统设计的包,通过GitHub发布,部分包也通过PyPI发布[1 (https://arxiv.org/html/2605.23037#bib.bib1)]。该实验室的数据集页面总结了托管在外部存档平台(如Dryad、Dataverse、OSF和MultiphaseHub[2 (https://arxiv.org/html/2605.23037#bib.bib2)])上的开放数据集。这种配对发布模式旨在使数据不仅可见,而且可用。  

本文有五个目标。首先,引入一个紧凑的S+TD框架,用于按空间和时间维度对热流体数据集进行分类。其次,回顾了在红外测温、光学成像、声学传感和仿真驱动基准测试方面的新兴两相AI模型与数据集文献。第三,利用S+TD框架整理现有的NED3开放数据集,使用户能够快速识别适用于时间序列回归、计算机视觉、视频分析、红外热成像、CFD代理建模、声学诊断或多模态融合的数据集。第四,描述由纳米能源与数据驱动发现(NED3)实验室组织的开源软件生态系统,并专辟一节讨论SeqReg,因为该包目前支持多种序列回归工作流,但尚未有独立的软件论文。第五,呼吁更广泛的社区努力建立开放的热流体数据库和精选的AI/ML工具库,使可复现的数据驱动研究对领域专家和新用户都更加容易。  

请参见图标题  
图1:两相输运过程及相关研究主题。  

## 2 热流体数据的空间加时间维度  
热流体数据集可以按测量、仿真或衍生量的维度进行组织。我们将此结构记为S+TD,其中S是空间维度数,T是时间维度数。这种简洁的记法从分析和机器学习角度描述数据对象的形状,而非底层物理的全维度。例如,沸腾实验中的热电偶测量是一个0+1D信号,尽管加热器周围的温度场是空间分布的。同一实验的高速视频是2+1D,因为每一帧解析两个空间维度,序列随时间演化。稳态CFD温度场可能是3+0D,而瞬态CFD计算可能是3+1D。这种记法有助于阐明为什么多模态热流体学习问题很困难。不同的模态占据不同的S+TD类别,具有不同的采样率,需要不同的预处理方法。水听器波形可能以数百千赫或更高频率采样,而热通量标签可能以低得多的速率计算。高速相机可能以每秒数百或数千帧产生2+1D光学数据,而红外热成像可能产生较低速率但空间分辨的温度场。CFD数据集可能提供密集的3+0D或3+1D场,但仅限于有限的几何和边界条件集合。组合这些模态需要对同步、重采样、特征提取、不确定性和训练-测试分割做出选择。  

S+TD框架还为连接数据集与AI/ML工具提供了一个中性词汇。对于0+0D元数据或小型表格数据集,经典回归模型通常就足够了。序列模型和谱特征自然适用于0+1D时间序列。卷积神经网络、分割模型和视觉变换器可应用于2+0D图像。循环、时间卷积、变换器或帧序列模型可应用于2+1D视频。降阶模型、自编码器、图神经网络、神经算子和物理信息代理可能适用于3+0D或3+1D场,具体取决于几何和支配物理。因此,该记法既支持数据发现,也支持模型选择。  

请参见图标题  
图2:涵盖分子、界面、组件和系统尺度的热输运过程的多尺度特性。  

### 2.1 S+TD 分类法  
表1总结了与开放热流体数据集相关的代表性S+TD类别。示例从数据分析的角度而非仅从仪器仪表的角度撰写。  

表1:热流体数据集的S+TD分类法。  

| 类别 | 数据对象 | 热流体示例 | 常见AI/ML任务 | 复用注意事项 |
|------|----------|------------|---------------|--------------|
| 0+0D | 静态标量或类别值 | 流体类型、表面粗糙度、稳态平均热通量、额定功率、几何标签 | 表格回归、分类、元数据过滤 | 适合作为元数据或标签;单独不足以描述瞬态多相物理。 |
| 0+1D | 点时间序列 | 热电偶历史、压力信号、水听器波形、AE事件序列、加热器功率 | 序列回归、事件检测、谱分析、异常检测 | 需要采样率、滤波、传感器位置、校准和同步信息。 |
| 1+0D | 静态剖面 | 线扫描温度剖面、通道中心线速度剖面、径向热通量剖面 | 剖面回归、插值、降阶描述符 | 需要坐标定义、空间分辨率和边界条件上下文。 |
| 1+1D | 时间演化剖面 | 温度随时间的剖面、线扫描蒸汽界面、通道压力随时间的分布 | 序列到序列预测、时间剖面重构 | 在点信号与全场之间提供有用的桥梁。 |
| 2+0D | 静态图像或2D场 | 沸腾图像、IR热像图、显微图、表面图、2D仿真切片 | 分割、分类、目标检测、图像回归 | 需要视场、比例、光照/发射率、相机模型和标注定义。 |
| 2+1D | 视频或时间演化2D场 | 高速沸腾视频、IR视频、时间分辨2D CFD切片 | 视频回归、事件预测、光流分析、多模态融合 | 需要帧率、曝光、同步以及避免跨实验泄露的训练-测试分割设计。 |
| 3+0D | 静态体积或3D场 | 全息重建、3D CFD温度/速度场、3D表面扫描 | 代理建模、降阶建模、几何感知学习 | 需要网格/体素表示、坐标系、边界条件和验证状态。 |
| 3+1D | 时间演化体积 | 瞬态CFD场、体积成像序列、3D数字孪生状态历史 | 神经算子、时空代理、状态估计、控制 | 数据大小和泛化风险高;元数据和压缩变得关键。 |
| 混合S+T | 同步多模态记录 | 光学视频+声学波形+热通量标签;IR场+热电偶+功率 | 传感器融合、多模态表征学习、跨模态预测 | 需要显式时钟对齐、缺失数据规则和模态特定不确定性。 |

请参见图标题  
图3:代表性多维静态和瞬态“S+TD”热流体数据集。  

## 3 两相热流体系统的AI模型与数据集  
AI赋能的两相传热研究沿着三条部分重叠的诊断路径发展:红外测温、光学成像和声学传感。这些路径不仅在仪器仪表上不同,而且在模型能观察到什么方面也不同。红外测温测量液固接触、干涸和传热不均匀性的热足迹。光学成像解析气泡、蒸汽结构、界面和流型。声学和声发射传感捕获压力波、溃灭事件、固体传播的应力波以及其他在光学通道受限时仍可获得的信号。Suh等人的一篇近期综述将AI在液-汽相变传热中的应用围绕数据提取、数据流分析、以物理为中心的机器学习、可持续网络基础设施以及热科学和计算机科学之间的多学科联系展开[3 (https://arxiv.org/html/2605.23037#bib.bib3)]。现有文献表明,每条路径都能支持有用的AI模型,但也说明了为什么该领域需要开放的多模态数据库——因为每种模态只捕捉了耦合相变过程的一个投影。  

### 3.1 红外测温与AI辅助的沸腾危机分析  
高速红外测温已成为沸腾和临界热通量研究中最强大的诊断路径之一,因为它能提供加热表面空间分辨的热信息。Ravichandran和Bucci使用前馈人工神经网络直接从高速红外辐射推断气泡生长时间、气泡周期和成核点密度,实现了准实时输出,回归系数相对于传统图像处理测量达到0.95或更高[4 (https://arxiv.org/html/2605.23037#bib.bib4)]。这项工作展示了热流体AI中的一个重复出现的主题:机器学习可以作为快速诊断层,将原始S+TD测量流转换为有物理意义的描述符。在后续的数据驱动沸腾危机研究中,Ravichandran等人开发了一个神经网络模型,该模型根据覆盖不同形貌和润湿性表面的高分辨率红外气泡动力学测量来预测与沸腾危机之间的裕度[5 (https://arxiv.org/html/2605.23037#bib.bib5)]。这项工作的公开描述强调,红外测量是在透明加热器下方以高帧率获取的,并利用机器学习识别了沸腾危机预测中具有物理意义的贡献因素,包括气泡数量、气泡大小以及生长/脱离时间特征[6 (https://arxiv.org/html/2605.23037#bib.bib6)]。这种以红外为中心的方向很重要,因为它将AI与机制性的沸腾理论联系起来,而不是将模型本身视为最终目标。Zhang等人利用高分辨率测量和类似逾渗的气泡足迹行为提出了一个统一的沸腾危机准则[7 (https://arxiv.org/html/2605.23037#bib.bib7)]。这项工作展示了AI辅助红外管道可以帮助大规模提取的定量表面状态信息。相关工作在自主干涸区域检测方面也使用了深度学习和红外测温来识别沸腾表面的干燥区域,强调了当诊断生成的数据量超过人工检查能力时进行在线分析的必要性[8 (https://arxiv.org/html/2605.23037#bib.bib8)]。

相似文章

利用主动学习构建集成热能系统的基于物理的数字孪生

arXiv cs.LG

本文提出了一种主动学习框架,将高保真 Modelica 仿真与更简单的代理模型(SINDyC、FNN、GRU)相结合,以创建高效的热能分配系统数字孪生。该方法在保持预测精度和实现不确定性量化的同时,显著减少了所需的仿真轨迹数量。