BatteryLake: 代理化、物理驱动的异构电池老化数据策展与基准测试
摘要
本文介绍了BatteryLake,一个治理型数据湖仓,它利用LLM智能体进行基于证据的元数据提取和模式映射,并采用人工在环验证,以策展异构电池老化数据集并发布开放基准测试。
arXiv:2607.09762v1 公告类型:新
摘要:公共电池老化数据集是高级健康管理的关键资产,但其实际应用常受限于不一致的格式、不清晰的模式以及分散在存储库和出版物中的元数据。当前策展主要依靠人工,难以复现,而通用数据集成工具缺乏电化学时间序列数据的领域特定语义。我们提出了BatteryLake,一个治理型数据湖仓,通过一个代理化、物理驱动的策展框架将原始公共电池数据转化为基准就绪资产,主要有三项贡献。第一,LLM智能体提取元数据并合成数据集特定转换器,将每个输出锚定在逐字证据上,并在没有证据支持时弃权。第二,一种人工在环机制将验证框定为选择性预测,并通过26个模式、统计和物理合理性规则筛选准入数据。第三,我们发布了一个包含来自超过25个机构的41个数据集的开放基准测试,包含标准化的SOH和RUL任务、三种划分协议和八个基线模型族。该平台、基准和策展协议公开于 https://tianwen1209.github.io/batterylake/。
查看缓存全文
缓存时间: 2026/07/14 04:17
# BatteryLake:基于智能体与物理约束的异构电池老化数据策管与基准测试
来源:https://arxiv.org/html/2607.09762
Tianwen Zhu, Hao Wang, and Yonggang Wen(作者单位:南洋理工大学计算与数据科学学院,新加坡,邮箱:{tianwen001, hao-wang, ygwen}@ntu.edu.sg)
###### 摘要
公开的电池老化数据集是先进健康管理的重要资产。然而,其实际应用常受限于不一致的文件格式、模糊的数据模式,以及分散在存储库和出版物中的元数据。当前的策管实践主要依赖人工且针对特定数据集,难以复现。同时,通用数据集成工具往往无法捕捉电化学时间序列数据的领域特定语义。本文提出 BatteryLake,一个受治理的数据湖仓,通过基于智能体和证据驱动的策管框架,将原始公共电池数据转化为可用于基准测试的资源。我们在公共电池数据集自动化策管方面做出三项主要贡献。第一项能力将证据驱动的元数据提取(含明确弃权)与模式映射及针对数据集的转换器程序合成相结合。这两项任务均由大语言模型代理处理。每个代理的输出必须基于逐字源证据。若无法获取此类证据,代理将选择弃权而非生成无依据的结果。第二,我们设计了一种人机协同的验证机制,将字段提取视为选择性预测问题,将低置信度的提取交由人工审查。低置信度字段被路由给领域专家,而高置信度字段仅在残差错误率低于预设阈值时才被接受。通过验证的数据必须通过一个包含 26 条规则的验证门,涵盖模式一致性、统计有效性和物理合理性。第三,在策管后的数据湖之上,我们发布了一个开放基准测试,涵盖来自 25 多个机构的 41 个策管数据集,覆盖多种化学体系(圆柱形、软包和方形电芯),以及循环老化、行驶循环、阻抗、日历老化和热滥用等测试机制,并提供标准化的健康状态和剩余寿命任务、三种数据划分协议以及八个基线模型家族。该平台、基准测试及策管协议均已开源,访问地址为:https://tianwen1209.github.io/batterylake/。
###### 索引术语:
数据策管,数据湖,大语言模型,人机协同,基准测试,电池健康管理。
## 1 引言
锂离子电池现已广泛应用于电动汽车、电网级储能和便携式电子设备中,在这些应用场景下,其容量和安全裕度会随着电池老化而下降。电池容量衰减的速度及其与寿命终点之间的距离,决定了何时应退役、仍能提供多少续航或备用容量,以及是否可重复使用或必须更换。这些量难以通过基本原理获得,因为老化过程耦合了化学体系、温度、负载和使用历史,且没有紧凑的物理模型能够涵盖所有电芯类型和运行条件下的这些效应。因此,老化行为越来越多地通过机器学习从大规模循环实验数据中学习 [1, 2]。过去二十年间,世界各地的实验室发布了数十个老化数据集,从 NASA 卓越预测中心 [3] 和 CALCE [4] 到 Severson 等人进行的 124 电芯快充研究 [1],总共包含数百万个充放电循环。原则上,这些数据足以支持健康状态估计、剩余寿命预测以及跨工况泛化研究。然而在实践中,其大规模应用仍受限于策管不善:对开放电池数据的调查显示存在存储库碎片化、文件格式不一致以及文档不完整等问题 [6]。
障碍不在于数据量,而在于数据工程。三个结构性问题反复出现。(i)格式和模式异构性。原始发布的数据以多种文件格式呈现:CSV、Excel、MATLAB .mat、HDF5、JSON、Parquet 以及专有的循环测试仪导出格式(Arbin、MACCOR、Neware)。在这些文件中,相同的物理测量指标出现数十个别名(Voltage、Ecell/V、V),单位不一致(Current_mA 与安培;开尔文与摄氏度),并且充电和放电电流的符号约定相互冲突。(ii)元数据分散。定义实验的事实信息,如电芯化学体系、标称容量、循环协议、温度、截止电压和软件许可,很少存储在数据文件本身。这些信息通常分散在存储库登陆页面、README 文件以及相关论文的正文中,需要人工查找提取。(iii)基准测试不可复现。不同的研究使用不同的解析例程、循环分段方法、标签定义和训练/测试划分。因此,发表的模型比较难以复现,且很少能直接对比,这在电池机器学习文献中已有记载 [7]。
传统的电池数据集成仅能提供部分缓解。Cupid [10] 等模式匹配工具基于关系元数据运行,无法利用能够区分电池信号的物理语义(取值范围、单位、单调退化);数据验证系统 [19] 检查约束但不生成映射;数据湖管理 [17] 假设输入的数据来源已知。最近的研究表明,大语言模型可以在极少监督下执行数据整理和提取任务 [13, 14],但将大语言模型朴素地用于科学策管会引入一种比数据缺失更严重的故障模式:对元数据的看似合理的捏造(例如,根据数据集名称猜测化学体系),这会悄然破坏所有下游分析。
我们认为,大规模科学数据的可信策管需要将 LLM 代理的灵活性与三项保障措施相结合,而这些措施在先前的 LLM 数据整理工作中基本缺失:(1)基于证据的显式弃权:每个提取的数据必须由逐字源文本证明,无支持的字段标记为“未说明”而非推断得出;(2)人工验证:基于字段的置信度分数将不确定的决定路由给人类专家,使审查过程超越全有或全无的人工检查。通过调整置信度阈值,系统可以在自动覆盖率和已接受字段的残差错误风险之间进行权衡;(3)可执行验证:代理合成的转换器只有在其输出通过一个结合了模式、统计和电池特定物理合理性约束的可机器检查的门控时才会被接受。
我们将这些原则具体实现在 BatteryLake 中,这是一个受治理的湖仓和针对电池老化数据的公共基准测试。本文做出以下贡献:
- • **问题形式化**。我们将电池数据集接入正式化为:(a)基于证据的结构化提取(含弃权),从多源文档中提取;(b)模式映射与转换器程序合成;并将人工审查视为具有显式风险-覆盖目标的贝叶风险决策问题。
- • **基于智能体的策管框架**。我们设计了一个两阶段的、基于来源排名的提取算法,用于处理数据集登陆页面和伴随论文;一个文件角色分类器和生成-验证-修复循环,用于转换器合成;以及一个包含 26 条规则的验证门,涵盖四个质量维度(包括物理合理性)。
- • **受治理的湖仓与开放基准测试**。我们定义了一个四层规范数据模型,包含类型化单位和完整性约束,并发布了一个包含来自 25 个机构的 41 个策管数据集的基准测试,提供标准化的 SOH/RUL 任务、三种划分协议、八个基线家族和版本化的可复现性清单。
尽管 BatteryLake 是为电池领域实例化的,但该框架包含基于证据的提取、选择性验证和物理验证的程序合成。我们设计 BatteryLake 旨在解决科学数据工程中的一个普遍模式:将长尾的、小规模的、异质的、文档不足的数据集转化为受治理的、可分析使用的集合。
## 2 相关工作
**用于数据集成和提取的 LLM**。基础模型最近被探索用于数据集成和准备任务。先前的工作表明,它们能够在几乎没有标注样本的情况下执行实体匹配、错误检测和插补 [13]。其他研究使用它们为半结构化语料库合成提取代码 [14],并在指令微调下统一多种数据准备任务 [15]。在 LLM 之前,神经匹配器如 Ditto [11] 和统一匹配模型如 Unicorn [12] 已经证明了预训练语言模型可以跨集成任务迁移。首先,我们针对**科学**元数据,其真实值稀疏且分散在网页和论文中。对于此类数据,我们将弃权和逐字证据作为一等输出,而不是像先前的数据整理系统中那样作为事后校准。我们的转换器合成与智能体工具使用 [16] 相关,但增加了领域特定的可执行验证器作为接受测试。
**数据湖、验证和治理**。数据湖管理研究涉及对读时模式(schema-on-read)集合的摄入、发现和版本控制 [17];湖仓系统如 Delta Lake 在开放格式上添加 ACID 保证 [18];声明式验证系统在大规模下验证数据质量约束 [19];约束驱动的修复引擎如 HoloClean [20] 则清理数据仓库内部的数据。BatteryLake 对这一方向进行了补充:它治理湖仓的**边界**,使用智能体编写验证系统所预设的映射和元数据,并将通用约束扩展为电化学合理性规则(电压范围、库仑效率范围、容量单调性)。
**电池数据基础设施与基准测试**。电池社区已产生开放数据集 [3, 4, 1, 5]、对其碎片化的调查 [6]、处理工具包(如用于循环测试仪文件特征化的 BEEP [8])、用于语义互操作性的本体 [9] 以及基准测试库(如 BatteryML [7])。这些努力要么手动策管一组固定的数据集,要么为新数据前瞻性地标准化格式。据我们所知,BatteryLake 是第一个自动化**回溯性**接入已发布电池数据集长尾(并附带可审计来源)的系统,也是第一个为每个接纳的数据集附带可机器检查的策管证据的电池基准测试,使集合符合 FAIR 原则 [24]。
## 3 问题形式化
我们首先定义策管的规范目标(§3.1),然后定义两个接入问题(§3.2、§3.3),以及选择性验证的目标(§3.4)。
### 3.1 规范数据模型
BatteryLake 将每个策管数据集组织为一个四层关系对象 D = (Md, Mc, S, T):
- • **数据集元数据** Md:每个数据集一个元组,属性集 Fd = {化学体系, 正极材料, 负极材料, 标称容量_Ah, 标称电压_V, 温度_C, 充电协议, 放电协议, C_rate, 高截止电压, 低截止电压, 外形因子, 品牌或制造商, 来源网址, 论文网址, 许可证, ...};
- • **电芯元数据** Mc:每个电芯一个元组,键为 (dataset_id, cell_id);
- • **循环摘要** S:每个 (电芯, 循环) 一个元组,包含容量、库仑效率和能量效率、SOH、RUL、持续时间、电压/温度统计以及质量标志;
- • **时间序列** T:每个采样点一个元组,包含规范信号:time_s、voltage_V、current_A、temperature_C、charge/discharge_capacity_Ah、step_type,采用固定单位及充电时 I>0 的符号约定。
每个属性 a 带有类型 τ(a)、单位 u(a) 和域 dom(a)(例如,dom(voltage_V) ⊆ [0,6] V 适用于单电芯)。各层通过外键 T → S → Mc → Md 连接,一组约束 Σ(|Σ|=26 条规则)管理数据接纳(第 4.3 节)。每个数据集还会获得一个机器可读的引用名称 ref_name = YYYY_SOURCE_CHEM_FORM_CHRGC_DCHRGC_TEMP,编码其身份,用于跨数据集过滤。
### 3.2 基于证据的提取与弃权
设 F ⊆ Fd 为目标元数据字段,E = {E1, ..., Ek} 为一个有序的证据文档集,具有来源排名(例如,E1 为数据集登陆页面,E2 为伴随论文)。一个基于证据的提取器是一个函数:
Φ(F, E) = {(f, v_f, e_f, s_f, c_f)}_{f ∈ F}, (1)
其中 v_f ∈ dom(f) ∪ {⊥} 是提取值或弃权符号 ⊥(呈现为“源页面未说明”),e_f 是从某个 Ei 中提取的逐字证据片段,s_f = i 记录来源,c_f ∈ [0,1] 是置信度分数。输出必须满足**基于证据的约束**:如果 v_f ≠ ⊥,则 e_f 必须出现在 E_{s_f} 中并蕴含 v_f。给定一个黄金标注 v_f^*(当没有来源说明该字段时,其自身可能为 ⊥),我们区分四种结果:正确提取 (v_f = v_f^* ≠ ⊥)、错误提取、正确弃权 (v_f = v_f^* = ⊥),以及**幻觉** (v_f ≠ ⊥ 而 v_f^* = ⊥相似文章
MagBridge-Battery:用于锂离子电池磁测量与健康状态诊断的合成桥梁数据集
本文介绍MagBridge-Battery,这是一个包含6,760个磁场信号的合成数据集,用于锂离子电池健康状态诊断,结合真实磁形态学与真实退化标签,以弥合公开磁感应电池数据方面的空白。
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
IonSense-QKG:面向锂离子电池数据集发现的量子就绪元数据框架
本文介绍了IonSense-QKG,这是一个元数据框架,通过添加量子就绪字段和加权量子就绪分数来丰富公开的锂离子电池数据集,以便对数据集进行排序,用于近期的混合量子-经典机器学习。
BatteryMFormer:多层级学习用于电池退化轨迹预测
本文提出了BatteryMFormer,一种用于早期电池退化轨迹预测的多层级Transformer,它集成了老化条件感知解码、元退化模式记忆和双视角编码,以捕捉多层级退化结构和SOC局部变化,在四个电池领域上持续优于最先进的基线方法。
你的智能体也在老化:部署系统中的智能体生命周期工程
本文介绍了AgingBench,一个衡量已部署AI智能体因记忆状态变化、交互历史和生命周期事件而随时间退化的基准。它将老化分为四种机制,并提供诊断工具进行针对性修复。