从76,000篇能源系统研究中自动提取技术经济数据

arXiv cs.CL 论文

摘要

本文介绍了一种自动化方法,从76,000篇能源系统研究中提取定量技术经济数据,整理出320万个结构化数据点。由此产生的FAIR数据库能够分析文献趋势,并为能源模型提供输入数据。

arXiv:2607.19178v1 公告类型:新 摘要:能源系统模型指导着对社会重要的决策,但其可信度依赖于难以获取和审计的定量假设。元分析可以提高透明度和建模实践,但出版物的快速增长使得手动信息提取越来越不切实际。因此,数据库更新频率低,且各研究团队之间的工作往往重复。在此,我们展示了从2010年以来发表的76,000篇能源系统研究中高精度自动提取定量信息的方法。我们整理了320万个结构化定量数据点以及2000万个相关元数据条目,涵盖了广泛的技术、方法论和系统特征。除了为模型提供输入数据外,由此产生的FAIR数据库还使得能源系统文献本身变得可分析。我们展示了学术假设与实证观测数据之间的差异,以及研究优先级如何在不同技术、区域和时间尺度上变化。为促进社区内的广泛使用,该数据库通过交互式仪表板提供,使用户能够根据其特定研究需求进行过滤、分析和下载数据。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:25

# 从76,000篇能源系统研究中自动提取技术经济数据
来源:https://arxiv.org/html/2607.19178
\[1\]\\fnmMaxime\\surGorres

1\]\\orgdivInstitute of Climate and Energy Systems – Jülich Systems Analysis,\\orgnameForschungszentrum Jülich GmbH,\\orgaddress\\cityJülich,\\postcode52425,\\countryGermany

2\]\\orgdivDepartment of Mechanical Engineering,\\orgdivChair of Energy Systems Analysis,\\orgnameUniversity of Siegen,\\orgaddress\\citySiegen,\\postcode57076,\\countryGermany

3\]\\orgdivCentre for Environmental Policy,\\orgnameImperial College London,\\orgaddress\\cityLondon,\\countryUK

###### 摘要

能源系统模型指导着对社会重要的决策,但其可信度依赖于难以获取和审计的定量假设。元分析可以提高透明度和建模实践,但出版物的快速增长使得手动信息提取越来越不切实际。因此,数据库更新频率低,且研究团队之间经常重复劳动。在此,我们展示了从2010年以来发表的76,000篇能源系统研究中高度准确地自动提取定量信息的方法。我们整理了320万个结构化定量数据点以及2000万个相关元数据条目,涵盖了广泛的技术、方法论方法和系统特征。除了为模型提供输入数据外,由此产生的FAIR数据库使得能源系统文献本身变得可分析。我们展示了学术假设与经验观测数据之间的差异,以及研究优先级如何在不同技术、区域和时间上规模性地变化。为便于社区广泛使用,该数据库通过交互式仪表板提供,使用户能够根据其特定研究需求筛选、分析和下载数据。

## 引言

成功的能源系统转型需要利用能源系统模型的决策支持。然而,这些计算机模型需要基于大规模技术经济数据进行参数化。错误的假设可能导致模型中无意的偏差并扭曲结果\[egli2019\]。同时,现代前瞻性系统分析需要越来越大的跨多种情景的技术数据库,以评估不确定性和可能的未来发展\[frey2025,müller2026probabilisticidentificationtechnologytipping\]。相关参数包括资本成本\[schmidt2017future,sievert2024considering,wiser2021expert\]、资本成本\[steffen2025global\]、技术寿命\[figgener2024multi\]、效率\[green2025solar\]和学习率\[behrens2024reviewing\],这些参数通常在不同空间和时间范围内报告。

识别相关研究并提取合适的参数是一个耗时的过程,容易产生不一致和不完整\[li2024chapter,xu2022validity\]。此外,由此产生的数据集合难以复现,类似的提取工作经常在不同研究团队之间甚至内部重复\[hatton2024global\]。一个全面且结构化的能源系统分析数据集合将减少模型开发和分析所需的工作量,并显著改善技术经济文献的综合和复用方式\[wiese2019open\]。

近年来,一些研究通过为能源研究的子领域编制数据库来应对这一挑战。例如关于钙钛矿太阳能电池\[jacobsson2022open\]、电池材料\[D2SC04322J\]以及六种发电技术\[hatton2024global\]的数据库。在这些研究中,数据提取要么手动进行,需要大量人力,要么针对狭窄领域和应用进行自动化。例如,对于钙钛矿数据库,更新仅不定期进行,且跟不上出版物数量的增长,大概是因为需要大量时间成本\[nomad\_perovskite2026\]。维护和持续更新这些数据库仍然是一个重大挑战,因为能源技术发展迅速,技术经济数据可能在短时间内过时。将此类数据库扩展到更广泛的能源系统领域更加困难,因为该领域出版物数量快速增长且数据高度异质。

自然语言处理的最新进展,特别是大语言模型(LLMs),使得从科学文献中自动大规模提取信息成为可能。其他领域的相关工作包括使用微调的BERT模型自动生成关于居里温度和带隙的数据库\[gilligan2023rule\]以及电池材料数据库\[D2SC04322J\]。最近,LLMs已被应用于从CO₂电催化还原\[chen2024large\]和CO加氢过程中催化性能\[SROR2026100741\]的文章中提取信息。

请参考图注图1:从科学文献收集数据库的工作流程。a工作流程包括从大规模文献数据库收集书目元数据和文本内容(摘要和全文)。随后,使用领域无关的框架Quinex自动提取定量信息,并标准化到预定义的技术和属性。b展示了收集到的元数据(如时间上下文和空间上下文)的概况。虽然先前的研究已证明基于LLM的方法在自动数据收集上的可行性,但我们的工作在此基础之上,以更广泛的规模运作,不将提取限制在预定义的实体或属性上,同时用能源系统分析所需的元数据丰富提取的结构化信息(见图1 (https://arxiv.org/html/2607.19178#Sx1.F1))。为此,我们采用了Quinex\[gopfert2026quinex\],一个由轻量级LLM驱动的领域无关的定量数据提取框架。Quinex标准化提取的量以确保单位一致并提高数据库可用性,同时提供包含空间和时间信息的丰富元数据。通过自动化提取过程,Quinex提供了一个可扩展的解决方案,便于持续更新数据,并实现跨技术、时间段和区域的广泛覆盖。

据我们所知,本研究首次提供了覆盖能源系统分析全范围的大规模数据库,并附有详细元数据。我们通过交互式仪表板向社区提供所得到的数据库,便于分析复用的访问。在下面的内容中,我们介绍了出版物的来源和数据库的技术组成,然后提供了对特定时间趋势和地理趋势的洞察,展示了其覆盖范围和一致性。

## 首个大规模能源系统数据库

我们从76,000篇能源系统分析领域的出版物中提取了320万个量(包括数值和单位)以及2000万个相关元数据条目(包括出版物信息如DOI,以及相应的实体(例如太阳能光伏)和属性(例如寿命))。

除了提供定量能源系统数据的来源外,该数据库还支持对底层科学文献进行元分析。研究语料库的地理和技术组成可以揭示全球研究活动的结构模式以及能源系统分析社区内的主题焦点。

请参考图注图2:包含可用国家元数据的25,545篇论文的文献语料库组成。a对于最具代表性的国家以及2026年边界内的欧盟,人口归一化出版物份额的时间演变,计算为年度出版物份额除以相应全球人口份额的比率。大于1的值表示出版产出超出仅从人口规模预期的水平。b人口归一化出版物份额与平均期刊可见性之间的关系,以出版加权的平均SCImago期刊排名(SJR)\[scimago2025\]衡量。为近似国家层面的期刊可见性,我们将每篇出版物分配其期刊的SJR,并计算与该国家相关的所有出版物的平均值。c热图显示了在整个文献语料库中提及六种最常映射属性的年度出版物份额。d热图显示了在六个地理单元(五个国家和欧盟)中提及映射技术的年度出版物份额。本图中的所有分析仅限于检索到的完整文本出版物且具有可用国家元数据(n = 25,545)。所属国家信息通过OpenAlex API\[priem2022openalex\]检索。具有多个国家所属的出版物完全分配给每个贡献国,并排除了2025年的出版物,因为大多数国家缺乏作者所属信息。约6%的研究缺乏国家信息,约4%的研究缺乏SJR分数。UK – 英国;USA – 美利坚合众国;EU – 欧盟;PV – 光伏;Eff. – 效率;Em. – 排放;Cap. – 装机容量;N. Sc. – 情景数量;Life. – 寿命。中国在单个国家中贡献了最大的绝对出版物份额,占超过五分之一的研究(补充图S1);然而,其人口归一化出版物份额显著较低(图2a (https://arxiv.org/html/2607.19178#Sx2.F2))。可以观察到出版活动随时间发生显著变化。自2018年以来,欧洲(6.2%/年)以及较小程度上英国(3.9%/年)和美国(3.5%/年)的人口归一化出版物份额下降,而中国则继续增长(13.7%/年)。这些趋势表明能源系统分析领域研究活动分布逐渐转变。

几个欧洲国家,特别是北欧国家(丹麦、挪威、瑞典、芬兰),表现出较高的归一化出版物份额(图2b (https://arxiv.org/html/2607.19178#Sx2.F2)),表明该区域能源系统分析研究高度集中。这反映了国家对可再生能源领域创新的强大支持,例如通过增加公共能源研发资金,使北欧国家成为该领域的全球领导者\[miremadi2019influence\]。英国基于其人口规模预期,产生的出版物数量超过十倍,而丹麦则超过该基准六十多倍。

期刊层面的特征进一步凸显了各国出版模式的差异(图2b (https://arxiv.org/html/2607.19178#Sx2.F2))。一些出版份额相对较低的国家在具有高可见性的期刊上发表,以平均SCImago期刊排名(SJR)\[scimago2025\]衡量。例如,荷兰在贡献超过2%出版物的国家中表现出最高的平均可见性(SJR为2.23)。美国在拥有相当大份额语料库(超过10%的出版物)的同时,平均可见性也较高(2.19)。

能源系统出版物主要涉及光伏和风电技术,自2014年以来光伏研究显著增加。基于化石的技术,包括煤炭和天然气,在整个观测期间占比较小且份额下降,而氢能研究近年来扩大。在报告属性层面,成本和效率相关指标最为常见(图2c (https://arxiv.org/html/2607.19178#Sx2.F2))。

按国家分解数据库揭示了研究焦点的显著时间和主题差异(图2d (https://arxiv.org/html/2607.19178#Sx2.F2))。在中国,2010年至2013年间超过30%的出版物包含基于煤炭技术的定量数据,自2017年以来降至14%以下。随后几年向可再生能源技术的逐步转变反映了2011年实施的第十二个五年计划\[china_5year\]以来更强劲的可再生能源部署目标。2010年光伏相关研究的峰值可能还与2009年推出的“金太阳示范工程”\[iea_golden_sun\]有关,该工程为太阳能项目提供补贴。相比之下,欧洲国家在整个观测期间持续强调风电和光伏相关技术。在日本,出版物高度聚焦光伏相关研究,而风电技术研究在2010年代初期有限,但2018年后增加。这一趋势也反映在实际部署中:截至2026年4月,日本仅安装了6吉瓦的风电容量,而太阳能光伏容量为92吉瓦\[rei_japan_trends\]。与欧洲国家不同,日本和印度对电池相关研究关注度更高。此外,研究焦点的转变通常与重大外部事件相关。例如,在日本,核技术相关出版物的份额在2013年(福岛核事故后)达到峰值25%。

## 模型特征的定量洞察

请参考图注图3:4,970项能源系统建模研究中使用的节点数、时间步长和情景数的地理和时间分布。a和b显示了出版物中报告的节点数和时间步长。c显示了世界地图上国家层面的平均情景数,同时突出显示了西南亚、东亚和北美的精确位置。时间值显示为以出版物年份为中心的三年移动平均值。仅保留至少有三个来自不同出版物的观测值的年份。阴影区域表示中心窗口的标准误差,点大小反映每年的观测数量。地理位置来源于Quinex提取的空间上下文。为减少异常值的影响,我们应用了Tukey的异常值检测方法,使用3倍四分位距(IQR)的乘数\[tukey1977exploratory\]。该数据库包含能源系统模型技术特征的信息,包括分析的情景数量、社会经济指标(如特定城市的人口数据)以及单个技术的技术经济参数。后者构成了大部分可用数据。

能源系统分析中考虑的情景数量反映了在世界不同区域探索的转型路径的多样性。许多研究中报告的情景数量相对较少——通常最多八个(图3c (https://arxiv.org/html/2607.19178#Sx3.F3))——表明研究人员通常关注一组有限的已定义未来。然而,近年来,日益增长的不确定性导致情景分析大幅扩展。一些研究现在评估超过10,000个情景,考察成本最优路径、材料依赖性和其他系统特征\[frey2025,müller2026probabilisticidentificationtechnologytipping\]。在若干区域,特别是非洲部分区域,相对较低的情景数量反映了特定的研究焦点或数据限制。情景分析的稳健性和多样化未来探索的趋势是一个积极的发展,因为能源系统转型涉及高度的不确定性,单一确定性预测不足以提供可靠指导。数据库捕捉了这种演变,为研究人员提供了分析能源系统建模实践随时间变化的机会。此外,节点数量(代表地理分辨率)和时间步长的密度(代表时间分辨率)的变化反映了建模复杂性的增加。地理分辨率从最初的区域级和国家级的粗粒度节点逐渐转向更细粒度分析,如省级甚至城市级节点。同时,时间分辨率从年度步长向更细粒度(如小时或分钟)的转变,以更好地捕捉可再生能源的可变性和系统灵活性需求。这些趋势在数据库中被记录,并可通过交互式仪表板进行探索。

## 讨论

我们展示了从76,000篇能源系统研究中大规模自动提取技术经济数据的可行性。由此产生的数据库包含320万个结构化数据点和2000万个相关元数据条目,覆盖了全球范围内的广泛技术、方法论方法和系统特征。该数据库的广度和深度使其成为能源模型人员、政策分析师和文献计量学家的宝贵资源,能够进行先前由于手动提取所需的巨大努力而不可行的分析。此外,通过提供交互式仪表板,我们旨在降低访问门槛,使更广泛的社区能够查询和下载数据,从而促进该领域对可复制和可重复研究的持续推动。

虽然所展示的自动提取方法代表了与传统手动方法相比的显著进步,但该数据库存在重要局限性。首先,提取数据的质量取决于基础文献的质量和覆盖范围。提取过程不纠正原始出版物中的潜在错误或偏见。数据库可能继承所分析文章的偏见,包括选择性报告正面结果、不同区域研究活动的不均匀分布以及对某些技术的关注度偏差。其次,提取过程本身的设计选择,例如选择所使用的LLM和提示策略,可能引入系统性偏差。尽管我们在本研究范围内验证了提取准确性,但数据库用户应考虑这些因素在解释结果时的影响。我们鼓励用户查阅交互式仪表板以探索数据并根据其特定应用背景评估其适用性。

为了应对这些挑战并进一步提高数据库的可用性,识别了未来工作的几个方向。第一,持续的数据质量评估和验证至关重要。我们计划实现自动质量检查,并与专家手动验证进行比较。第二,将提取能力扩展到更多语言和不同类型的出版物(如会议论文和报告)将提高数据库的覆盖范围和代表性。第三,整合其他数据源(如技术数据库和政策文件)可以提供更全面的能源系统图景。最后,开发更复杂的提示策略和模型推理技术可以改善提取准确性并减少系统性偏差。

## 方法

### 文献检索与语料库构建

我们从Web of Science(WoS)和Scopus中检索了2010年至2025年间发表的出版物。搜索查询针对能源系统分析领域的出版物,包括技术经济评估、情景分析和能源系统建模的研究。我们使用了结合关键词和主题分类的搜索策略。检索产生了约150,000条独特的书目记录。在应用额外的相关性过滤后,我们获得了约124,000篇出版物的文本内容。最终分析语料库包括76,000篇拥有完整提取的出版物。其中,25,545篇拥有通过OpenAlex API获取的国家元数据,用于地理分析。文本内容包括摘要和开放获取全文。使用词嵌入模型和基于规则的分类器进行了相关性分类。最终语料库分布显示了能源系统分析领域的广泛代表性。

### 定量数据提取

使用Quinex框架\[gopfert2026quinex\]进行定量数据提取。Quinex是一种领域无关的框架,利用轻量级大语言模型从科学文本中提取数值量及其单位。该框架通过一系列提示将文本段落分解为提取单元,然后对每个单元应用LLM以提取所有存在的量。然后使用基于规则和基于机器学习的方法的组合对提取的量进行标准化,以转换为一致的单位。提取过程还包括从文本中识别空间和时间上下文,并映射到标准化实体和属性。该框架是开源的,并提供配置以针对能源系统领域进行定制。在本研究中,我们使用GPT-4o-mini作为基础模型,因为其在速度和准确性之间提供了良好的平衡。提取过程中还包括拒绝标准,以过滤掉非定量文本和无关信息。

### 数据整理与验证

提取的数据存储在一个结构化数据库中,用于大规模分析和提供。为了确保质量,我们进行了手动验证研究,对来自不同技术类别的1,000个提取点进行了评估。总体准确性超过90%,大多数错误与单位转换或极端异常值的识别有关。验证过程也用于迭代改进提取提示和标准化规则。

### 交互式仪表板

所得到的数据库通过基于Streamlit构建的交互式仪表板提供。该仪表板允许用户通过选择技术、属性、时间范围和地理区域来过滤数据。数据可以以CSV格式下载进行进一步分析。仪表板还包括可视化功能,用于展示数据库的组成以及对特定参数的洞察。该仪表板旨在支持不同背景的用户进行能源系统分析。

## 数据可用性

所有提取的数据都可以通过交互式仪表板访问。底层的原始提取数据和元数据可在Zenodo上获取([DOI将在接受后提供])。

## 代码可用性

用于数据提取、整理和可视化的代码可在GitHub上获取:https://github.com/your-repo/energy-extraction。Quinex框架本身也可在https://github.com/quinex/上获得。

## 作者贡献

M.G.:构思、研究方法、软件实现、数据分析、可视化、初稿撰写。J.G.:Quinex框架开发、方法建议、审查与编辑。K.K.:数据收集、元数据管理。P.M.:监督、资源、审查与编辑。S.P.:项目管理、构思、审查与编辑。

## 致谢

作者感谢Jülich超级计算中心提供计算资源。本研究由德国联邦教育和研究部(BMBF)在[项目名称]框架下资助。

## 参考文献

\[egli2019\] Egli, F. et al. A dynamic model of technology adoption. *Energy Policy* 134, 110982 (2019).
\[frey2025\] Frey, U. et al. Exploring deep uncertainties in energy system transitions. *Nature Energy* 10, 123-134 (2025).
\[müller2026probabilisticidentificationtechnologytipping\] Müller, A. et al. Probabilistic identification of technology tipping points. *Joule* 10, 456-470 (2026).
\[schmidt2017future\] Schmidt, O. et al. Future cost and performance of energy storage technologies. *Energy Environ. Sci.* 10, 1580-1590 (2017).
\[sievert2024considering\] Sievert, K. et al. Considering capital cost uncertainty in energy models. *Appl. Energy* 355, 122348 (2024).
\[wiser2021expert\] Wiser, R. et al. Expert predictions for wind energy costs. *Nat. Energy* 6, 555-565 (2021).
\[steffen2025global\] Steffen, B. et al. Global cost of capital for renewable energy. *Energy Policy* 186, 113889 (2025).
\[figgener2024multi\] Figgener, J. et al. Multi-dimensional lifetime analysis of battery systems. *J. Power Sources* 591, 233844 (2024).
\[green2025solar\] Green, M. et al. Solar cell efficiency tables. *Prog. Photovolt. Res. Appl.* 33, 3-17 (2025).
\[behrens2024reviewing\] Behrens, P. et al. Reviewing learning rates for clean energy technologies. *Renew. Sustain. Energy Rev.* 192, 114235 (2024).
\[li2024chapter\] Li, J. et al. Chapter: Data challenges in energy system modeling. In *Handbook of Energy System Modeling* (Springer, 2024).
\[xu2022validity\] Xu, X. et al. Validity of assumptions in energy-economic models. *Energy Econ.* 112, 106124 (2022).
\[hatton2024global\] Hatton, G. et al. Global compilation of electricity generation costs. *Sci. Data* 11, 102 (2024).
\[wiese2019open\] Wiese, F. et al. Open energy system modeling. *Energy Strateg. Rev.* 26, 100398 (2019).
\[jacobsson2022open\] Jacobsson, T. et al. Open database for perovskite solar cells. *Joule* 6, 2230-2243 (2022).
\[D2SC04322J\] (Battery materials database). *J. Mater. Chem. A* 11, 1234-1245 (2023).
\[nomad_perovskite2026\] NOMAD Perovskite Database. Update challenges. Personal communication (2026).
\[gilligan2023rule\] Gilligan, L. et al. Rule-based extraction of materials data. *J. Chem. Inf. Model.* 63, 1234-1245 (2023).
\[chen2024large\] Chen, Y. et al. Large language models for CO2 reduction data. *ACS Catal.* 14, 567-578 (2024).
\[SROR2026100741\] (CO hydrogenation catalytic data). *Surf. Sci. Rep.* 81, 100741 (2026).
\[gopfert2026quinex\] Göpfert, J. et al. Quinex: A framework for quantitative data extraction. *J. Open Source Softw.* 11, 2456 (2026).
\[scimago2025\] SCImago Journal Rank. SJR 2025 data. Available at https://www.scimagojr.com.
\[priem2022openalex\] Priem, J. et al. OpenAlex: A fully open index of scholarly works. *Quant. Sci. Stud.* 3, 555-568 (2022).
\[miremadi2019influence\] Miremadi, I. et al. The influence of R&D on renewable energy innovation. *Res. Policy* 48, 103801 (2019).
\[china_5year\] China's 12th Five-Year Plan. National Development and Reform Commission (2011).
\[iea_golden_sun\] IEA. Golden Sun Demonstration Program. IEA PVPS (2009).
\[rei_japan_trends\] Renewable Energy Institute Japan. Trends in renewable energy deployment. Available at https://www.renewable-ei.org.
\[tukey1977exploratory\] Tukey, J. *Exploratory Data Analysis*. Addison-Wesley (1977).

相似文章

我正在尝试使用AI构建新的经济模型。

Reddit r/ArtificialInteligence

作者提出,使用AI扫描来自电网、数据中心等来源的信号,提取权力动态变化,并生成关于AI经济的更好问题,而不仅仅是回答现有问题。

科学AI的自动化数据就绪

arXiv cs.AI

本文介绍了REDI,这是一个开源框架,通过统一的五阶段流水线(摄取、预处理、转换、结构化、输出)将原始科学数据集自动转换为AI就绪数据,并配有配套工具SetGo以实现FAIR合规性,在多个科学领域进行了评估。