Scope3Trace:基于证据的可持续发展报告中范围三温室气体排放识别与提取
摘要
Scope3Trace 提出了一种基于证据的信息提取框架,利用大语言模型从可持续发展报告中识别和提取范围三温室气体排放,贡献了一个双层多模态数据集,实现了高精度的提取。
arXiv:2607.17122v1 公告类型:新
摘要:范围三温室气体排放占企业碳足迹的大部分,但由于披露稀疏、报告文档格式异构以及证据可追溯性有限,仍难以大规模分析。现有方法通常依赖大语言模型从 ESG 报告中提取排放信息,但往往缺乏明确的证据依据,或依赖昂贵的人工标注和验证来确保提取可靠性。为解决这些挑战,我们提出了 Scope3Trace,一个基于证据的信息提取框架,旨在从真实的 ESG 和可持续发展报告中提取可解释且可追溯的范围三排放信息。该框架集成了文档信息提取流水线,执行 PDF 收集和 OCR 解析、LLM 辅助的页面定位和表格重建,以及混合规则-LLM 提取组织和建筑级别的排放披露,并带有基于证据的验证。在此框架基础上,我们进一步贡献了一个双层、基于证据的多模态数据集,包含从异构可持续发展报告中提取的组织级范围三披露。Scope3Trace 实现了异构可持续发展披露的可靠提取和透明集成,在从可持续发展报告中提取范围 1-3 总量和类别级披露方面取得了高精度。
查看缓存全文
缓存时间: 2026/07/21 06:44
# Scope3Trace:基于证据的可持续性报告中范围3温室气体排放识别与抽取
来源:https://arxiv.org/html/2607.17122
Siyuan Zheng,Yifan Duan,Chao Xue,Flora D. Salim
新南威尔士大学悉尼校区
{siyuan.zheng1}@student.unsw.edu.au
{yifan.duan3, flora.salim}@unsw.edu.au
###### 摘要
范围3温室气体(GHG)排放占企业碳足迹的大部分,但由于披露不充分、报告文档格式异构以及证据可追溯性有限,至今仍难以大规模分析。现有方法通常依赖大型语言模型从ESG报告中提取排放信息,但往往缺乏明确的证据依据,或依赖于昂贵的人工标注和验证来确保提取可靠性。为解决这些挑战,我们提出了Scope3Trace,一个基于证据的信息抽取框架,旨在从真实世界的ESG和可持续性报告中提取可解释且可追溯的范围3排放信息。该框架集成了文档信息抽取管道,执行PDF收集与OCR解析、基于LLM的页面定位与表格重建,以及混合规则-LLM抽取(含基于证据的验证)企业层面和建筑层面的排放披露。基于此框架,我们进一步贡献了一个双层面、基于证据的多模态数据集,包含从异构可持续性报告中提取的企业层面范围3披露信息。Scope3Trace能够可靠地提取异构可持续性披露并透明地整合,在从可持续性报告中提取范围1-3总量及类别层面披露方面实现了高精度。代码可在https://github.com/JeppesenZheng/Scope3trace 获取。
Scope3Trace:基于证据的可持续性报告中范围3温室气体排放识别与抽取
Siyuan Zheng,Yifan Duan,Chao Xue,Flora D. Salim††感谢:通讯作者。
新南威尔士大学悉尼校区
{siyuan.zheng1}@student.unsw.edu.au
{yifan.duan3, flora.salim}@unsw.edu.au
## 1 引言
参见图注
图1: GHG协议下范围1、2、3排放示意图。利用我们的信息抽取框架,我们构建了Scope3Trace数据集,将提取的排放披露按企业层面和建筑层面组织,并附带证据。
随着气候变化日益威胁全球可持续性和经济稳定,企业温室气体(GHG)报告已成为气候治理、企业风险管理和监管问责的基石(Traub et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib16); Luu, 2025 (https://arxiv.org/html/2607.17122#bib.bib13); Li, 2025 (https://arxiv.org/html/2607.17122#bib.bib12))。在企业碳核算框架中,排放根据其来源和价值链边界分为范围1、范围2和范围3,如图1所示。虽然现有研究和行业努力因标准化报告协议和相对可获取的活动数据而日益聚焦于范围1和范围2排放(Yap et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib18)),但范围3排放——尽管占企业碳足迹的大部分——由于披露分散且缺乏源自可持续性报告的统一结构化数据集,在数据驱动的研究中仍然难以分析(Greenhouse Gas Protocol, 2019 (https://arxiv.org/html/2607.17122#bib.bib8); Hertwich and Wood, 2018 (https://arxiv.org/html/2607.17122#bib.bib10); Greenhouse Gas Protocol, 2011 (https://arxiv.org/html/2607.17122#bib.bib7))。
近期大型语言模型(LLM)的进展显著提高了文档理解能力(Achiam et al., 2023 (https://arxiv.org/html/2607.17122#bib.bib1))。此外,检索增强生成(RAG)技术通过将生成过程基于检索到的外部证据,有助于减轻幻觉现象(Gao et al., 2023 (https://arxiv.org/html/2607.17122#bib.bib6))。近期研究已开始利用这些能力,通过基于LLM的信息抽取管道从可持续性和ESG报告中提取企业排放披露,通常结合人工验证或标注以确保提取可靠性(Beck et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib2))。与此同时,另一条研究路线利用LLM从企业报告中推断公司所属行业,并进一步通过将行业层面排放因子与企业活动或支出数据相结合来估算公司层面的排放(Dumit et al., 2024 (https://arxiv.org/html/2607.17122#bib.bib5); Guo et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib9); Lenzen et al., 2012 (https://arxiv.org/html/2607.17122#bib.bib11))。尽管这些方法前景可期,但仍留下重要的挑战未解决。以抽取为中心的方法(Beck et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib2))改善了对已披露数据的获取,但常常忽视报告边界、资产覆盖范围和证据可追溯性。此外,这些工作通常依赖昂贵且耗时的人工专家验证来确保提取可靠性。基于估算的方法(Guo et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib9))提供了更广泛的覆盖范围,但脱离了企业或资产层面的特征,透明度有限,且与已披露的会计实践对齐度弱。因此,范围3数据仍然难以解释、验证并用于决策支持。
为应对这些局限,我们提出了Scope3Trace,一个基于证据的可持续性与ESG报告信息抽取框架。该框架实现了一个文档抽取管道,收集可持续性报告,将PDF转换为结构化OCR文本,并通过页面级定位识别包含范围1-3披露的页面。然后通过基于LLM的表格解读重建表格披露,并通过混合规则-LLM设计执行排放值的结构化抽取,其中LLM辅助页面定位和表格重建,而规则组件负责数字解析、类别映射以及针对OCR文本的证据验证。这种设计使得能够可靠地提取企业层面和建筑层面的排放披露,并附有明确的文本证据。利用该框架,我们进一步将提取的记录组织成一个双层面数据集,涵盖企业层面和建筑层面的范围排放信息。我们的主要贡献可总结如下:
- •我们提出了一个基于证据的可持续性报告信息抽取框架,集成了PDF收集、基于OCR的文档解析、基于LLM的页面定位与表格重建,以及用于范围1-3排放披露的混合规则-LLM结构化抽取。
- •我们设计了一个可靠的抽取管道,明确将提取的排放值与支持性文本证据相关联,从而能够从异构ESG报告中实现可追溯、可验证的企业层面和建筑层面范围排放信息抽取。
- •据我们所知,Scope3Trace是首批构建双层面、多模态、基于证据的数据集的工作之一,专门针对范围3排放。
## 2 相关工作
**可持续性与ESG报告的信息抽取。** 近期工作表明,基于NLP和LLM的系统能够可靠地从可持续性和ESG报告中提取结构化排放信息,包括范围1-3数值、标准化类别以及支持性文本或表格证据(Beck et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib2); Zou et al., 2023 (https://arxiv.org/html/2607.17122#bib.bib20); Mishra et al., 2024 (https://arxiv.org/html/2607.17122#bib.bib14); Ding et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib4))。这些方法大大减少了人工报告工作量,并构成了大规模获取已披露排放数据的基础。然而,其任务定义和评估主要以文档为中心,侧重于提取准确性和证据定位,而非报告数值与基础资产或组织覆盖范围之间的关系。
**范围3排放估算与基于代理的方法。** 另一条研究路线利用经济、基于活动或基于支出的代理变量估算范围3排放,通常依赖投入产出模型或行业排放因子以实现广泛的组织覆盖范围(Hertwich and Wood, 2018 (https://arxiv.org/html/2607.17122#bib.bib10); Dumit et al., 2024 (https://arxiv.org/html/2607.17122#bib.bib5); Guo et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib9))。这些方法非常适合大规模基准测试和政策分析,但通常脱离资产层面结构,且对披露数值或报告边界的可追溯性有限。
**建筑与资产层面碳建模。** 在单个建筑和物理资产层面的碳建模,利用建筑属性、能源数据和地理空间上下文,已能够对运营和隐含排放进行详细分析(Yap et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib18); Zou et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib19))。虽然这些研究提供了强大的物理可解释性和城市尺度洞察,但它们通常独立于企业可持续性披露和范围3报告框架而开发。
**ESG系统中的数据质量、覆盖范围与实用性。** 先前工作已强调ESG数据质量中持续存在的挑战,包括不完整的披露、不一致的边界以及异构的估算实践,特别是对于范围3排放(Beck et al., 2025 (https://arxiv.org/html/2607.17122#bib.bib2); Dimmelmeier et al., 2024 (https://arxiv.org/html/2607.17122#bib.bib3); Sternberg, 2022 (https://arxiv.org/html/2607.17122#bib.bib15))。虽然这些局限性被广泛认识,但很少以机器可读的形式明确编码,导致覆盖范围、适用性和置信度在现有ESG数据集和系统中通常是隐含的。
参见图注
图2: Scope3Trace多智能体系统数据集构建概览。管道由三个智能体(搜索、范围和验证)协调,执行数据获取、解析、提取和验证。通过将结构化解析(如页面定位和表格重建)与明确的证据依据(示例见A.2 (https://arxiv.org/html/2607.17122#A1.SS2.SSS0.Px1))相结合,系统确保所有提取的值都是可追溯和可靠的,从而能够构建审计级范围1/2/3排放数据。
## 3 Scope3Trace
本节介绍Scope3Trace框架:§3.1 (https://arxiv.org/html/2607.17122#S3.SS1) 阐述设计目标,§3.2 (https://arxiv.org/html/2607.17122#S3.SS2) 描述双层面数据表示,§3.3 (https://arxiv.org/html/2607.17122#S3.SS3) 介绍用于数据提取和验证的多智能体管道。
### 3.1 动机与设计目标
范围3排放估算的根本局限不仅在于数值准确性,还在于物理资产层面活动数据的可观测性有限,而这又因非结构化ESG报告文本的异构性而进一步加剧——这恰恰是语义和文本处理技术能够独特解决的核心挑战。在实践中,企业层面的披露往往嵌入在可持续性报告的非结构化段落、表格或脚注中,用词不一致、类别定义模糊、文档格式各异,包括扫描PDF、格式化文本和混合图文布局。现有研究要么依赖人工标注(昂贵且难以扩展),要么采用缺乏足够语义理解的通用文档处理管道。结果,提取的排放数据可追溯性和可解释性都很弱。
为弥补这些差距,我们的设计目标是利用先进的文本处理和语义技术,自动完成异构ESG报告排放信息的提取、标准化和验证,构建一个双层面的范围3数据集。具体而言,我们旨在:(1)使用语义模型实现对非结构化文本/表格中排放相关内容的准确定位和解读;(2)开发规则-LLM混合管道,通过将提取值与原始文本片段相连接,确保证据依据和可追溯性;(3)应用语义对齐,将异构披露统一为标准化模式,从而实现可解释、可诊断、覆盖范围感知的排放分析。这种设计消除了对人工标注的过度依赖,并增强了框架的可扩展性。
### 3.2 数据集组成与结构
Scope3Trace采用显式针对信息抽取和语义对齐优化的多层级数据结构。该结构区分了通过文本处理技术从ESG报告中获取的企业披露数据与资产层面的表示。由增强的多智能体系统协同生成,包含两个紧密耦合的数据层:通过信息抽取从报告中获取的组织层面披露,以及通过文本分析产生的语义元数据增强的建筑层面资产记录。
在组织层面,每条记录对应一个组织和一个特定的报告年份。它包含提取的范围3排放总量、带有语义标签(通过文本分析归一化)的类别层面分解,以及标准化的范围1和范围2排放。该记录还整合了元数据,如报告边界和审计状态,这些通过实体识别和关系抽取来捕获。该层的一个关键特征是证据链接:每个提取值都与语义模型从原始ESG报告中识别出的文本片段配对,同时附带抽取管道产生的置信度分数。
在建筑层面,每条记录对应一个建筑和年份,记录物理属性、地理空间坐标和运营活动指标。记录进一步补充了语义元数据,包括通过文本分类生成的建筑类型分类,以及通过语义相似度计算提炼的活动描述标准。多模态卫星图像被整合作为补充上下文,而核心描述性元数据则通过文本处理增强,以确保与企业层面披露的对齐。这种对齐包括通过实体链接,将报告中提到的建筑名称与相应的资产条目相连接。所有派生字段都明确标记其来源(区分直接提取、建模或估算的信息),并附带语义处理获得的置信度分数。这种标注确保了透明度,防止与企业报告数据的混淆。
### 3.3 数据来源与构建
Scope3Trace通过一个以信息抽取和语义处理为核心的模块化管道,整合企业层面披露和建筑层面清单,如图2所示,这与流程图中的多智能体系统概览一致。该管道由以下部分协调:相似文章
从碎片化ESG数据中获取可审计的气候风险智能:面向范围1-3验证的确定性编排与不平衡感知学习
本文提出了一种确定性气候风险智能框架,整合了编排、异常检测和不平衡感知集成学习,用于可审计的ESG验证,以解决碎片化的范围1-3报告数据。
DocScope:用于值得信赖的长文档理解的可靠推理基准测试
DocScope 是一个新的基准测试,旨在评估多模态大语言模型在长文档上的可靠推理能力和可信度,引入了包含页面定位、区域定位、事实提取和答案验证四个阶段的评估协议。
TokenScope: 面向大型语言模型中代码任务的词元级可解释性与可理解性
TokenScope是一个面向仅解码器大型语言模型的交互式可解释性工具,在代码生成过程中提供词元级指标、注意力模式及反事实分支,支持系统性地研究模型行为。
使用大语言模型在危机报告中提取和三角验证因果证据:基于ReliefWeb的研究
本文提出了一种两阶段的大语言模型流水线,用于从人道主义危机报告中提取和三角验证因果证据,在ReliefWeb数据集上取得了较高的F1分数,并提出了一种证据水平评分,用于衡量跨情境的一致性。
从片段到语义:重新思考多语言事实核查的证据粒度
本文介绍了SEEK,一个用于多语言事实核查中语义证据提取的框架,该框架从完整文章中构建连贯的证据块,并使用LoRA微调多语言大语言模型,在宏观F1分数上相比基线提升了高达20%。