ESGLens:基于LLM的RAG框架,实现交互式ESG报告分析与评分预测

arXiv cs.CL 论文

摘要

MIT研究人员提出ESGLens,一个RAG框架,可从PDF报告中提取结构化ESG数据,并以0.48的Pearson相关系数预测环境评分,对标LSEG基准。

arXiv:2604.19779v1 公告类型:新 摘要:环境、社会与治理(ESG)报告是投资决策的核心,但其篇幅冗长、内容多样且缺乏标准化结构,导致人工分析成本高昂且结果不一致。我们推出ESGLens,一个概念验证框架,将检索增强生成(RAG)与提示工程化提取相结合,自动完成三项任务:(1)依据全球报告倡议组织(GRI)标准进行结构化信息提取;(2)可溯源的交互式问答;(3)基于LLM生成嵌入的ESG评分回归预测。ESGLens专为该领域设计:报告处理模块将异构PDF内容切分为文本、表格、图表等类型化块;GRI引导的提取模块检索并合成符合特定标准的信息;评分模块对提取摘要进行嵌入,并输入以伦敦证券交易所集团(LSEG)参考评分训练的回归模型。我们在约300份来自QQQ、S&P 500及Russell 1000指数公司2022财年报告中评估该框架。在三种嵌入方法(ChatGPT、BERT、RoBERTa)与两种回归器(神经网络、LightGBM)中,ChatGPT嵌入+神经网络以Pearson相关系数0.48(R²≈0.23)对标LSEG真实评分——在仅约300份训练集且仅聚焦环境维度的限制下,该信号虽温和但统计显著。可追溯性审计显示,10条提取声明中有8条可在源文档中验证,2条失败归因于少样本示例泄露。我们讨论了数据集规模及仅限环境指标等局限,并开源代码以支持可复现性。
查看原文
查看缓存全文

缓存时间: 2026/04/23 10:02

# ESGLens:基于 LLM 的 RAG 框架,用于交互式 ESG 报告分析与评分预测  
来源:https://arxiv.org/html/2604.19779  
杨宗瑜 麻省理工学院 [email protected] & 陈孟奇 麻省理工学院 [email protected]  

###### 摘要  

环境、社会与治理(ESG)报告是投资决策的核心,但其篇幅冗长、内容异构、缺乏统一结构,导致人工分析成本高昂且结果不一致。我们提出 ESGLens,一个概念验证框架,融合检索增强生成(RAG)与提示工程抽取,自动完成三项任务:(1)按全球报告倡议组织(GRI)标准进行结构化信息抽取;(2)可溯源的交互式问答;(3)基于 LLM 嵌入的回归模型预测 ESG 评分。ESGLens 专为该领域设计:报告处理模块将异构 PDF 内容切分为文本、表格、图表等类型块;GRI 引导抽取模块检索并合成与特定标准对齐的信息;评分模块将抽取摘要嵌入后输入回归模型,与伦敦证券交易所集团(LSEG)参考评分对齐。我们在约 300 份 2022 财年 QQQ、S&P 500 与 Russell 1000 公司报告中评估框架。三种嵌入(ChatGPT、BERT、RoBERTa)与两种回归器(神经网络、LightGBM)中,ChatGPT 嵌入 + 神经网络对 LSEG 真值评分取得皮尔逊相关系数 0.48(R²≈0.23),在仅约 300 份训练集且仅限环境维度的条件下,已呈现统计显著信号。可溯源审计显示,10 条抽取中有 8 条可在原文验证,2 条失败源于少样本示例泄漏。我们讨论了数据集规模与仅限环境指标等局限,并开源代码以支持复现与后续扩展。

## 1 引言  

随着气候变化加剧,各界呼吁企业超越股东利益追求更广泛目标。ESG 报告因此激增,企业向投资者、政府、学者与倡导者披露其气候行动[^3,19,32,2,29]。然而,ESG 报告为自我披露文件,缺乏统一模板,导致跨公司、跨行业比较困难[^7,12,10]。本研究利用大语言模型分析 ESG 报告,让用户可针对特定报告提出精准问题。

此外,本研究另一动机是扩展 LLM 基于用户所提供文档回答问题的能力[^9,18]。ESG 报告通常为 PDF,含文本、图表、图形[^9]。开发高效的文档嵌入与摘要方法,可让用户交叉比对多份文档并提出更细粒度问题[^35],这在多领域均有价值[^1]。

图 1:通用 AI PDF 工具与本文提出的 ESG 报告交互问答系统对比。(a) 通用工具上传 PDF 后,用未知嵌入模型(主要处理文本,对方程、表格、图表、图片支持有限)结合用户问题调用商用 LLM,答案生成过程不透明。(b) 本框架先让用户从数据库选择公司比对 ESG 报告,再提交问题;系统生成针对 ESG 主题的定制提示,通过 API 调用 ChatGPT,几乎无需后处理,答案直接返回用户界面。ESGLens 是概念验证而非生产系统,核心贡献是端到端流水线设计——从异构 PDF 处理、提示工程抽取到回归评分——在有限数据集上验证最小可行原型,并开源代码。

## 2 相关工作  

### 2.1 基于 LLM 的 ESG 报告分析  

本项目期间(2024 年底–2025 年初),已有并发工作用 LLM 自动化分析企业 ESG 披露。Ni 等提出 ChatReport,用 LLM 对照 TCFD 准则分析可持续报告,引入领域专家反馈抑制幻觉。Zou 等将 LLM 与 RAG 结合,基于 REALM 范式,从港交所公司报告中抽取结构化 ESG 数据,GPT-4 抽取准确率 76.9%。

2025–2026 后续工作进一步深入:Ding 等提出 EulerESG,双通道检索 + SASB 指标抽取,多行业标准对齐指标表平均准确率 0.95;Hoang 等提出覆盖完整 ESG 报告生命周期的智能体框架;Wu 等发布 SusGen-GPT,7–8B 微调模型在金融 NLP 与 TCFD 合规报告生成任务上逼近 GPT-4;Mousavian Anaraki 等用 LLM 过滤实现自动 GRI–SDG 标注,同期综述系统梳理了 LLM 用于可持续报告的进展。ESGLens 另辟蹊径,将 GRI 引导抽取与基于 LLM 嵌入的量化评分回归结合,是上述系统尚未覆盖的能力。

### 2.2 ESG 文本分类与领域专用模型  

Transformer 模型在 ESG 文本分类中已验证有效。Pontes 等证明 RoBERTa 与 SVM 在多语言 ESG 议题分类有效;Tseng 提出实时从新闻抽取 ESG 评级,对标 MSCI 与 SASB;Xia 结合 PLM 与 LLM 开发 ESGLlama、FinLlama,解决领域训练数据稀缺;Mehra 等推出专为 ESG 分类调优的 ESGBERT。然而,这些方法主要面向新闻或句子级分类,而非整份 ESG 报告的结构化抽取。

### 2.3 与通用 PDF 工具的差异  

上述系统为 ESG 专用,而 PDF.ai、ChatPDF、ChatDOC 等通用 AI PDF 工具(图 1(a))调用商用 LLM 回答任意报告问题,但缺乏 GRI 等标准指导的领域抽取、量化评分与透明 RAG 流程,其 PDF 处理与 LLM 交互细节亦不公开。ESGLens 通过 GRI 引导检索 + 提示工程抽取 + 回归评分,填补这些空白。

## 3 升级版 ChatReport:ESGLens  

本文整合前人优势,提升 ESG 报告分析效率。与通用 PDF 工具不同,ESGLens 遵循三大原则:(1) 针对异构 ESG 报告格式的结构化文档处理;(2) 以 GRI 标准为指导的可比抽取;(3) 量化评分而非仅摘要。ESG 报告含文本、公式、表格、图表、甚至化学结构,需全部转为机器可读;且关键数据常位于图表。为此,我们提出基于 RAG 的 ESGLens(图 1(b)):年度嵌入公司 ESG 报告入向量库,检索用户查询与 GRI 标准问题所需上下文,经精心设计的提示送入 LLM,实现领域专用抽取并输出量化评分。

## 4 评估与成功标准  

- 报告摘要与关键数值识别:人工先标定一份 ESG 报告中的关键数值(如温室气体排放),再测试 LLM 能否准确检出。  
- 幻觉验证:抽取信息时必须返回对应页码,以便回溯原文,确保非幻觉。  
- 对比评级:将 LLM 给出的 ESG 评级与 LSEG 官方评分比较,评估一致性与准确性。

## 5 相关数据集  

- Responsibility Report:可下载 ESG 报告的网站。  
- LSEG Dataset:提供公司 ESG 评分与财务报告。  
- DynamicESG:用于 ESG 新闻分类的数据集。

## 6 实现细节  

ESGLens 分三大模块:报告处理、数据抽取、评分(图 2)。我们使用 LangChain 框架集成 LLM 与其他组件,参考 ChatReport 的 TCFD 流程,但重新设计面向 GRI 的提示与工作流。

图 2:ESGLens 五阶段详细流程。(1) 数据收集:从 QQQ、S&P 500、Russell 1000 选公司,下载其 ESG 报告与 LSEG 参考评分;(2) PDF 处理:用 RecursiveCharacterTextSplitter 切分报告,OpenAI 嵌入后存入 FAISS 向量库;(3) 数据抽取:按 GRI 标准检索,每标准取前 20 相关块;(4) 摘要:将 GRI 标准、检索上下文与提示规范输入 ChatGPT 生成结构化摘要;(5) 报告评分:嵌入摘要后输入回归模型(神经网络或 LightGBM)预测量化 ESG 评分,与 LSEG 真值对比。

- PDF 处理(RAG 基础):用 RecursiveCharacterTextSplitter 切分 ESG 报告 PDF,ChatGPT 嵌入,FAISS 管理向量库,实现高效检索。  
- GRI 引导抽取:GRI 标准约 120 条,本项目先选 5 条环境相关标准。模块针对每条标准检索向量库,取前 20 相关块,确保领域对齐。  
- 提示工程抽取:将前 20 块作为 CONTEXT,设计含 QUESTIONS 与 GUIDELINES 的提示,确保 ChatGPT 输出符合 GRI 标准,超越通用摘要。  
- 量化评分:将各标准下抽取的要点嵌入后输入回归模型,预测公司 ESG 评分,与 LSEG 官方分比对。回归可用 ChatGPT、BERT、RoBERTa 嵌入,模型可选神经网络或 LightGBM。

## 7 结果与分析  

### 7.1 提示工程  

为从长文档准确抽取并保证输出格式,提示需精心设计。提示通常包含:

- 指令:开篇高级描述或角色设定,如“你是一名 ESG 专家,负责分析公司 ESG 报告”,可附示例。  
- 上下文:待分析文档…

相似文章

EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试

arXiv cs.AI

介绍了EnterpriseRAG,一个包含六个领域983个专家验证样本的基准测试,用于评估LLM在非理想企业检索条件下的指令遵循和鲁棒性,这些条件包括噪声、知识缺口和事实冲突。对13个LLM的评估揭示了单个约束满足率与整体合规率之间的巨大差距,凸显了在生产级RAG系统中需要上下文感知协议。