ESGLens:基于LLM的RAG框架,实现交互式ESG报告分析与评分预测
摘要
MIT研究人员提出ESGLens,一个RAG框架,可从PDF报告中提取结构化ESG数据,并以0.48的Pearson相关系数预测环境评分,对标LSEG基准。
arXiv:2604.19779v1 公告类型:新
摘要:环境、社会与治理(ESG)报告是投资决策的核心,但其篇幅冗长、内容多样且缺乏标准化结构,导致人工分析成本高昂且结果不一致。我们推出ESGLens,一个概念验证框架,将检索增强生成(RAG)与提示工程化提取相结合,自动完成三项任务:(1)依据全球报告倡议组织(GRI)标准进行结构化信息提取;(2)可溯源的交互式问答;(3)基于LLM生成嵌入的ESG评分回归预测。ESGLens专为该领域设计:报告处理模块将异构PDF内容切分为文本、表格、图表等类型化块;GRI引导的提取模块检索并合成符合特定标准的信息;评分模块对提取摘要进行嵌入,并输入以伦敦证券交易所集团(LSEG)参考评分训练的回归模型。我们在约300份来自QQQ、S&P 500及Russell 1000指数公司2022财年报告中评估该框架。在三种嵌入方法(ChatGPT、BERT、RoBERTa)与两种回归器(神经网络、LightGBM)中,ChatGPT嵌入+神经网络以Pearson相关系数0.48(R²≈0.23)对标LSEG真实评分——在仅约300份训练集且仅聚焦环境维度的限制下,该信号虽温和但统计显著。可追溯性审计显示,10条提取声明中有8条可在源文档中验证,2条失败归因于少样本示例泄露。我们讨论了数据集规模及仅限环境指标等局限,并开源代码以支持可复现性。
查看缓存全文
缓存时间: 2026/04/23 10:02
# ESGLens:基于 LLM 的 RAG 框架,用于交互式 ESG 报告分析与评分预测 来源:https://arxiv.org/html/2604.19779 杨宗瑜 麻省理工学院 [email protected] & 陈孟奇 麻省理工学院 [email protected] ###### 摘要 环境、社会与治理(ESG)报告是投资决策的核心,但其篇幅冗长、内容异构、缺乏统一结构,导致人工分析成本高昂且结果不一致。我们提出 ESGLens,一个概念验证框架,融合检索增强生成(RAG)与提示工程抽取,自动完成三项任务:(1)按全球报告倡议组织(GRI)标准进行结构化信息抽取;(2)可溯源的交互式问答;(3)基于 LLM 嵌入的回归模型预测 ESG 评分。ESGLens 专为该领域设计:报告处理模块将异构 PDF 内容切分为文本、表格、图表等类型块;GRI 引导抽取模块检索并合成与特定标准对齐的信息;评分模块将抽取摘要嵌入后输入回归模型,与伦敦证券交易所集团(LSEG)参考评分对齐。我们在约 300 份 2022 财年 QQQ、S&P 500 与 Russell 1000 公司报告中评估框架。三种嵌入(ChatGPT、BERT、RoBERTa)与两种回归器(神经网络、LightGBM)中,ChatGPT 嵌入 + 神经网络对 LSEG 真值评分取得皮尔逊相关系数 0.48(R²≈0.23),在仅约 300 份训练集且仅限环境维度的条件下,已呈现统计显著信号。可溯源审计显示,10 条抽取中有 8 条可在原文验证,2 条失败源于少样本示例泄漏。我们讨论了数据集规模与仅限环境指标等局限,并开源代码以支持复现与后续扩展。 ## 1 引言 随着气候变化加剧,各界呼吁企业超越股东利益追求更广泛目标。ESG 报告因此激增,企业向投资者、政府、学者与倡导者披露其气候行动[^3,19,32,2,29]。然而,ESG 报告为自我披露文件,缺乏统一模板,导致跨公司、跨行业比较困难[^7,12,10]。本研究利用大语言模型分析 ESG 报告,让用户可针对特定报告提出精准问题。 此外,本研究另一动机是扩展 LLM 基于用户所提供文档回答问题的能力[^9,18]。ESG 报告通常为 PDF,含文本、图表、图形[^9]。开发高效的文档嵌入与摘要方法,可让用户交叉比对多份文档并提出更细粒度问题[^35],这在多领域均有价值[^1]。 图 1:通用 AI PDF 工具与本文提出的 ESG 报告交互问答系统对比。(a) 通用工具上传 PDF 后,用未知嵌入模型(主要处理文本,对方程、表格、图表、图片支持有限)结合用户问题调用商用 LLM,答案生成过程不透明。(b) 本框架先让用户从数据库选择公司比对 ESG 报告,再提交问题;系统生成针对 ESG 主题的定制提示,通过 API 调用 ChatGPT,几乎无需后处理,答案直接返回用户界面。ESGLens 是概念验证而非生产系统,核心贡献是端到端流水线设计——从异构 PDF 处理、提示工程抽取到回归评分——在有限数据集上验证最小可行原型,并开源代码。 ## 2 相关工作 ### 2.1 基于 LLM 的 ESG 报告分析 本项目期间(2024 年底–2025 年初),已有并发工作用 LLM 自动化分析企业 ESG 披露。Ni 等提出 ChatReport,用 LLM 对照 TCFD 准则分析可持续报告,引入领域专家反馈抑制幻觉。Zou 等将 LLM 与 RAG 结合,基于 REALM 范式,从港交所公司报告中抽取结构化 ESG 数据,GPT-4 抽取准确率 76.9%。 2025–2026 后续工作进一步深入:Ding 等提出 EulerESG,双通道检索 + SASB 指标抽取,多行业标准对齐指标表平均准确率 0.95;Hoang 等提出覆盖完整 ESG 报告生命周期的智能体框架;Wu 等发布 SusGen-GPT,7–8B 微调模型在金融 NLP 与 TCFD 合规报告生成任务上逼近 GPT-4;Mousavian Anaraki 等用 LLM 过滤实现自动 GRI–SDG 标注,同期综述系统梳理了 LLM 用于可持续报告的进展。ESGLens 另辟蹊径,将 GRI 引导抽取与基于 LLM 嵌入的量化评分回归结合,是上述系统尚未覆盖的能力。 ### 2.2 ESG 文本分类与领域专用模型 Transformer 模型在 ESG 文本分类中已验证有效。Pontes 等证明 RoBERTa 与 SVM 在多语言 ESG 议题分类有效;Tseng 提出实时从新闻抽取 ESG 评级,对标 MSCI 与 SASB;Xia 结合 PLM 与 LLM 开发 ESGLlama、FinLlama,解决领域训练数据稀缺;Mehra 等推出专为 ESG 分类调优的 ESGBERT。然而,这些方法主要面向新闻或句子级分类,而非整份 ESG 报告的结构化抽取。 ### 2.3 与通用 PDF 工具的差异 上述系统为 ESG 专用,而 PDF.ai、ChatPDF、ChatDOC 等通用 AI PDF 工具(图 1(a))调用商用 LLM 回答任意报告问题,但缺乏 GRI 等标准指导的领域抽取、量化评分与透明 RAG 流程,其 PDF 处理与 LLM 交互细节亦不公开。ESGLens 通过 GRI 引导检索 + 提示工程抽取 + 回归评分,填补这些空白。 ## 3 升级版 ChatReport:ESGLens 本文整合前人优势,提升 ESG 报告分析效率。与通用 PDF 工具不同,ESGLens 遵循三大原则:(1) 针对异构 ESG 报告格式的结构化文档处理;(2) 以 GRI 标准为指导的可比抽取;(3) 量化评分而非仅摘要。ESG 报告含文本、公式、表格、图表、甚至化学结构,需全部转为机器可读;且关键数据常位于图表。为此,我们提出基于 RAG 的 ESGLens(图 1(b)):年度嵌入公司 ESG 报告入向量库,检索用户查询与 GRI 标准问题所需上下文,经精心设计的提示送入 LLM,实现领域专用抽取并输出量化评分。 ## 4 评估与成功标准 - 报告摘要与关键数值识别:人工先标定一份 ESG 报告中的关键数值(如温室气体排放),再测试 LLM 能否准确检出。 - 幻觉验证:抽取信息时必须返回对应页码,以便回溯原文,确保非幻觉。 - 对比评级:将 LLM 给出的 ESG 评级与 LSEG 官方评分比较,评估一致性与准确性。 ## 5 相关数据集 - Responsibility Report:可下载 ESG 报告的网站。 - LSEG Dataset:提供公司 ESG 评分与财务报告。 - DynamicESG:用于 ESG 新闻分类的数据集。 ## 6 实现细节 ESGLens 分三大模块:报告处理、数据抽取、评分(图 2)。我们使用 LangChain 框架集成 LLM 与其他组件,参考 ChatReport 的 TCFD 流程,但重新设计面向 GRI 的提示与工作流。 图 2:ESGLens 五阶段详细流程。(1) 数据收集:从 QQQ、S&P 500、Russell 1000 选公司,下载其 ESG 报告与 LSEG 参考评分;(2) PDF 处理:用 RecursiveCharacterTextSplitter 切分报告,OpenAI 嵌入后存入 FAISS 向量库;(3) 数据抽取:按 GRI 标准检索,每标准取前 20 相关块;(4) 摘要:将 GRI 标准、检索上下文与提示规范输入 ChatGPT 生成结构化摘要;(5) 报告评分:嵌入摘要后输入回归模型(神经网络或 LightGBM)预测量化 ESG 评分,与 LSEG 真值对比。 - PDF 处理(RAG 基础):用 RecursiveCharacterTextSplitter 切分 ESG 报告 PDF,ChatGPT 嵌入,FAISS 管理向量库,实现高效检索。 - GRI 引导抽取:GRI 标准约 120 条,本项目先选 5 条环境相关标准。模块针对每条标准检索向量库,取前 20 相关块,确保领域对齐。 - 提示工程抽取:将前 20 块作为 CONTEXT,设计含 QUESTIONS 与 GUIDELINES 的提示,确保 ChatGPT 输出符合 GRI 标准,超越通用摘要。 - 量化评分:将各标准下抽取的要点嵌入后输入回归模型,预测公司 ESG 评分,与 LSEG 官方分比对。回归可用 ChatGPT、BERT、RoBERTa 嵌入,模型可选神经网络或 LightGBM。 ## 7 结果与分析 ### 7.1 提示工程 为从长文档准确抽取并保证输出格式,提示需精心设计。提示通常包含: - 指令:开篇高级描述或角色设定,如“你是一名 ESG 专家,负责分析公司 ESG 报告”,可附示例。 - 上下文:待分析文档…
相似文章
利用大语言模型增强基本面分析:基于RAG的投资者简报生成系统
本文探讨了使用大语言模型与RAG系统,通过处理财务报告和宏观经济数据来自动化公司基本面分析,生成由个人投资者评估的投资者简报。
ArguLens:一个用于自动作文评分和标签感知反馈生成的开源系统
ArguLens 是一个用于自动作文评分的开源系统,它使用微调的LLM进行话语分类,LightGBM进行评分,并通过一个反馈生成器提供可解释的、标签感知的结果。
EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试
介绍了EnterpriseRAG,一个包含六个领域983个专家验证样本的基准测试,用于评估LLM在非理想企业检索条件下的指令遵循和鲁棒性,这些条件包括噪声、知识缺口和事实冲突。对13个LLM的评估揭示了单个约束满足率与整体合规率之间的巨大差距,凸显了在生产级RAG系统中需要上下文感知协议。
Elmes*:长尾教育场景下大型语言模型细粒度评估标准的自动构建
本文介绍了Elmes+,一个面向长尾教育场景下LLMs细粒度评估标准构建的自动化框架,并提出了涵盖11个学科330个场景的Edu-330基准。该框架使用多智能体引擎和自演化模块来协同优化评估标准与测试数据,揭示了顶级LLMs在多维教育能力上的差异。
在应用场景中评估RAG指标:一项实验、发现与局限性
本文通过一项实证研究,比较了来自四个库(Ragas、DeepEval、RAGChecker、Opik)的RAG评估指标与人工判断及标准召回指标,并基于商业数据创建了问答数据集。