利用网络数据和大型语言模型量化组织环境行动
摘要
提出了一种使用网络数据和大型语言模型的可扩展计算框架,以量化组织环境行动,并以美国犹太教堂为例进行了演示,比较了关键词检索、语义检索和直接分类方法。
arXiv:2609.16627v1 Announce Type: new
摘要:从公开可用的网页内容中量化组织环境行动仍然是一个具有挑战性的环境数据科学问题,因为相关信息可能分散在多个网页中,并且主要通过非结构化文本进行传达。我们提出了一个可扩展的计算框架,用于将组织网页内容转化为环境行动的结构化度量,并以美国犹太教堂为例进行了演示。我们通过整合多个地理空间、知识库、目录和手动审核来源,构建了一个包含4,964个教堂的全国数据库。其中,2,657个教堂拥有活跃的网站并被成功爬取,生成了一个包含154,454个网页的语料库。我们比较了三种检测环境行动的方法:关键词检索后进行大型语言模型(LLM)分类、语义向量检索后进行LLM分类,以及不进行初步检索的直接LLM分类。与专家人工审核者的一致性最低的是关键词检索($\kappa$ = 0.26),语义向量检索较高($\kappa$ = 0.42),直接LLM分类相似($\kappa$ = 0.40)。尽管语义检索达到了最高的一致性,但其检索召回率为0.87,表明在分类之前丢失了相关内容。应用于完整语料库时,直接LLM分类在1,398个教堂(53%)中至少识别出一项环境行动,提供了比基于检索的方法更高的覆盖范围。这些结果表明,初步检索可以降低计算成本,但可能在相关信息到达分类器之前将其排除。该框架提供了一种可重现的方法,用于从非结构化网页内容中提取组织级别的环境信息,并可应用于其他机构。
查看缓存全文
缓存时间: 2026/09/16 08:51
# 从网络数据与大语言模型量化组织环境行动 来源:https://arxiv.org/html/2609.16627 作者:Daniel Shore 所属机构:多伦多大学环境学院 作者:Vianey Leos Barajas 所属机构:多伦多大学统计科学系 / 多伦多大学环境学院 作者:Tanhum Yoreh 所属机构:多伦多大学环境学院 作者:Meredith Franklin††thanks: 通讯作者:[meredith\.franklin@utoronto\.ca](mailto:[email protected]) 所属机构:多伦多大学统计科学系 / 多伦多大学环境学院 ###### 摘要 从公开的网络内容中量化组织的环境行动仍然是一个具有挑战性的环境数据科学问题,因为相关信息可能分散在多个网页中,且主要通过非结构化文本传达。我们提出了一个可扩展的计算框架,用于将组织网页内容转化为结构化的环境行动衡量指标,并以美国的犹太教集会为例展示了该方法。我们通过整合多个地理空间、知识库、目录和人工审核来源,构建了一个包含4,964个集会的全国数据库。其中,2,657个集会拥有活跃网站并被成功爬取,生成了包含154,454个网页的语料库。我们比较了三种检测环境行动的方法:关键词检索后接大语言模型(LLM)分类、语义向量检索后接LLM分类,以及直接进行LLM分类(无预先检索)。与专家人工评审的一致性在关键词检索中最低(κ=0.26),在语义向量检索中更高(κ=0.42),而在直接LLM分类中则相似(κ=0.40)。尽管语义检索取得了最高的一致性,但其检索召回率为0.87,表明在分类前损失了相关内容。应用于完整语料库时,直接LLM分类在1,398个集会(52.6%)中至少识别出一项环境行动,提供了比基于检索的方法更高的集会层面覆盖率。这些结果表明,预先检索可以降低计算成本,但可能在信息进入分类器之前排除了相关信息。该框架提供了一种可重现的方法,用于从非结构化网络内容中提取组织层面的环境信息,并可应用于其他机构。 关键词:环境行动;大语言模型;自然语言处理;网络数据;环境数据科学;组织行为 ## 1 引言 许多环境研究问题日益依赖于整合来自多样化且不断演变的大规模异构数据(Blair等人,2019 (https://arxiv.org/html/2609.16627#bib.bib4))。虽然环境数据通常包括监测网络的测量数据、遥感观测、地理空间数据、模型和再分析产品、调查和行政记录,但许多形式的环境行动主要在文本中记录,例如组织网站、报告、新闻稿和社交媒体(Ghermandi等人,2023 (https://arxiv.org/html/2609.16627#bib.bib5))。这些文本来源包含了关于可持续发展倡议(Ilieva和McPhearson,2018 (https://arxiv.org/html/2609.16627#bib.bib6))、保护活动、气候承诺和环境治理的宝贵信息,但由于缺乏标准化结构,它们仍然难以进行系统性分析。自然语言处理(NLP)和大语言模型(LLM)的最新进展为将非结构化文本信息转化为适合科学分析的结构化环境数据集提供了新机遇(Zhao等人,2026 (https://arxiv.org/html/2609.16627#bib.bib2))。 从网络数据中自动提取环境信息面临着若干方法论挑战(Kulkarni和Di Minin,2021 (https://arxiv.org/html/2609.16627#bib.bib7))。组织在传达环境活动的方式上差异显著,使用不同的术语、写作风格和网站架构。仅依靠关键词搜索通常会出现精度和召回率低的问题,因为环境概念可能是隐含表达或通过依赖上下文的语言表达的(Naskar等人,2024 (https://arxiv.org/html/2609.16627#bib.bib8))。基于Transformer的语言模型已显著扩展了超越传统基于词典方法的、对上下文敏感的语义分类和信息提取能力(Devlin等人,2019 (https://arxiv.org/html/2609.16627#bib.bib3))。这些模型已迅速成为将非结构化文本转化为跨科学领域结构化变量的有用工具。然而,在网络规模上应用语言模型会在计算效率和信息损失之间产生权衡。在LLM分类之前检索或过滤文本可以大幅降低计算需求,但可能在相关性被模型评估之前将其排除。 尽管环境文本挖掘的最新进展证明了从科学出版物、可持续发展报告、新闻文章和社交媒体中提取信息的价值,但对于开发和验证可重现的、直接从国家层面的组织网站测量环境行动的流程的关注较少(Farrell等人,2024 (https://arxiv.org/html/2609.16627#bib.bib19))。组织网站提供了关于环境倡议的丰富但未被充分利用的信息来源,因为它们记录了特定组织的活动、项目和实践,这些内容通常在结构化数据库中无法找到。宗教场所为开发和评估此类方法提供了一个有用的试验平台。宗教组织代表了世界上最大的公民社会网络之一,集体拥有大量的土地、建筑和财政资源,同时影响着数百万人的环境态度和行为(Gardner,2002 (https://arxiv.org/html/2609.16627#bib.bib20);Jenkins等人,2017 (https://arxiv.org/html/2609.16627#bib.bib21);Eom和Ng,2023 (https://arxiv.org/html/2609.16627#bib.bib28);Hitzhusen和Tucker,2013 (https://arxiv.org/html/2609.16627#bib.bib29))。学者们认为,许多宗教传统通过更广泛的“宗教绿化”运动,越来越多地接受了环境管理理念(Gottlieb,2006 (https://arxiv.org/html/2609.16627#bib.bib22))。然而,关于个别集会中环境行动的普遍性和形式的经验证据仍然有限,因为这些活动很少在集中式数据库中收集,而是由各个集会在各种格式中记录。因此,对大量集会的环境行动进行系统测量仍然困难。 在本研究中,我们提出并评估了一个可扩展的计算框架,用于从公开的网站中衡量组织环境行动。我们以美国的犹太教集会为例展示了该框架。我们的工作流程整合了自动组织和网站发现、大规模网络爬取和存档,以及基于LLM的信息提取,将非结构化网络内容转化为集会层面的环境行动衡量指标。我们比较了三种检测环境行动的方法:(i) 关键词检索后接LLM分类,(ii) 语义向量检索后接LLM分类,以及 (iii) 直接进行LLM分类(无预先检索)。我们根据专家人工分类对这些方法进行评估,并评估了在一致性、检索召回率、计算成本和集会层面覆盖率之间的权衡。随后,选定的方法被用于表征环境行动的类型和框架,并检验其地理和组织差异。 除了应用于宗教组织外,所提出的方法也可适用于其他类型的机构,其环境活动通过公开可用的网络内容进行传达。通过整合网络规模的数据获取、基于LLM的信息提取、人工验证和结构化环境分类,本研究提供了一种可重现的方法,用于将非结构化的组织网络内容转化为可用于分析的环境信息。 ## 2 方法论 我们开发了一个计算框架,用于从公开可用的组织网站内容中识别和分类记录的环境行动,并将其应用于美国的犹太教宗教场所。分析单位是单个宗教场所,环境行动是通过每个集会网站上发布的公开内容来衡量的。我们将环境主义定义为对保护自然世界的关注,并通过组织所采取或鼓励的环境行动来操作化组织的环境主义。我们将环境行动广泛定义为具有实际或潜在环境相关性的组织实践、项目或活动(Caldwell等人,2022 (https://arxiv.org/html/2609.16627#bib.bib10))。实证应用集中于美国的犹太教宗教场所。我们之所以关注美国,是因为它拥有以色列以外最大的犹太人口,为大规模全国性分析提供了庞大且多样化的人口。此外,集会网站主要提供英文内容,便于进行一致的文本处理。最后,关于美国境内犹太环境主义的大规模实证数据仍然有限(Tirosh-Samuelson,2024 (https://arxiv.org/html/2609.16627#bib.bib17))。 ### 2.1 数据库构建 我们通过结合程序化搜索和人工审核来构建分析数据库。我们参考了五个互补来源:OpenStreetMap Overpass API;使用SPARQL坐标和名称加州匹配查询的Wikidata;覆盖美国所有50个州和哥伦比亚特区的维基百科州级犹太教堂列表;教派和联合会目录;以及Google Places API。为提高人口稠密地区的覆盖率,我们使用自适应四叉树分解对覆盖美国本土的1°×1°网格查询了Google Places API。接近API结果限制的网格单元会被递归细分,以在高密度地区恢复可能被遗漏的集会。我们补充了州级犹太教堂列表和教派目录的人工搜索。所有来源的记录都使用集会名称和地理坐标进行合并和去重,生成了一个单一的犹太教宗教场所规范数据库。该数据库在PostgreSQL中实现,并带有PostGIS和pgvector扩展。对于每个集会,我们记录了其名称、城市、州、街道地址和地理坐标、网站以及教派归属。 ### 2.2 网络爬取与存档 我们为每个拥有活跃网站的集会创建了公开可用网站内容的固定语料库。在分类前对网站内容进行存档,确保后续分析基于一致的快照,而非可能在数据收集或模型评估期间发生变化的网页。每个网站都使用Python实现的、基于BeautifulSoup HTML解析器(Richardson,2015 (https://arxiv.org/html/2609.16627#bib.bib16))的广度优先遍历进行爬取。爬虫从网站根目录开始,跟踪域内链接,并从每个网站检索最多150个页面。爬取使用十个并发工作进程执行,每个工作进程独立处理网站。媒体文件和动态页面被排除在外。保留爬取状态,以便中断的爬取可以恢复,而无需重复检索先前已获取的页面。为最大限度地减少对网站运营者的潜在负担并尊重自动访问的限制,爬虫在向同一网站发出请求之间使用了固定的0.2秒延迟,并且不尝试绕过阻止自动流量的技术措施。因此,通过自动流量控制阻止访问的网站被排除在自动内容收集之外。这些限制对于使用共享网站平台的集会尤为重要,因为访问控制可能会应用于多个托管网站。例如,自动化访问受到限制的犹太教堂网站托管在ShulCloud上。未能使用初始爬取设置成功爬取的网站随后会进行更慢的恢复爬取。该过程从5秒的请求延迟开始,每次失败时延迟加倍,最高可达80秒。这种方法恢复了来自额外网站的内容,特别是那些共享常见托管基础设施的网站。例如,它恢复了一些共享相同底层chabad.org基础设施的Chabad网站。由于保留了完整的网页语料库,而不仅仅是包含关键词的文本片段,因此该语料库随后可以使用替代的检索和分类程序进行重新分析。所有后续的分类和分析都在这个固定语料库上进行,该语料库代表了截至2026年6月1日检索到的网站内容。 ### 2.3 环境行动分类 我们使用大语言模型(LLM)作为分类器,完成若干信息提取任务。在LLM分类器框架(Zheng等人,2023 (https://arxiv.org/html/2609.16627#bib.bib1))中,一个预训练的通用语言模型会收到一个特定于任务的提示,其中指定了分类定义和决策规则,并为每个文本输入返回结构化分类。这种方法使我们能够将非结构化的组织网站内容转化为用于定量分析的结构化变量。我们通过Google Gemini 3.1 Flash-Lite实现了这一框架,该模型通过Google Gemini开发者API访问。所有分类任务的完整提示见附录A (https://arxiv.org/html/2609.16627#A1)。 LLM在本研究中用于三个任务:(1) 识别和分类网站内容中的环境行动(见A.1 (https://arxiv.org/html/2609.16627#A1.SS1)),(2) 当无法从可用元数据直接确定时,推断教派归属(见A.2 (https://arxiv.org/html/2609.16627#A1.SS2)),以及 (3) 对已识别的环境行动进行框架分类(见A.3 (https://arxiv.org/html/2609.16627#A1.SS3))。对于环境行动识别和分类(任务1),我们评估了三种在选择网站内容供LLM分类方面不同的方法:(1) 关键词检索后接LLM分类,(2) 向量相似性检索后接LLM分类,以及 (3) 直接进行LLM分类(无先前检索过滤器)。前两种方法采用两阶段程序:首先使用计算成本较低的检索方法识别候选文本,然后对保留的内容进行LLM分类。这些检索步骤旨在减少提交给LLM的文本量,从而降低计算成本和处理时间。直接LLM方法则无需先前检索过滤器即可分类网站内容。
相似文章
比人类更环保?大语言模型中的环境态度
本文开发了一个用于评估31个大语言模型环境态度的基准,发现它们往往表现出进步的环境观和情境敏感性,凸显了在可持续发展应用中可操控性和规范可靠性的问题。
现实世界中的数据分析:针对真实数据复杂性的大语言模型基准测试
本文介绍了DataGovBench,这是一个源自政府开放数据的基准测试,旨在评估大语言模型在现实数据分析任务上的表现,包括表格问答和洞察发现。实验表明,当前的大语言模型在复杂数据分析场景中仍然表现不佳。
大型语言模型能否可靠地编码定性人道主义数据?一项与人类专家裁决对比的基准研究
这项基准研究评估了46个大型语言模型与人类专家在编码定性人道主义数据方面的表现,发现通过结构化提示和推理,LLM可以达到与人类相当的可靠性,但对于细微主题仍需仔细监督。
面向LinkedIn大规模职位理解的统一语义建模框架
本文提出了一种统一的语义建模框架,利用带有多适配器架构的微调小型语言模型,用于Linkedin的大规模职位理解,提升了性能并降低了运营复杂度。
从政策文件到结构化调查响应:评估大型语言模型在政策监测中的应用
本文评估了使用大型语言模型作为AI受访者,从政策文件生成结构化调查响应的方法,展示了在结构化指标上的高度一致性,以及在政策监测中混合人机工作流程的潜力。