ConstructCIE:从建筑事故叙述中提取因果信息的数据集
摘要
本文介绍了ConstructCIE,这是一个用于从OSHA建筑事故叙述中提取因果信息的人工标注数据集,并评估了监督序列标注器和指令微调的大语言模型在端到端层次化提取中的表现。
arXiv:2608.06495v1 公告类型:新
摘要:建筑事故叙述包含丰富的因果信息,但证据往往是隐性的、长跨度的且分布式的。我们引入了ConstructCIE,一个用于从OSHA建筑事故报告中提取因果信息的人工标注数据集。该数据集采用层次化模式,涵盖事故类型、因果因素、子因果因素和支持性证据片段。我们在端到端层次化提取设置下评估了监督序列标注器和指令微调的大语言模型。结果表明,大多数被评估的模型在事故类型预测上表现强劲,并能恢复广泛的因果含义,但在精确的片段级提取方面仍然有限。JHE通常实现更强的精确匹配和软匹配,而IHE有时获得更高的关键词F1分数。错误分布因提取策略而异,但证据选择和片段边界错误仍然常见。这些发现表明,可靠的建筑事故因果信息提取需要更强的领域基础知识和更准确的证据提取。
查看缓存全文
缓存时间: 2026/08/10 08:01
# ConstructCIE:一个从施工事故叙述中提取因果信息的数据集 来源:https://arxiv.org/html/2608.06495 Jaehoon Lee,德克萨斯A&M大学建筑科学系 Namgyun Kim,德克萨斯A&M大学建筑科学系 Kuan\-Hao Huang,德克萨斯A&M大学计算机科学系 ###### 摘要 施工事故叙述包含丰富的因果信息,但相关证据往往是隐性的、跨长跨度的、且分布在不同位置。我们引入了ConstructCIE,一个从OSHA施工事故报告中手动标注的因果信息提取数据集。该数据集使用了一个层级化模式,涵盖事故类型、因果因素、子因果因素和支持性证据片段。我们在端到端的层级化提取场景中评估了监督式序列标注模型和指令微调的LLM。结果表明,大多数被评估的模型能够准确预测事故类型并恢复广泛的因果含义,但在精确的片段级提取方面仍存在局限。JHE通常在精确匹配和软匹配上表现更强,而IHE有时能获得更高的关键词F1。错误分布因提取策略而异,但证据选择错误和片段边界错误仍然普遍。这些发现表明,可靠的施工事故因果信息提取需要更强的领域基础以及更准确的证据提取。 ConstructCIE:一个从施工事故叙述中提取因果信息的数据集 ## 1 引言 建筑业在经济上具有重要作用,但仍然非常危险。2024年,在美国5,070起与工作相关的死亡事故中,建筑施工占1,034起,在私营行业中排名最高(美国劳工统计局,2026c (https://arxiv.org/html/2608.06495#bib.bib36),a (https://arxiv.org/html/2608.06495#bib.bib34))。尽管建筑业仅占美国非农就业的约5%,却导致了约20%的工人死亡(美国劳工统计局,2026b (https://arxiv.org/html/2608.06495#bib.bib35))。因此,事故报告对于理解原因和预防未来事件非常有价值(Rupasinghe and Panuwatwanich, 2020 (https://arxiv.org/html/2608.06495#bib.bib31);Zou et al., 2017 (https://arxiv.org/html/2608.06495#bib.bib43))。然而,这些叙述文本难以分析,因为它们描述了动态的现场条件、变化的工作流程,以及将不安全条件、程序失误、工人行为和伤害后果联系起来的因果链(Lee et al., 2012 (https://arxiv.org/html/2608.06495#bib.bib16);Zhou et al., 2014 (https://arxiv.org/html/2608.06495#bib.bib41))。因此,许多安全知识仍然是非结构化的,需要人工分析(Zou et al., 2017 (https://arxiv.org/html/2608.06495#bib.bib43);Ma and Chen, 2024 (https://arxiv.org/html/2608.06495#bib.bib21))。 该任务与事件提取(Event Extraction, EE)一致,但施工事故的因果性与传统的以触发词为中心的事件提取不同。现有数据集如ACE05(Doddington et al., 2004 (https://arxiv.org/html/2608.06495#bib.bib6))侧重于显式事件触发词和预定义的论元角色,而事故叙述则需要识别事故发生的原因,这些原因往往通过分布在多个句子中的长跨度、有时是隐性的因果证据来表达(Hershowitz et al., 2024 (https://arxiv.org/html/2608.06495#bib.bib9);Chen, 2025 (https://arxiv.org/html/2608.06495#bib.bib1))。因此,现有的事件提取数据集不足以满足施工事故因果信息提取(Causal Information Extraction, CIE)的需求,后者需要领域术语、工程背景和模糊的因果语言(Chen et al., 2024 (https://arxiv.org/html/2608.06495#bib.bib2);Norouzi et al., 2025 (https://arxiv.org/html/2608.06495#bib.bib24);Fu and Dai, 2026 (https://arxiv.org/html/2608.06495#bib.bib7))。 参见图注Figure 1:一个事故报告示例及其提取出的设备因素(Equipment Factors),包括防护设备状况(Protective Equipment Condition)和工作设备状况(Work Equipment Condition)子因果因素。为了解决上述局限性,我们引入了ConstructCIE,一个从事故叙述中进行CIE的建筑领域专用数据集。该数据集基于2011年到2023年间发布的530份美国职业安全与健康管理局(OSHA)事故调查报告摘要(Occupational Safety and Health Administration (https://arxiv.org/html/2608.06495#bib.bib25))。ConstructCIE支持事故类型预测以及因果因素、子因果因素和支持性证据的层级化提取。与传统事件提取数据集不同,它专门针对建筑事故分析中无触发词、长跨度且可能不连续的因果证据。 本研究主要有三个贡献:(1)我们引入了ConstructCIE,一个建筑领域专用的CIE数据集,基于OSHA事故叙述构建,标注了事故类型、因果因素、子因果因素和支持性证据。(2)我们提出了一个层级化的施工事故因果模式,涵盖事故类型、广泛的因果因素和细粒度的子因果因素。(3)我们在联合和单独层级化提取策略下对监督方法和基于LLM的方法进行了端到端评估,揭示了广泛的因果恢复与精确证据提取之间存在的持续性差距。 ## 2 相关工作 **施工事故本体** 早期安全科学研究定义了丰富的理论分类法,用于描述系统性事故因果关系背后的复杂互动因素(Perrow, 1984 (https://arxiv.org/html/2608.06495#bib.bib26);Reason, 1997 (https://arxiv.org/html/2608.06495#bib.bib30))。后续分析框架,如HFACS(Wiegmann and Shappell, 2003 (https://arxiv.org/html/2608.06495#bib.bib37))和STAMP(Leveson, 2012 (https://arxiv.org/html/2608.06495#bib.bib17)),将人类、组织及系统层面的风险因素形式化为层级化类别,以支持事故分析和安全专家之间的沟通。近年来,自然语言处理研究侧重于组织具体的施工相关危害,例如面向铁路事故的风险知识图谱(Risk Knowledge Graph in Railway Safety, RKGRS)(Liu and Yang, 2022 (https://arxiv.org/html/2608.06495#bib.bib19)),以及针对撞击事故的特定实体词典(Zhou et al., 2025 (https://arxiv.org/html/2608.06495#bib.bib42))。然而,现有的事件提取基准如ACE05和WikiEvents依赖通用领域本体(Doddington et al., 2004 (https://arxiv.org/html/2608.06495#bib.bib6);Li et al., 2021 (https://arxiv.org/html/2608.06495#bib.bib18)),而近期安全领域的提取流程仍侧重于局部的、文本中明确陈述的因果片段,而非密集的多跳因果图构建(Chen et al., 2026 (https://arxiv.org/html/2608.06495#bib.bib4))。因此,现有本体往往过于理论化、受限于句子边界,或只针对特定事故类型,限制了它们在跨多样施工事故的文档级因果信息提取中的适用性。 **因果信息提取** 早期的CIE工作依赖于模式匹配和基于规则的方法,利用显式语言线索来识别因果关系(Khoo et al., 1998 (https://arxiv.org/html/2608.06495#bib.bib15), 2000 (https://arxiv.org/html/2608.06495#bib.bib14))。随着基于Transformer模型的引入,预训练语言模型如BERT使得对复杂、隐性因果关系的建模更加灵活(Devlin et al., 2019 (https://arxiv.org/html/2608.06495#bib.bib5))。一种常见方法是使用BERT对包含两个目标事件提及的上下文进行编码,并在生成的事件表示上应用分类器来预测事件是否具有因果关系(Wu et al., 2023 (https://arxiv.org/html/2608.06495#bib.bib39))。然而,简单的事件对上下文编码可能不够,因为它没有显式纳入更广泛的语义结构,例如以事件为中心的表示和事件关联路径,而这些有助于捕获事件之间隐含的因果依赖关系(Hu et al., 2023 (https://arxiv.org/html/2608.06495#bib.bib11))。此外,真实世界的因果结构往往以复杂的多对一或一对多关系交织在一起(Chen et al., 2025 (https://arxiv.org/html/2608.06495#bib.bib3)),并且与因果事件相关的论元往往是隐性的,或分布在碎片化的文本证据中,而不是以清晰界定的局部片段形式表达(Sharif et al., 2024 (https://arxiv.org/html/2608.06495#bib.bib33))。为了捕获这些复杂的相互依赖关系,最近的研究利用了大型语言模型(LLMs)、自动提示工程和图神经网络(GNNs)进行多跳因果推理(Chen et al., 2025 (https://arxiv.org/html/2608.06495#bib.bib3);Yan, 2025 (https://arxiv.org/html/2608.06495#bib.bib40))。尽管取得了这些进展,CIE在施工安全领域仍未得到充分探索。以往施工安全研究主要依赖结构化或表格化的事故报告字段,而叙述性事故报告尽管包含关于事故情况、根本原因和促成因素的更丰富背景信息,却相对未被充分利用(Ray et al., 2025 (https://arxiv.org/html/2608.06495#bib.bib29))。这一差距凸显了构建一个施工领域专用CIE基准的必要性,以支持从非结构化事故叙述中进行文档级因果因素和支持性证据提取,尤其是在这些信息是隐性的、碎片化的或分布在报告多个部分的情况下。 因果因素 | 子因果因素 | 定义 | 子因果因素类型 ---|---|---|--- 工作环境(Working Circumstances) | 施工工种(Construction Trade) | 工作环境描述事故发生的物理和操作背景,而施工工种则识别所进行的主要施工活动。 | 分类(Classification) 涉及物体(Object Involved) | 不适用(N/A) | 涉及物体捕获了与事故机制发生物理互动或促成事故机制的设备、结构、材料或物体。 | 不适用(N/A) 管理因素(Managerial Factors) | 危害管理失败(Failure of Hazard Management) | 管理因素捕获组织或监督层面的缺陷,而该子因素识别在规划或风险评估过程中未能识别可预见危害的失败。 | 提取(Extraction) 管理因素(Managerial Factors) | 安全培训不足(Deficiency in Safety Training) | 管理因素捕获组织或监督层面的缺陷,而该子因素识别任务特定安全培训的不足。 | 提取(Extraction) 设备因素(Equipment Factors) | 防护设备状况(Protective Equipment Condition) | 设备因素捕获与设备相关的促成因素,而该子因素识别防护设备缺失、不可用、不充分或配置不当。 | 提取(Extraction) 设备因素(Equipment Factors) | 工作设备状况(Work Equipment Condition) | 设备因素捕获与设备相关的促成因素,而该子因素识别涉及工具或机械的不安全状况、缺陷、配置问题或可用性问题。 | 提取(Extraction) 工作条件因素(Working Condition Factors) | 天气状况(Weather Condition) | 工作条件因素捕获物理工作环境方面的促成因素,而该子因素识别影响工作环境或事故序列的天气条件。 | 提取(Extraction) 工作条件因素(Working Condition Factors) | 工作空间状况(Workspace Condition) | 工作条件因素捕获物理工作环境方面的促成因素,而该子因素识别工作空间中不安全的空间、结构、表面、支撑或布局条件。 | 提取(Extraction) 行为因素(Behavioral Factors) | 疏忽行为(Inattentive Behavior) | 行为因素捕获任务层面的人类行为或疏漏,而该子因素识别分心、警觉性降低或情境意识丧失。 | 提取(Extraction) 行为因素(Behavioral Factors) | 违规行为(Noncompliant Behavior) | 行为因素捕获任务层面的人类行为或疏漏,而该子因素识别无视安全规则、安全作业规范或要求的防护措施。 | 提取(Extraction) 后果(Consequences) | 严重程度(Severity) | 后果捕获事故结果,而该子因素将伤害严重程度从轻伤到死亡进行分类。 | 分类(Classification) 后果(Consequences) | 受影响身体部位(Affected Body Part) | 后果捕获事故结果,而该子因素识别事件中受到伤害的一个或多个身体部位。 | 提取(Extraction) 表1:施工事故的因果因素分类法、行级定义及子因果因素类型。详细定义见附录A (https://arxiv.org/html/2608.06495#A1)。 ## 3 ConstructCIE数据构建 ### 3.1 任务定义 **事故类型**(accident type)代表高层级的事故机制。我们考虑四种事故类型:**高处坠落**(fall)、**物体撞击**(struck\-by)、**夹挤/卡入**(caught\-in/between)和**触电**(electrocution)。**因果因素**(causal factor)是解释事故如何发生或为何发生的条件、行动、失败或环境。**子因果因素**(sub\-causal factor)是一个细粒度类别,用于具体说明因果证据的类型。 给定一份事故叙述,CIE旨在生成事故类型、因果因素、子因果因素和证据的层级结构。在端到端设置中,模型首先从报告中预测事故类型。然后,它识别叙述中存在的因果因素,并提取其支持性文本片段。对于每个因果因素,模型进一步预测关联的子因果因素信息。根据子因果因素的不同,该步骤被建模为分类任务或片段提取任务。例如,在图1 (https://arxiv.org/html/2608.06495#S1.F1)中,**设备因素**(Equipment Factors)这一因果因素由可进一步划分为**防护设备状况**和**工作设备状况**的证据支持。 该任务不同于传统的以触发词为中心的事件提取。在标准EE中,模型通常识别显式事件触发词,并提取与这些触发词相关的局部论元(Doddington et al., 2004 (https://arxiv.org/html/2608.06495#bib.bib6))。相反,在施工事故叙述中,关键信息不仅在于发生了什么,还在于为什么发生,因果证据通过分布在多个句子中的长跨度来表达(Hershowitz et al., 2024 (https://arxiv.org/html/2608.06495#bib.bib9);Chen, 2025 (https://arxiv.org/html/2608.06495#bib.bib1))。此外,一个单独的因果因素可能由需要进一步分解为多个子因果因素的证据支持,而某些子因果因素需要分类而不是直接的片段提取。这要求将事故背景、领域术语和隐含因果关系联系起来。 ### 3.2 因果模式创建 我们使用一个建筑专用的层级框架来定义CIE。每份报告被赋予一个顶层事故类型(Acc.),随后是两级因果模式。事故类型代表整体事故机制,因果因素代表广泛的事故促成因素,子因果因素则捕获细粒度的条件、失败、行为或结果。 如表1 (https://arxiv.org/html/2608.06495#S2.T1)所示,该模式包含七个主要因果因素:**工作环境**(Working Circumstances)、**涉及物体**(Object Involved)、**管理因素**(Managerial Factors)、**工作条件因素**(Working Condition Factors)、**设备因素**(Equipment Factors)、**行为因素**(Behavioral Factors)和**后果**(Consequences)。其简称分别为Work. Circ.、Obj. Inv.、Mgmt.、Cond.、Equip.、Behav.和Conseq.。该模式进一步定义了子因果因素,如**施工工种**(Construction Trade)、**工作空间状况**(Workspace Condition)、**防护设备状况**(Protective Equipment Condition)、**工作设备状况**(Work Equipment Condition)、**疏忽行为**(Inattentive Behavior)、**违规行为**(Noncompliant Behavior)和**受影响身体部位**(Affected Body Part)。表1 (https://arxiv.org/html/2608.06495#S2.T1)提供了所有因素定义和预测类型。 该模式来源于建筑施工安全文献中关于管理、环境、设备相关和行为的
相似文章
超越大语言模型:从叙事文本生成因果图的语言学方法
本文提出了一种混合框架,结合了LLM摘要、语言学基础的专家指数(Expert Index)以及STAC分类,用于从叙事文本生成因果图,在基准故事上超越了GPT-4o和Claude 3.5。
Causal-Audit:通过目标感知因果链构建实现显式可审计的图推理
提出了Causal-Audit框架,该框架通过目标感知因果图构建和路径级证据聚合,实现大语言模型中显式且可审计的因果推理,在多个基准测试上优于现有方法。
CausaLab: 面向AI科学家的可扩展交互式因果发现环境
CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。
LMT: 一种从制造系统文本告警记录中进行因果发现的贝叶斯框架
本文提出了LMT,一种贝叶斯因果发现框架,它结合了从文本告警记录中由LLM提取的语义信号和基于时间戳的统计证据,以推断制造系统中的因果图。
使用大语言模型在危机报告中提取和三角验证因果证据:基于ReliefWeb的研究
本文提出了一种两阶段的大语言模型流水线,用于从人道主义危机报告中提取和三角验证因果证据,在ReliefWeb数据集上取得了较高的F1分数,并提出了一种证据水平评分,用于衡量跨情境的一致性。