G-SHARE:一种基于指南的结构化推理框架,用于人因事件诊断
摘要
G-SHARE 是一种基于指南的结构化推理框架,用于核电站人因事件诊断。它将九步诊断指南操作化为一个多阶段流水线,包括证据提取、逐步推理和一致性修复,性能优于一次性大语言模型提示和传统基线方法。
arXiv:2607.11892v1 公告类型:新
摘要:人因事件诊断对于从核电站运行事件中学习至关重要,但其质量在很大程度上取决于专家对叙述性报告的解释和基于指南的推理。现有的数据驱动或一次性大语言模型方法通常缺乏结构化推理,与正式诊断指南的一致性有限,并且可能产生逻辑上不一致的结论。为了解决这一问题,本研究提出了 G-SHARE,一种基于指南的结构化推理框架,将中国核工业(CNNP)九步人因事件诊断指南操作化为一个多阶段诊断流水线。该框架包括证据提取、逐步诊断推理和事后一致性修复,能够显式使用报告证据、生成中间推理过程,并对诊断输出进行逻辑验证。从中国核工业来源构建了一个真实的人因事件报告数据集,并使用由领域专家注释的金标准子集进行评估。结果表明,G-SHARE 大幅优于一次性提示和传统机器学习基线,最强版本在整体准确率和宏 F1 上均达到最佳。消融结果进一步表明,结构化推理和一致性强制对于稳健诊断至关重要,尤其是在弱提示条件下。这些发现证明了将专家诊断指南转化为可审计推理工作流程的价值,为安全关键行业中的智能人因分析提供了实用途径。
查看缓存全文
缓存时间: 2026/07/15 04:21
# G-SHARE:一种基于指南的结构化推理框架用于人因事件诊断 来源:https://arxiv.org/html/2607.11892 \\tnotetext[1]本研究得到国家自然科学基金(批准号:T2192933)、中国核工业集团有限公司领创研究项目、人因工程全国重点实验室基金(批准号:HFNKL2024W07)以及清华大学自主科研计划的支持。[style=chinese] \\credit[style=chinese] 概念化、方法论、软件、形式化分析、数据整理、可视化、验证、撰写初稿。 \\credit[style=chinese] 调研、资源、验证、撰写-审阅与编辑。 \\credit[style=chinese] 概念化、形式化分析、监督、撰写-审阅与编辑。 \\credit[style=chinese] 监督、撰写-审阅与编辑。 \\credit[style=chinese] 监督、撰写-审阅与编辑。 1]organization=清华大学核能与新能源技术研究院,城市=北京,邮编=100084,国家=中国 2]organization=人因工程全国重点实验室,城市=北京,邮编=100094,国家=中国 3]organization=福建福清核电有限公司,城市=福建,邮编=350318,国家=中国 ###### 摘要 人因事件诊断对于从核电厂运行事件中学习至关重要,但其质量高度依赖专家对叙事性报告的解释和基于指南的推理。现有的数据驱动或一次性大语言模型方法通常缺乏结构化推理,与正式诊断指南的一致性有限,且可能产生逻辑不一致的结论。为解决这一问题,本研究提出G-SHARE,一种基于指南的结构化推理框架,将CNNP九步人因事件诊断指南转化为一个多阶段诊断管道。该框架包括证据提取、逐步诊断推理和事后一致性修复,能够显式使用报告证据、生成中间推理过程并对诊断输出进行逻辑验证。从中国核工业来源构建了真实人因事件报告数据集,并使用了由领域专家标注的金标准子集进行评测。结果表明,G-SHARE显著优于一次性提示和传统机器学习基线,最强版本在总体准确率和宏F1上均达到最佳。消融结果进一步表明,结构化推理和一致性强制对于稳健诊断至关重要,尤其是在弱提示条件下。研究结果证明了将专家诊断指南转化为可审计推理工作流的价值,为安全关键行业中的智能人因分析提供了实用途径。 ###### 关键词:人因事件诊断;核电厂安全;大语言模型;结构化推理;基于指南的决策;约束一致性;可解释性;安全关键系统 ## 1 引言 人因事件诊断在从运行事件中学习和提升核电厂安全绩效方面发挥着关键作用(poller2020human)。在异常事件发生后,需进行系统分析以识别人为错误、理解其潜在机制,并支持制定纠正和预防措施(anu2018development)。在实践中,该过程不仅仅是对事件进行简单分类,还要求分析人员重建事件序列、解读操作人员行为,并根据既定的诊断指南评估认知和情境因素(kim2019influencing)。然而,事件报告通常是叙事性和半结构化的,关键信息分散在零散的文本描述中(mueller2019episodic)。因此,分析人员必须手动提取相关证据并将其综合为连贯的诊断解释。尽管中国核工业开发的九步人因事件诊断指南等正式程序提供了结构化的分析原则,但其执行仍然高度依赖专家判断(mayfield2008organizational)。这导致效率、一致性和可重现性受限,尤其是在处理大量事件数据时(zwanenburg2019radiomics)。因此,需要一种更加结构化和可重现的人因事件诊断方法,该方法能够保留专家推理逻辑,同时减少对纯手动分析的依赖(zarei2023account)。 近期人工智能的进步推动了支持或自动化事件分析的研究(homes2004artificial)。传统机器学习方法通常将任务形式化为文本分类问题,直接将事件报告映射到预定义的诊断类别(young2019systematic)。虽然这类方法可以实现合理的预测性能,但它们缺乏显式的推理过程,也未融入领域特定的诊断指南,导致输出难以解释和验证(arocha2005identifying)。近年来,大语言模型被应用于事件分析,通过自由形式的提示利用其强大的语言理解能力生成诊断结论(da2025flans)。然而,这类方法通常产生不受约束的输出,可能忽略关键证据、推理中存在不一致性,或结论与中间分析不符(hunter1998managing)。在安全关键领域,这些局限性引发了关于可靠性、透明度和可审计性的担忧(rausand2014reliability)。同时,现有的人因可靠性分析方法和事件分析工具提供了评估人因绩效的结构化框架,但并非设计用于通过基于指南的推理处理叙事性报告(lekadir2025future)。特别是,目前仍缺乏将正式诊断指南显式转化为机器可执行推理过程的方法。因此,当前方法的关键局限性不仅在于预测准确性,还在于缺乏一种结构化的、与指南对齐的推理机制来支持透明可靠的人因事件诊断(poller2020human)。 在工业实践中,像CNNP九步人因事件诊断程序这样的诊断指南代表了专家知识的宝贵积累(tang2018automatic),它定义了如何解读事件信息、如何识别因果因素(meyer2011experience)以及如何对人为错误进行分类。然而,这些指南主要用于人工操作,尚未完全转化为计算框架(mitchell2014review)。具体来说,缺乏能够将此类指南转化为机器可读推理阶段、系统地从叙事性报告中提取和利用证据、加强中间推理与最终结论之间的一致性(mayer2021enhancing)以及产生可重现和可审计诊断输出的方法。弥补这一差距需要桥接专家定义的分析程序与数据驱动或基于语言的模型(withers2025natural)。因此,一个核心问题是如何将领域诊断指南转化为既保留专家逻辑又支持可扩展和可审计的AI辅助分析的结构化推理框架(surisetty2025ai)。 为应对这一挑战,本研究提出一种基于指南的结构化推理框架用于人因事件诊断,称为G-SHARE。该框架将CNNP九步诊断指南转化为一个多阶段推理过程,整合了证据提取、逐步诊断和基于逻辑的一致性修复。通过这种方式,它能够显式使用报告证据、结构化生成中间推理过程并验证诊断一致性。构建了一个真实世界的人因事件报告数据集,并包含由领域专家标注的金标准子集用于评测。结果表明,所提出的框架与一次性大语言模型方法和传统机器学习方法相比,提升了诊断性能,同时提供了更透明和可审计的推理过程。更广泛地说,这项工作展示了将专家诊断指南转化为机器可执行工作流的实用途径,有助于在安全关键领域发展可信赖的AI辅助分析。 本文其余部分组织如下:第2节介绍背景和问题形式化;第3节提出所提框架;第4节描述实验设计;第5节给出结果;第6节讨论本工作的意义和局限性;第7节总结全文。 ## 2 相关工作 ### 2.1 人因事件分析与诊断方法 人因事件分析是核能、航空和化工等高可靠性行业安全管理的基本组成部分(bevilacqua2018human)。过去几十年中,开发了多种人因可靠性分析(HRA)方法来支持人为错误的识别、量化和解释(levine2024identifying)。经典方法包括THERP、SPAR-H以及最近如IDHEAS等框架,它们通过分解任务、识别绩效塑造因子(pt2002therapeutic)和估计错误概率,提供了分析人因绩效的结构化程序。这些方法显著提升了对人因错误机制及其对系统安全性影响的系统性理解(gertman1992intent)。 除了概率性HRA方法外,事件调查和诊断框架在实际操作中被广泛应用,用于分析真实世界的事故(ahmad2021can)。这些方法通常通过结构化分析程序,重点重建事件序列、识别因果因素并确定人为错误的性质(strauch2017investigating)。在核能背景下,诊断指南——例如中国核工业开发的九步人因事件诊断程序——提供了详细的指导,指导分析人员如何从事件报告中提取证据、解读操作人员行为、评估情境条件(stanton2017human),并最终对人因事件进行分类。此类指南强调一种逐步推理过程,整合多种信息源并支持一致决策(hasic2018augmenting)。 尽管具有优势,现有的人因分析和诊断方法主要设计用于手动执行,且高度依赖专家判断(stanton2017human)。分析过程通常耗时且需要大量领域专业知识,尤其是在处理叙事性和半结构化事件报告时(henriksen2022methods)。此外,不同分析人员之间的差异可能导致诊断结果不一致,且推理过程并不总是以可重现的方式完整记录(shinkins2013diagnostic)。虽然这些方法提供了定义良好的分析原则,但它们缺乏将诊断程序直接转化为机器可执行工作流的计算机制(liu2018generating)。因此,在正式诊断指南与其在大规模或数据驱动分析环境中的实际实施之间仍存在差距(ikegwu2022big)。现有方法提供了结构化概念框架,但并未明确支持将基于指南的推理转化为自动化、可重现和可审计的诊断过程(lichtner2023automated)。 ### 2.2 基于AI的事件分析与文本诊断方法 随着运行数据的日益丰富和自然语言处理技术的进步,人工智能(AI)技术被探索用于支持事件分析和人因诊断(mah2022natural)。早期研究主要采用传统机器学习方法,将文本事件报告转化为特征表示(如TF-IDF)(al2022document),随后使用逻辑回归、随机森林和梯度提升等方法进行分类(lombardo2015binary)。这些方法能够自动处理大量报告并实现合理的预测性能。然而,它们通常将任务视为从文本到标签的直接映射(minaee2021deep),没有显式建模潜在的推理过程或融入领域特定的诊断知识。因此,其输出往往难以解释,且可能与既定的分析程序不一致(fortsch2018systematizing)。 最近,大语言模型(LLMs)在理解和生成自然语言方面展现了强大能力,被应用于事件分析任务(karanikolas2023large)。通过利用基于提示的技术,LLMs能够生成诊断结论及文本解释,为传统分类器提供了更灵活的替代方案(liu2019towards)。特别是,一次性或少量提示方法无需大量任务特定训练即可快速部署,使这些模型在实际应用中具有吸引力(hogstrom2010create)。然而,此类方法通常基于自由形式生成,推理过程未显式受约束。因此,模型可能忽略关键证据,产生不完整或不一致的推理链,或生成未被输入报告充分支持的结论(sun2025survey)。这些问题在安全关键领域尤为令人担忧,因为诊断结果必须可靠、透明且可验证(height2012practical)。 与此同时,AI技术也被应用于更广泛的安全分析任务,如事故报告分类、风险因素识别(wang2022artificial)和事件摘要生成。尽管这些研究展示了AI在处理非结构化安全数据方面的潜力,但它们通常侧重于提高预测准确性或文本理解,而非复现领域专家使用的结构化推理过程(tenenbaum2011grow)。特别是,在将正式诊断指南融入AI模型(sharma2025integration)或确保中间推理步骤与最终诊断结果之间的一致性方面,受到的关注有限。 总体而言,现有的基于AI的方法提供了处理文本数据的强大工具,但未能完全满足安全关键环境中人因事件诊断的要求(badhan2025artificial)。关键局限性不仅在于模型性能,还在于缺乏能够支持透明、一致和可审计诊断过程的结构化且与指南对齐的推理机制(lin2025performance)。 ### 2.3 结构化推理与指南驱动的AI系统 为提高AI系统的可靠性和可解释性,近期研究探索了结构化推理方法,显式地将复杂任务分解为中间步骤(li2022interpretable)。此
相似文章
当答案未出,安全先溃:评测推理链中的有害行为检测
研究者发布 HarmThoughts 基准,含 1,018 条推理轨迹、56,931 句细粒度标注,用于逐步评估有害行为如何在推理过程中浮现,并揭示现有检测器对微妙不安全推理转折的盲区。
GuideSkill:为基于指南的临床推理进化可执行LLM智能体技能
介绍GuideSkill,一种外部推理层,将临床实践指南编译为可执行的诊断技能,在无需更新骨干模型的情况下提高LLM在临床推理基准上的准确性。
面向多模态核监管文件多跳推理的LLM引导规划
本文将监管文件审查问题建模为LLM引导的规划问题,采用无向量文档树,配备浏览、读取和搜索工具,并以动态知识图谱作为状态。在针对NuScale FSAR文档的200个问题基准测试中,该系统达到了81.5%的准确率和0.93的RAGAS忠实度,显著优于现有RAG方法。
面向安全的假设演绎框架用于AI辅助鉴别诊断
AegisDx是一个面向安全的框架,它利用专门的LLM组件和验证门进行假设演绎临床推理,在医学病例报告上,将鉴别诊断准确率比单独的LLM提高了7-17个百分点。
指令层级失效之处:诊断与修复推理语言模型中的故障
本文引入了一个白盒诊断框架,将推理语言模型中的指令层级故障定位为识别、冲突解决和响应实现三个阶段。该框架评估了多个模型,并提出了两种无需训练的自我监控机制,可将违规率降低81%–99%。