SafeLLM:在安全关键场景中,提取作为重写的抗幻觉替代方案

arXiv cs.CL 论文

摘要

本文提出SafeLLM,一种基于提取的方法,用于从安全关键文档中检索信息,表明行号选择在减少幻觉的同时保持高召回率方面优于基于重写的RAG方法。

arXiv:2606.12897v1 公告类型:新 摘要:大语言模型(LLMs)越来越多地用于访问组织文档,包括标准操作程序(SOP)、人力资源政策和机构指南。然而,依赖自由形式重写的检索增强生成(RAG)系统可能会引入幻觉,并在完整性与简洁性之间产生不稳定的权衡,尤其是在安全和合规关键场景中。目标:评估提取作为基于重写的RAG的抗幻觉替代方案,并比较在不同文档类型和模型规模下平衡精确度、召回率和安全的策略。方法:我们比较了多种提示策略,包括基于行号的源选择、提取带有明确安全注释的相关指南句子,以及一个多阶段流水线,该流水线利用源指南中的支持证据来完善草稿答案。实验在长度和结构各异的文档上进行,包括当地NHS急症护理和肿瘤指南以及全英NICE指南,使用前沿级和本地可部署模型。性能通过自动指标和人类专家对相关性和完整性的评估来衡量。结果:行号选择取得了最强结果,在大型和小型模型上均优于直接复制和以安全为重点的策略,同时保持高术语召回率(高达95%)并与源文本紧密对齐。以安全为导向的方法提高了精确度,但引入了系统性遗漏,而多阶段过滤进一步放大了这种权衡。性能随文档结构而变化:基于行的提取在类似协议的内容中表现出色,而替代策略在更冗长的文档上表现更好(术语召回率高达97%)。
查看原文
查看缓存全文

缓存时间: 2026/06/12 08:50

# SafeLLM:在安全关键场景中,提取作为重写的抗幻觉替代方案 来源:https://arxiv.org/html/2606.12897 Julia Ive 伦敦大学学院健康信息学研究所,英国伦敦 这些作者贡献相同:Julia Ive, Felix Jozsa julia\.ive@ucl\.ac\.uk Felix Jozsa 伦敦大学学院健康信息学研究所,英国伦敦 伦敦皇后广场国家神经病学和神经外科医院,英国伦敦 这些作者贡献相同:Julia Ive, Felix Jozsa Nabeel Sheikh 萨默塞特NHS基金会信托,英国 Emma Cattell 萨默塞特NHS基金会信托,英国 Nick Jackson 伦敦国王学院医院,丹麦山,英国伦敦 Paulina Bondaronek 伦敦大学学院健康信息学研究所,英国伦敦 Ciaran Scott Hill 伦敦皇后广场国家神经病学和神经外科医院,英国伦敦 Richard Dobson 伦敦大学学院健康信息学研究所,英国伦敦 伦敦国王学院,英国伦敦 ###### 摘要 背景:大型语言模型(LLMs)越来越多地被用于访问组织文档,包括标准操作规程(SOP)、人力资源政策和机构指南。然而,依赖自由形式重写的检索增强生成(RAG)方法可能会引入幻觉,并在完整性和简洁性之间产生不稳定的权衡,尤其是在安全和合规关键的场景中。 目标:评估提取作为一种抗幻觉替代方案,以取代基于重写的RAG,并比较在文档类型和模型规模之间平衡精确度、召回率和安全性的策略。 方法:我们比较了多种提示策略,包括基于行号的来源选择、提取相关指南句子并显式注释安全相关内容,以及一个多阶段流程,该流程使用来自源指南的支持证据来完善草稿答案。所有方法都优于依赖模型从源文档复制相关文本的直接提示。实验在长度和结构各异的文档(急性护理和肿瘤学领域的本地NHS指南,以及英国范围的NICE指南)上进行,使用了前沿规模和小型可本地部署的模型。性能通过自动指标和人类专家对相关性和完整性的评估来衡量。 结果:行号选择取得了最强的结果,在大模型和小模型上都优于直接复制和专注安全的策略,同时保持了高术语召回率(高达95%)且与源文本高度一致。安全导向的方法提高了精确度,但引入了系统性的遗漏,多阶段过滤进一步放大了这种权衡。性能因文档结构而异:基于行的提取在协议式内容中表现出色,而其他策略在更冗长的文档中显示出优势(术语召回率高达97%)。 结论:行号选择为访问组织文档提供了一种稳健的替代方案,以取代基于重写的RAG。在超长文档设置中,基于草稿的方法可能提供额外的好处。这些发现强调了根据文档结构、模型规模和遗漏风险调整检索策略的重要性。 ## 引言 行政和操作文档,包括临床指南、标准操作规程(SOP)和组织政策,为决策和任务执行提供了基于共识的指导[9 (https://arxiv.org/html/2606.12897#bib.bib23)]。在各个领域,遵守此类文档是良好专业实践的核心要求,并与提高安全性、合规性和操作一致性相关[22 (https://arxiv.org/html/2606.12897#bib.bib21),12 (https://arxiv.org/html/2606.12897#bib.bib22),5 (https://arxiv.org/html/2606.12897#bib.bib24),27 (https://arxiv.org/html/2606.12897#bib.bib25),1 (https://arxiv.org/html/2606.12897#bib.bib28),17 (https://arxiv.org/html/2606.12897#bib.bib29),3 (https://arxiv.org/html/2606.12897#bib.bib30)]。在实践中,高层指导由本地或部门文档补充,这些文档将建议调整到特定的工作流程、约束和组织结构。用户查阅这些资源以回答专注的、面向任务的问题,例如,应采取哪些行动,需要哪些批准,或如何升级情况。然而,它们的使用常因复杂性和时间压力而受阻[21 (https://arxiv.org/html/2606.12897#bib.bib32),25 (https://arxiv.org/html/2606.12897#bib.bib34),7 (https://arxiv.org/html/2606.12897#bib.bib35),26 (https://arxiv.org/html/2606.12897#bib.bib42)],这些挑战因工作量增加和文档数量增长而加剧[24 (https://arxiv.org/html/2606.12897#bib.bib36),4 (https://arxiv.org/html/2606.12897#bib.bib37),10 (https://arxiv.org/html/2606.12897#bib.bib38)]。在高风险或时间关键的环境中,这些限制可能导致延迟、错误或不遵守。 大型语言模型(LLMs)为基于文档的问答(Q&A)提供了一种有前景的方法[23 (https://arxiv.org/html/2606.12897#bib.bib18)],但它们的部署受到幻觉的限制,即生成的内容没有源证据支持[20 (https://arxiv.org/html/2606.12897#bib.bib17)]。检索增强生成(RAG)通过将响应基于检索到的文档来缓解这一问题[14 (https://arxiv.org/html/2606.12897#bib.bib16)],提高了事实一致性[18 (https://arxiv.org/html/2606.12897#bib.bib13)]。然而,它并不能完全消除错误:模型可能会遗漏关键步骤,引入无关细节,或无法忠实地再现源文本,在安全和合规敏感的环境中带来风险[16 (https://arxiv.org/html/2606.12897#bib.bib15),2 (https://arxiv.org/html/2606.12897#bib.bib14),12 (https://arxiv.org/html/2606.12897#bib.bib22),13 (https://arxiv.org/html/2606.12897#bib.bib12)]。 基于文档的问答中的一个核心挑战是平衡解释与忠实再现。有些查询需要整合分布在多个部分的信息,或将条件指令调整到特定场景。另一些则需要精确、逐字的再现以保留意义,特别是当确切措辞具有操作或监管意义时。当前的方法侧重于提高生成质量,而不是控制何时应该生成[12 (https://arxiv.org/html/2606.12897#bib.bib22),13 (https://arxiv.org/html/2606.12897#bib.bib12)]。在这里,我们采取相反的方法:我们最小化生成。我们约束模型通过提取直接操作源文本,使其能够识别和呈现相关信息而无需重写。这将任务从答案生成重新定义为证据选择,减少了幻觉的机会,同时保持对源材料的忠实度。 我们的主要贡献是开发和评估一个用于临床问答用例的提取框架,该框架最小化幻觉,同时平衡添加信息与遗漏临床关键细节的风险。与基于重写的方法相比,我们将LLMs约束为选择和复制指南文本,旨在高度忠实于源材料,这是措辞上的微小不准确(例如,药物剂量、禁忌症或升级标准)可能影响患者安全的环境中的基本要求。 我们在多个长度和结构各异的指南用例中评估了这种方法,包括来自伦敦大学学院医院(UCLH)的简洁急性护理协议、来自萨默塞特NHS信托的肿瘤学导向机构指南,以及大型国家建议(NICE)。这些设置捕捉了一系列现实世界决策场景。我们使用基于这些文档的人类专家开发的问答对进行评估,反映了时间压力下的实际临床信息需求。我们还评估了各种LLM配置的性能,包括开放权重和商业模型,以表征跨部署场景的稳健性。我们主张,约束LLMs比试图让它们成为更好的生成器,为在安全关键的临床环境中部署提供了更可靠的途径。 ## 方法 ### 伦理考量 本研究已获得UCL审查委员会批准(编号:TRE-467283),并作为一项临床服务审计获得伦敦大学学院医院(UCLH)国家神经病学和神经外科医院批准(编号:130-202425-SE)。本研究中使用的指南数据不包含患者级别或个人身份信息。所有材料均来自用于专业用途的机构临床指南,因此不会对患者隐私构成风险。 ### 数据 我们评估了三种数据集的方法,涵盖不同的文档风格和规模:简洁的急性护理指南(UCLH)、中等长度的机构指南(萨默塞特NHS信托)和大型国家建议(NICE)。 UCLH数据集包含96个临床基础的问题,分为24个急性护理主题,由FJ和NJ设计,以反映一线临床医生遇到的现实世界场景。主题包括,例如,急性冠脉综合征,其中问题探究升级决策(例如,“如果一线治疗未能缓解症状,何时应使用第二剂?”),以及急性肾损伤,侧重于调查和管理步骤(例如,“入院时哪些血液检查是必需的?”)。参考答案通过直接选择相关指南行构建,以确保基于源材料。 萨默塞特NHS信托数据集遵循类似的问题设计过程,但在注释策略上有所不同。在这里,参考答案完全通过临床医生自由写作(NS和FJ)生成。这些指南主要是肿瘤学导向的,涵盖了癌症及其治疗的急性并发症,例如,中性粒细胞减少性败血症、代谢紊乱和治疗相关毒性。尽管长度适中,但它们具有很强的急性性质,通常关注易感患者群体中时间关键的识别、升级和稳定决策。 相比之下,NICE数据集是根据Ding等人[6 (https://arxiv.org/html/2606.12897#bib.bib3)]的协议合成生成的,使用gpt-4o-mini从完整长度的建议文档中生成临床场景-问题-指南段落三元组。为了反映真实的模型输入,我们将场景描述和相关问题合并为一个输入提示。所有生成的输出随后由人类专家手动审查以确保临床有效性。该数据集包含与场景相关的输入,例如,在慢性肾病或心力衰竭管理中。一个代表性示例是:“一名68岁有高血压和2型糖尿病病史的患者,表现出进行性疲劳和脚踝肿胀数周。血液检查显示eGFR降低和肌酐升高。根据当前指南,应进行哪些调查和初始管理步骤,何时应考虑专科转诊?”这与UCLH和萨默塞特中较短、聚焦的查询形成对比,例如:“急性肾损伤中哪些血液检查是必需的?”(见表LABEL:tab:task_questions_long和LABEL:tab:oncology_questions)。 所有底层指南文档都使用pdftotext工具从PDF文件中提取,以保留原始措辞,然后进行手动清理以移除目录、校正格式伪影并确保忠实于源内容。 在数据集中,问题的表述差异很大,从UCLH中的简洁查询(平均9.6个词)到NICE中较长的基于场景的输入(平均45.9个词),萨默塞特NHS信托处于中间位置。重要的是,指南语料库在长度上相差一个数量级:短篇UCLH文档(平均746词)、中等长度的萨默塞特NHS信托指南(平均3153词)和长篇NICE建议(平均5224词;最大8007词)(表1 (https://arxiv.org/html/2606.12897#Sx2.T1))。 表1:评估数据集的汇总统计,涵盖三种文档长度范围:简洁急性护理指南(UCLH)、中等长度机构指南(萨默塞特NHS信托)和大型国家建议(NICE)。值以均值(最小-最大)报告。 ### 基于指南的临床问答的提示策略 本节概述了本研究评估的方法,从基于用户问题和指南文本之间语义相似性的基线检索方法开始。然后,我们展示了一组提示流程方法,这些方法结合了初始主题识别步骤与不同的提示机制,用于从临床指南中提取相关证据(见图1 (https://arxiv.org/html/2606.12897#Sx2.F1),方法总结见表2 (https://arxiv.org/html/2606.12897#Sx2.T2))。 参考图标题 图1:提出的指南问答流程概览。给定用户问题,系统首先执行主题选择,从指南索引中识别最相关的临床指南。一旦选择了相关指南,系统应用几种提示策略之一来提取回答问题所需证据。评估的策略包括:(i) COPY,模型逐句提取;(ii) LINES,模型选择相关指南行号;(iii) JuniorDoc,一个多智能体工作流程,生成类似初级医生的草稿答案,对照指南进行验证,并由安全编辑器过滤;(iv) Safety,提取与问题相关的指南句子,并注释安全关键内容以支持安全的基于证据的响应。 ##### 基线检索(BASE) 作为基线检索策略,我们构建了一个信息块仓库,这些信息块源自指南文本,每个块代表一个自包含的临床相关内容单元,可用于回答问题。从每个指南中,我们提取指南部分,对于每个部分,提取部分标题、部分文本和一个代表性的可操作问题。这些部分使用LLM提示从指南段落中自动提取。这个部分提取提示(代码1 (https://arxiv.org/html/2606.12897#LST1))将每个段落分解为更小的、临床有意义的重叠子部分。然后,对于每个部分,它生成一个简短的描述性标题和一个可操作临床问题。通过将每个文本片段与一个代表性问题相关联,我们旨在减少指南文本与相关查询之间措辞变化的敏感性。在索引时,每个子部分使用两种表示之一进行嵌入(图2 (https://arxiv.org/html/2606.12897#Sx2.F2)):(a) 文本,基于指南主题、部分标题和部分文本连接成单个字符串;或 (b) 文本+问题,额外包含代表性问题(指南主题、部分标题、部分文本和代表性问题连接成单个字符串)。在查询时,用户问题使用相同模型嵌入,并通过余弦相似度与所有嵌入(变体(a)或(b))进行比较。然后通过选择其表示与查询最语义对齐的子部分来进行检索。 参考

相似文章

AI代理中的操作幻觉与安全漂移

arXiv cs.AI

本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。

智慧在于知道何时沉默:通过注意力转移实现无幻觉的大语言模型遗忘

arXiv cs.CL

本论文引入注意力转移(Attention-Shifting, AS)框架,用于大语言模型的选择性机器遗忘,在有效移除敏感信息与防止幻觉和保持模型性能之间取得平衡。该方法采用重要性感知的注意力抑制和保留增强机制,在标准基准上相比现有遗忘方法实现了高达15%的准确度保持率提升。

长文本幻觉检测的健全性检验

arXiv cs.CL

本文介绍了一种受控不变性方法以及两种测试(Force 和 Remove),旨在确定大语言模型(LLM)幻觉检测器是依赖于推理过程还是最终答案的特征。研究提出了 TRACT,这是一种基于词汇特征的轻量级评分器,证明了其在不依赖答案层面线索的情况下仍能保持鲁棒的性能。