CRAFT:基于LLM的临床叙述时间推理迭代优化框架
摘要
CRAFT是一种新的LLM框架,用于对临床叙述中的时间推理进行迭代优化,引入了基于验证器的反馈机制,并提出了用于疫苗不良事件报告的MedTempo基准。
arXiv:2608.12779v1 公告类型:新
摘要:理解临床叙述中症状的时间进展对于疾病监测、安全监测和因果关系评估至关重要。然而,临床叙述很少提供明确的时间锚点。当前的时间信息推理方法主要侧重于跨多次就诊和富含时间戳记录的成对关系分类,而忽略了从单个缺少锚点的报告中重构结构化症状轨迹。我们提出了CRAFT,一个LLM框架,将生成器与基于约束的验证器配对,通过有针对性的反馈迭代生成和优化分阶段症状时间线。我们在MedTempo上进行了评估,这是一个包含5,347份疫苗不良事件叙述的新基准,涵盖三种COVID-19疫苗类型,其中3,166份报告具有专家验证的时间阶段标注。跨四个LLM骨干网络的实验表明,CRAFT持续提高了时间排序准确性,消融分析在不同模型能力水平上分离了生成器和验证器组件的贡献。
查看缓存全文
缓存时间: 2026/08/14 09:27
# CRAFT:基于LLM的临床叙述时间推理迭代优化框架 来源:https://arxiv.org/html/2608.12779 陈成阳致谢:史蒂文斯理工学院,霍博肯,新泽西州,07030,美国 \([che14@stevens\.edu](mailto:[email protected]),[tarif1@stevens\.edu](mailto:[email protected]),[yue\.ning@stevens\.edu](mailto:[email protected]),[pwang44@stevens\.edu](mailto:[email protected])\) Marko Zivkovic致谢:Genesis Research Group,霍博肯,新泽西州,07030,美国 \([marko\.zivkovic@genesisrg\.com](mailto:[email protected])\) Lijing Wang致谢:新泽西理工学院,纽瓦克,新泽西州,07102,美国 \([lijing\.wang@njit\.edu](mailto:[email protected]) Yue Ning¹¹footnotemark:1 Ping Wang¹¹footnotemark:1 ###### 摘要 理解临床叙述中症状的时间进展对于疾病监测、安全监测和因果关系评估至关重要。然而,临床叙述很少提供明确的时间锚点。当前的时间信息推理方法主要集中于对多就诊记录和富含时间戳数据的成对关系分类,而基于单份、锚点稀疏的报告重建结构化症状轨迹的问题在很大程度上未得到解决。我们提出了CRAFT,一个LLM框架,它将生成器与基于约束的验证器配对,通过有针对性的反馈迭代生成并优化阶段性的症状时间线。我们在MedTempo上进行了评估,这是一个包含5,347份疫苗不良事件叙述的新基准,涵盖三种COVID-19疫苗类型,其中3,166份报告具有专家验证的时间阶段注释。跨四个LLM主干网络的实验表明,CRAFT始终能提高时间排序准确性,消融分析则在不同模型能力水平上分离了生成器和验证器组件的贡献。 ## 1 引言 临床时间推理,即从叙述文本中恢复临床事件的分阶段轨迹,是疾病进展建模、治疗结果监测和安全信号检测的核心\[10 (https://arxiv.org/html/2608.12779#bib.bib24),20 (https://arxiv.org/html/2608.12779#bib.bib19)\]。然而,从自由文本中构建这种顺序仍然需要大量人工。这些叙述中的时间线索通常是隐式的,或相对于其他事件表达,而非锚定到固定日期,同时共提及、重述和状态更新进一步模糊了症状的真实时间顺序\[37 (https://arxiv.org/html/2608.12779#bib.bib21),1 (https://arxiv.org/html/2608.12779#bib.bib20)\]。大量关于时间信息推理的工作集中在识别事件和时间表达式,并预测成对关系以推导全局排序\[16 (https://arxiv.org/html/2608.12779#bib.bib16),25 (https://arxiv.org/html/2608.12779#bib.bib37)\],最近的工作扩展到详尽的关系覆盖和复杂时间事实提取\[2 (https://arxiv.org/html/2608.12779#bib.bib17),8 (https://arxiv.org/html/2608.12779#bib.bib18)\]。然而,在临床领域,进展受到基准多样性有限的制约,大多数工作集中在小部分语料库和关系清单上\[1 (https://arxiv.org/html/2608.12779#bib.bib20),28 (https://arxiv.org/html/2608.12779#bib.bib25)\]。最近的基于LLM的临床时间推理方法进一步假设多就诊时间线、时间戳相关监督或受限数据设置\[3 (https://arxiv.org/html/2608.12779#bib.bib23),10 (https://arxiv.org/html/2608.12779#bib.bib24),35 (https://arxiv.org/html/2608.12779#bib.bib22)\]。因此,用于在单报告、锚点稀疏的临床叙述中对症状进展进行排序的标准化方法和基准仍未得到充分探索。 为弥补这一空白,我们提出了CRAFT(基于自适应反馈的临床时间顺序细化,Clinical Refinement with Adaptive Feedback for Temporal ordering),一种生成器-验证器框架,将时间轨迹重建建模为弱时间锚定下的迭代结构化预测任务,其中候选轨迹通过基于约束的反馈进行细化。受Self-Refine等迭代细化范式的启发\[17 (https://arxiv.org/html/2608.12779#bib.bib33)\],CRAFT引入了一种结构化轨迹表示和一种针对时间排序的任务特定验证机制,并可利用不同的生成器和验证器配置进行实例化。在本工作中,我们将CRAFT实例化为CRAFT-Full,它将完全重新生成的生成器与多标准附加验证器配对;我们还定义了两个基线(PIVOT,GUIDE)和两个消融变体(CRAFT-G,CRAFT w/o V),以分别分离生成器和验证器组件的贡献。 为了支持严格评估,我们引入了MedTempo(医学时间顺序基准,Medical Temporal Ordering Benchmark),一个用于从医学自由文本中重建时间进展的基准。MedTempo包含5,347份覆盖三种疫苗类型的叙述报告,每份报告为单一患者单份报告,没有明确的绝对时间锚点,并配有提供的症状列表。我们的基准任务聚焦于其中3,166份表现出明显症状进展时间证据的报告,我们为这些报告提供了专家验证的分阶段排序注释。其余报告不包含时间进展,保留在发布的数据库中以支持未来关于时间证据识别的工作,但不属于当前基准评估的范围。 我们的主要贡献如下: - 我们提出了CRAFT,一个在弱时间锚定下进行迭代时间推理细化的生成器-验证器框架,并带有受控基线和消融,以分离生成器和验证器的贡献。 - 我们引入了MedTempo,一个专家注释的基准,用于评估锚点稀疏的临床叙述上的结构化时间轨迹。 - 我们在四个LLM上进行了广泛实验,揭示了与模型能力和验证器校准相关的不同细化行为。图4.1 (https://arxiv.org/html/2608.12779#S4.F1)提供了从数据集构建到迭代细化和事后评估的完整流程示意图。 ## 2 相关工作 时间信息抽取受到TimeML注释框架的深刻影响\[23 (https://arxiv.org/html/2608.12779#bib.bib6)\],该框架引入了一种用于事件、时间表达式及其关系的标记语言。TempEval共享任务\[31 (https://arxiv.org/html/2608.12779#bib.bib7)\]为成对时间关系分类建立了标准化评估,系统从基于规则和CRF/SVM方法发展为神经方法。一种常见范式是预测成对关系,然后推导全局一致的排序\[16 (https://arxiv.org/html/2608.12779#bib.bib16),9 (https://arxiv.org/html/2608.12779#bib.bib35),33 (https://arxiv.org/html/2608.12779#bib.bib34)\],而较新的基准则强调更丰富的事件排序注释\[2 (https://arxiv.org/html/2608.12779#bib.bib17)\]以及基于LLM的时间基础事实提取策略\[8 (https://arxiv.org/html/2608.12779#bib.bib18)\]。基于Transformer的方法已成为主导范式,如\[28 (https://arxiv.org/html/2608.12779#bib.bib25)\]所述。然而,这些工作通常侧重于局部关系正确性,而非在弱锚定下端到端重建有序、分组轨迹。 在临床领域,i2b2 2012挑战赛\[29 (https://arxiv.org/html/2608.12779#bib.bib8)\]将时间关系抽取引入临床出院小结,随后是THYME语料库上的Clinical TempEval共享任务\[6 (https://arxiv.org/html/2608.12779#bib.bib9),27 (https://arxiv.org/html/2608.12779#bib.bib5)\],其中表现最好的系统从CRF/SVM分类器发展到LSTM\[30 (https://arxiv.org/html/2608.12779#bib.bib31)\]。综述记录了持续存在的困难,包括隐式时间锚点、句间关系,以及关系级抽取与可用患者时间线之间的差距\[20 (https://arxiv.org/html/2608.12779#bib.bib19),1 (https://arxiv.org/html/2608.12779#bib.bib20)\]。最近的工作将神经端到端方法应用于已有临床语料库\[19 (https://arxiv.org/html/2608.12779#bib.bib26)\],基于LLM的方法也开始研究用于临床时间关系抽取的提示和微调\[13 (https://arxiv.org/html/2608.12779#bib.bib29),4 (https://arxiv.org/html/2608.12779#bib.bib27),3 (https://arxiv.org/html/2608.12779#bib.bib23),36 (https://arxiv.org/html/2608.12779#bib.bib28)\],以及从医学病例报告中提取时间线\[32 (https://arxiv.org/html/2608.12779#bib.bib30)\]。然而,这些方法通常需要跨多次就诊的纵向记录,或依赖结构化时间元数据\[10 (https://arxiv.org/html/2608.12779#bib.bib24),35 (https://arxiv.org/html/2608.12779#bib.bib22)\]。相比之下,CRAFT处理的是时间线索稀疏或隐式的单报告临床叙述。为了支持这一未被充分探索场景下的评估,MedTempo提供了源自真实不良事件叙述、由专家注释的时间轨迹基准。 表2.1:MedTempo按疫苗类型的描述性统计。Text Len\.表示临床叙述的单词数;\#Stages表示时间阶段数。 | MedTempo | | MedTempo-T | | | MedTempo-NT | | | |---|---|---|---|---|---|---|---| | 疫苗 | 指标 | Med | Min | Max | Med | Min | Max | | Pfizer(1789/1019/770) | 文本长度 | 102 | 11 | 2319 | 109 | 12 | 1638 | | | 症状数 | 6 | 4 | 64 | 6 | 4 | 64 | | | 阶段数 | 2 | 0 | 10 | 1 | 0 | 0 | | Moderna(1769/983/786) | 文本长度 | 83 | 11 | 1056 | 99 | 13 | 905 | | | 症状数 | 6 | 4 | 30 | 6 | 4 | 30 | | | 阶段数 | 2 | 0 | 9 | 3 | 2 | 9 | | Janssen(1789/1164/625) | 文本长度 | 87 | 11 | 1317 | 100 | 12 | 826 | | | 症状数 | 6 | 4 | 43 | 7 | 4 | 43 | | | 阶段数 | 2 | 0 | 13 | 3 | 2 | 13 | 另一条并行的工作方向是将迭代细化应用于结构化预测,最著名的是Self-Refine范式\[17 (https://arxiv.org/html/2608.12779#bib.bib33)\],它使用自生成的反馈对模型输出进行迭代。在临床领域,Hein等人\[14 (https://arxiv.org/html/2608.12779#bib.bib36)\]将迭代细化与人在回路的评审周期结合,以提高抽取精度。然而,这类方法不适用于跨模型层的系统性基准评估,因为它们将模型能力与人类评审工作量混为一谈。CRAFT在完全自动化的环境中利用迭代细化进行结构化临床时间抽取,将生成器与多标准验证器配对,并支持在前沿模型和开放权重模型之间进行原则性比较。 ## 3 数据集构建 本节描述如何从VAERS构建MedTempo。我们首先介绍源语料库以及每份报告提供的信息。然后描述过滤和分层抽样,将语料库缩减到携带时间信号的部分,接着介绍生成金标准时间线的注释协议。最后给出所生成基准的汇总统计。 ### 3.1 VAERS数据集 疫苗不良事件报告系统(VAERS)由CDC和FDA联合管理,是一个被动监测数据库,医疗专业人员、患者和制造商在此提交免疫后不良事件报告\[7 (https://arxiv.org/html/2608.12779#bib.bib32)\]。每份报告包括人口统计信息、疫苗接种详情、自由文本临床叙述和MEdDRA编码的症状列表。我们重点研究三种广泛接种的COVID-19疫苗:Pfizer-BioNTech、Moderna和Janssen,覆盖2021年至2024年的报告。 ### 3.2 数据抽样 表3.1:注释一致性和裁决率(%),总体及按子集。Ann\. = 注释者;T = MedTempo-T,仅包含有时间报告;NT = MedTempo-NT,包含无时间报告。在T子集中,歧义排除项按定义不适用(–)。 | 类别 | 指标 | MedTempo | T | NT | |---|---|---|---|---| | 一致性 | 模型–注释者1 | 78 | 82 | 91 | | | 模型–注释者2 | 73 | 78 | 86 | | | 注释者间 | 93 | 94 | 94 | | 裁决 | 接受 | 80 | 90 | 90 | | | 修正 | 9 | 10 | 10 | | | 排除 | 11 | – | – | 从完整的VAERS语料库开始,我们应用了多阶段过滤和分层抽样流程。我们首先通过从三个非临床系统器官分类(外科和医疗操作、社会情况、产品问题)构建排除列表,并结合人工注释的非症状标签,移除了非症状MedDRA术语,共得到5,601个排除术语。症状数量不超过三个的报告因缺乏足够的时间变异而被丢弃。字数不超过十个的报告(通常是没有叙述上下文的裸症状列表)也被移除。对于11至30个字的报告,我们应用基于规则的时间关键词过滤(相对标记如之前/之后、持续时间术语、日期模式),仅保留具有明确时间线索的报告;30个字及以上的报告无条件保留。最后,按疫苗进行分层抽样,当年份和报告长度达到平衡,每种疫苗抽取2,000条记录,保持底层VAERS语料库的分布。附录A.1 (https://arxiv.org/html/2608.12779#S1.SS1)展示了每种准则下被移除报告的代表性示例。 ### 3.3 时间序列注释 时间线通过一个三阶段人在回路协议生成:GPT-4o mini\[21 (https://arxiv.org/html/2608.12779#bib.bib4)\]生成初始的分阶段有序时间线;两位具有医学生物NLP背景的注释者独立审查并标记每条序列;所有分歧和不确定案例通过协作裁决解决。如表3.1 (https://arxiv.org/html/2608.12779#S3.T1)所示,人类注释者间一致性(IAA)为93%。经过裁决,80%的LLM注释被无修改接受,9%被修正,11%因时间歧义被排除,最终得到5,347条记录的语料库。 ### 3.4 数据集统计与分析 表2.1 (https://arxiv.org/html/2608.12779#S2.T1)总结了构成主要基准子集MedTempo-T的3,166份具有时间证据的报告;其余2,181份报告不包含时间进展,作为MedTempo-NT单独发布。症状数量在不同疫苗间保持一致(中位数6),而叙述长度有所变化:Pfizer-BioNTech报告最长(中位数102字),而Moderna为83字,Janssen为87字。由于无论长度如何,症状数量都保持稳定,较长的报告可能提供更丰富的上下文线索,而非更多的不良事件,从而为时间抽取提供更强的信号。图3.1 (https://arxiv.org/html/2608.12779#S3.F1)显示,体温调节症状(发热、寒战)在早期阶段占主导地位,而头痛和疲劳在总体上最为频繁,说明了基准中症状轨迹的多样性。 参见说明图3.1:最常见症状(左)和随后出现的症状(右)的分布。每张图表共显示15个独特症状,代表每种疫苗类型和整体数据集的前10个症状的组合。 ## 4 方法 本节介绍CRAFT。我们首先形式化排序任务,并定义全文使用的基于阶段的表示,固定报告、发现和预测时间线的符号。然后,我们描述框架本身:提出时间线的生成器、对其评分并返回反馈的验证器,以及连接两者的循环。图4.1 (https://arxiv.org/html/2608.12779#S4.F1)概述了数据集流程和框架。 参见说明图4.1:MedTempo和CRAFT概述。(a) 从VAERS叙述到金标准阶段排序的数据集构建流程。
相似文章
CRAFT:面向表格问答与事实验证的统一反事实推理框架
CRAFT是一个统一的反事实推理框架,通过构建原始陈述和反事实变体,从双向推理路径中提取证据,并通过加权机制进行整合,从而提升了表格问答和事实验证的效果。在WikiTQ和TabFact数据集上的实验表明,该框架持续优于基线方法。
FaithMed:训练LLMs进行忠实的循证医学推理
FaithMed 是一个框架,通过将临床医生设计的评分标准与使用步骤级过程奖励分配的强化学习相结合,训练LLMs进行忠实的循证医学推理,在多个医学基准上相比基线取得了显著改进。
CLExEval:一种用于定性评估LLM临床推理的人机交互框架
CLExEval 引入了一种人机交互框架,用于在渐进信息遮蔽条件下评估 LLM 临床推理,揭示了 GPT-4o-mini 和 HuatuoGPT-o1 等模型中存在的失败模式,如冗长偏见、隐藏知识悖论以及推理与输出不匹配。
KREL:利用大语言模型通过知识引导的临床证据推理实现自动医疗编码
KREL是一个框架,利用大语言模型进行自动医疗编码,通过整合结构化的ICD编码指南来改进推理并减少幻觉。它在基准数据集上优于现有方法。
面向时间干预下个人LLM智能体的用户条件化评估
本文认为,评估个人LLM智能体需要跨不同的用户条件化状态重放时间干预,并指出现有基准中的空白。它提出了一个最小基准设计和用于用户条件化适应的报告指标。