面向医疗NLP代理的工作流感知基准测试

arXiv cs.CL 论文

摘要

本文介绍了一种针对医疗NLP代理的情节级评估协议,以更好地评估其在临床工作流中的性能,超越静态基准测试。

arXiv:2609.00296v1 公告类型:新 摘要:大语言模型(LLM)代理越来越多地被提出用于医疗任务,如临床文档、证据检索、患者消息和护理协调。然而,许多评估仍局限于静态医疗问题解答或一次生成,未能充分表示纵向状态、中断和人工交接。我们为医疗NLP代理引入了一种情节级评估协议。该协议将证据分为模型、代理和模拟工作流行为;指定了一个五字段情节模式;并定义了状态连续性、证据可追溯性和升级决策的注释和评分。它被实例化为四个任务模板:文档更新、证据检索、患者消息和分诊交接。该协议不声称测量临床结果或部署价值。相反,它提供了一个可重复的中间评估层,介于静态基准测试和前瞻性工作流研究之间,并对遗漏与不必要的升级进行了明确的成本敏感处理。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:49

# 面向工作流感知的医疗NLP智能体基准测试
来源:https://arxiv.org/html/2609.00296
作者:Junyi Yao¹, Baichuan Li², Zihao Zheng¹, Jiayu Long¹  
机构:¹美国圣路易斯华盛顿大学 \{j.yao, z.zihaogary, jiayujacqueline\}@wustl.edu  
²美国南卫理公会大学 [email protected]

###### 摘要

大型语言模型(LLM)智能体正越来越多地被应用于临床文档记录、证据检索、患者信息传递和护理协调等医疗任务。然而,许多评估仍局限于静态医学问答或单次生成,未能充分体现纵向状态管理和人机交接能力。我们提出了针对医疗NLP智能体的医疗情景评估方案。该方案将评估维度分为模型能力、智能体行为和模拟工作流行为三个层面;定义了五字段情景结构;建立了状态连续性、证据可追溯性和升级决策的标注评分体系。该方案具体化为四种任务模板:文档更新、证据检索、患者信息传递和分诊交接。本方案不旨在评估临床疗效或部署价值,而是在静态基准与前瞻性工作流研究之间提供可复现的中间评估层,并对漏报与过度升级进行成本敏感分析。

###### 索引术语:

医疗NLP、LLM智能体、基准设计、临床AI、评估、智能体记忆

## 一、引言

医疗领域最清晰地体现了流畅语言模型与实用语言智能体之间的操作差异。临床护理工作流具有多步骤、状态化和高风险特性。系统可能需要总结病历、检索指南证据、维持对话上下文、在信息缺失时推迟决策,并在不确定性增加时支持人工交接。在这种场景下,单轮对话的强势表现并不能充分证明其实用价值。

这种差距之所以重要,是因为医疗AI文献正快速向智能体化框架发展。近期研究将规划、工具使用、检索、记忆和多步交互视为医疗护理中LLM系统的核心特征[1,2,3,4]。同时,多项综述与展望论文警告,通用基准的提升可能被误认为临床就绪性[5,6,7,8,9]。主要失败模式往往不仅是文本生成错误,更常见的是状态保持失败、证据检索不当、不确定性未有效传达或工作流范围越界。

本文持明确立场:实用的医疗智能体基准需要在静态提示-响应测试与前瞻性临床工作流研究之间建立操作层。这一关注点与更广泛的智能体评估论点一致,即系统表观性能可能严重依赖隐含的执行假设而非架构本身[10]。静态基准仍有价值,但应将其视为更广泛证据栈中的一个层级。

我们的贡献有三方面:首先,区分模型层、智能体层和模拟工作流层不同证据支撑的结论;其次,制定可复现的情景评估协议,包括参考决策、标注单元和聚合方法;第三,提供四种任务模板和成本敏感的升级评分体系。本贡献是设计与测量协议,而非公开数据集或临床验证研究。

## 二、为何医疗智能体评估与众不同

医疗工作具有序列性而非原子性。文档记录、分诊、患者随访、出院沟通和辅助决策支持等环节随时间推移逐步展开。用户目标可能在任务中发生变化,初始输出后可能出现新信息,系统可能需要提出澄清问题而非立即回答。这些特性使得工作流质量至少与局部答案质量同等重要。

这一特点对智能体而言尤为明显。独立模型若能对静态问题给出流畅回答,可能表现优异;而医疗智能体即便语言精炼也可能失败:可能遗漏禁忌症、沿用过时病历信息,或检索出无关证据却言之凿凿。换言之,医疗场景中的失败往往是状态或流程失败,而非单纯的生成失败。这就是为什么智能体记忆、检索增强生成和动态医疗评估的近期研究直接关联到医疗AI评估[11,12,13,14,15]。

实践启示明确:评估应跟踪智能体是否保持相关上下文、恰当使用证据、从中断中恢复,并在达到范围边界时进行升级。近期关于智能体路由真实静态与在线评估的研究,进一步推动了将路由视为显式行为而非附带文本输出的范式[16]。忽略这些行为的基准或许可用于能力筛选,但作为部署证据则效力不足。

## 三、静态基准的局限性

静态医疗问答基准在测试事实记忆、解释能力、多语言覆盖和专科广度方面仍有价值[17,18,19]。幻觉基准同样有助于表征无依据断言和安全敏感失败模式[20,21]。然而,这些任务将交互冻结在狭窄切片中,很少测试模型是否应推迟回答、询问缺失上下文或跨轮次跟踪先前状态。

临床表型概念识别是另一个有价值的能力目标[22],但基于提示的提取任务表现良好,同样无法证明智能体能在工作流中管理状态变化、证据约束或升级决策。

当系统被定位为嵌入护理工作流的辅助工具时,这种局限性变得更加严峻。近期基准研究方向开始解决此问题。MedAgentBench评估类电子病历环境中的智能体任务,而非仅限文本提示[23]。PhysicianBench和标准化患者式评估进一步朝向长期临床行为推进[24,25,26]。基于电子病历和以咨询为中心的基准通过锚定于病历、医生对话和演进中的患者轨迹来增强真实性[27,28,29,30]。医疗摘要和RAG相关评估通过测试来源保留、证据选择和基于上下文的生成,增加了另一个重要维度[31,15,32]。

因此该领域已朝正确方向发展。剩余挑战在于概念整合。不同基准捕获不同层次的有效行为,但常被并列报告而缺乏统一评估逻辑。这可能掩盖强分数实际支持的结论类型,并增加基准设计可复用性的难度。

## 四、三层证据协议

我们根据三个证据层级组织医疗NLP智能体评估。区分评估分层并非新观点;其附加价值在于报告规则:每个结果必须标明证据层级,不得强化为更强的部署结论。

表I紧凑总结了该框架。表格设计注重实用性:每个层级关联具体部署问题、典型指标族,以及单独使用该层级时的主要盲点。

表I:医疗NLP智能体评估三层框架
### 四-A、模型层

第一层级衡量核心模型行为:事实性、校准度、公平性、鲁棒性和有害错误模式。静态问答、解释和幻觉基准在此层级仍适用。它们回答诸如模型是否掌握相关医学知识、是否做出无依据断言、是否在分布或语言变异下性能下降等问题[5,6,20]。

### 四-B、智能体层

第二层级衡量智能体在多步任务执行中的行为。相关结构包括规划质量、工具使用正确性、检索保真度、记忆一致性、更新行为和不确定性处理。通用LLM智能体和记忆研究在此对医疗领域具有价值,因为它提供了测试写入、检索、更新、遗忘和反思操作的术语体系,而不仅限于最终响应[3,4,11,12]。医疗专用检索和类电子病历基准自然适配此层级[23,14,32]。

### 四-C、模拟工作流层

第三层级评估路由、中断恢复、交接完整性和受控情景中的输出可审阅性。明确说明这不是对时间节省、临床医生工作量、患者安全或护理效果的测量。此类结论需要包含本地治理和人机参与的前瞻性工作流研究。系统可能在模型层和智能体层表现优异,但在模拟情景中若创建不完整交接、忽略状态更新或将路由决策视为普通文本生成,仍会失败[8,9]。

该协议报告的是向量而非单一排行榜分数:模型能力、智能体执行和模拟工作流性能。最后一层级的强结果仅支持关于定义情景的结论,不能证明临床整合价值。

## 五、任务类别差异

文档支持、证据检索、患者信息传递和分诊的失败模式并不相同。适用于某任务的基准包可能完全不匹配另一任务。表II恢复了任务敏感视角:通用医疗智能体排行榜可能掩盖正确性、上下文化、升级和连续性之间不断变化的平衡关系。

表II:不同任务类别具有特定主要风险和评估重点
例如,文档转换可能局部准确但对分诊任务仍显薄弱,因为主要风险从正确性转向升级和连续性。同样,若不测试边界和有害建议缓解措施,证据检索无法确立面向患者沟通的安全性。

## 六、情景规范与评分

评估单元是基于文档的短工作流情景,而非单个提示。每个情景包含五个必填字段:(i)初始上下文包,(ii)改变状态的事件或中断,(iii)允许的操作空间,(iv)参考决策概况,(v)评审核准表。上下文使用去标识化或合成文档;状态变化标识必须保留、修正或丢弃的事实;操作空间明确智能体是否可回答、检索、修订、提问、拒绝或升级。固定的情景结构使构建可审计并防止事后调整评分标准。

两名合格标注员使用情景指南独立生成参考决策。他们标注必要事实、禁止主张、可接受证据源、适当操作集和交接字段。第三审核员裁决分歧,基准发布应保留最终标签和分歧类型。这在不要求单一参考响应唯一正确的前提下支持可复现性。

表III:情景模板与预设主要评分目标
每个情景的分数基于原子标注而非全局印象计算。状态连续性评分为保留或正确修正的必要事实比例,减去矛盾与过时事实。证据可追溯性评分为实质主张与可接受来源的关联比例,对无依据或不匹配引用扣分。交接完整度评分为必要路由字段存在且正确的比例。所有分数组件和权重按任务类别报告。

升级被视为决策而非通用安全偏好。令EE表示参考升级标签,E^\\hat{E}表示智能体动作。我们报告敏感性、特异性和可配置效用U=uTPTP\+uTNTN−cFNFN−cFPFPU=u\_{TP}TP\+u\_{TN}TN\-c\_{FN}FN\-c\_{FP}FP,其中当漏报升级被认为比不必要升级更有害时cFN\>cFPc\_{FN}\>c\_{FP}。成本矩阵必须在评估前声明并经任务临床治理小组审核。这使权衡关系显性化,避免隐含奖励过度推迟或不安全完成。

## 七、示例性失败分析

考虑患者报告近期换药后呼吸急促加剧的信息。静态基准可能奖励正确解释或摘要,但可能错过临床显著失败:制作精良回复而非启动升级。情景协议则考察是否识别警告信号、保留先前上下文、交接是否包含必要信息。在此场景中,简短确认加升级可能优于详细回答。

## 八、设计要求与边界

该协议实现四项要求,并明确划定结论边界。

### 八-A、状态连续性

情景测试相关信息是否跨轮次保留、更新和丢弃。标注指南区分保留事实、修正事实和必须不再使用的事实。因此记忆被视为治理问题,而不仅是上下文窗口问题[11,13]。

相似文章