以部署为中心的评估:预测临床LLM系统中的查询级拒绝风险
摘要
本文对集成在电子健康记录中的LLM系统进行了以部署为中心的评估,训练了一个分类器,利用提供者类型和科室等响应前上下文来预测查询级拒绝风险,在4.5个月的反馈中实现了0.719的AUROC。
arXiv:2606.12702v1 Announce Type: new
摘要:大型语言模型(LLMs)越来越多地集成到临床系统中,评估这些系统在实际中的效用变得至关重要。然而,静态基准往往测量正确性而非用户接受度,聚合跨查询的性能,并且需要密集标注的数据集——这导致了评估临床系统存在重大盲点。在这项工作中,我们对一个嵌入到学术医疗中心电子健康记录中的LLM系统进行了以部署为中心的评估,其中用户反馈稀疏但密切反映了部署条件。具体来说,我们训练了一个响应前分类器,根据查询内容和生成前可用的部署特定上下文,估计未来交互将导致用户拒绝LLM响应的风险。我们基于4.5个月的用户反馈对该模型进行了前瞻性分析,发现我们的预测模型达到了0.719的AUROC。此外,我们评估了这些预测在两个下游用例(护栏触发和弃权)中的收益。我们的关键概念见解是,利用部署特定上下文(即提供者类型、科室名称、用于响应的语言模型),而不是仅依靠查询内容,能够提高预测用户是否会拒绝系统输出的能力。总之,我们的实证案例研究证明了利用部署特定上下文预测用户拒绝的可行性,为有针对性的护栏打开了大门。
查看缓存全文
缓存时间: 2026/06/12 08:53
# 以部署为中心的评估:预测临床LLM系统中查询级拒绝风险 来源:https://arxiv.org/abs/2606.12702 查看PDF(https://arxiv.org/pdf/2606.12702) > **摘要:** 大型语言模型(LLM)正越来越多地集成到临床系统中,因此评估这些系统的实际效用至关重要。然而,静态基准通常衡量正确性而非用户接受度,聚合查询间的性能,并且需要密集标注的数据集——这导致评估临床系统时存在重大盲点。在这项工作中,我们对嵌入某学术医疗中心电子健康记录中的LLM系统进行了一次以部署为中心的评估,在此场景下用户反馈稀疏但紧密反映部署条件。具体地,我们训练了一个响应前分类器,该分类器基于查询内容和生成前可用的部署特定上下文,估计未来交互导致用户拒绝LLM响应的风险。我们对4.5个月的用户反馈进行了前瞻性分析,发现我们的预测模型达到了0.719的AUROC。此外,我们评估了此类预测在两个下游用例(护栏触发和弃权)中的益处。我们的关键概念洞察是,利用部署特定上下文(即提供者类型、科室名称、用于响应的语言模型),而非仅依赖查询内容,能够提高预测用户是否拒绝系统输出的能力。总的来说,我们的实证案例研究证明了利用部署特定上下文预测用户拒绝的可行性,为针对性护栏打开了大门。 ## 提交历史 来自:Alyssa Unell [查看电子邮件(https://arxiv.org/show-email/809c42c6/2606.12702)] **\[v1\]** 2026年6月10日星期三 21:44:20 UTC(640 KB)
相似文章
AIPatient Arena:基于电子健康记录的大语言模型在端到端临床咨询工作流中的评估
介绍了AIPatient Arena,一个基于电子健康记录的评估框架,用于评估大语言模型在临床能力的多个维度。研究揭示了在问诊和伦理方面的优势,但在处理模糊性和诊断准确性方面的弱点。
CLExEval:一种用于定性评估LLM临床推理的人机交互框架
CLExEval 引入了一种人机交互框架,用于在渐进信息遮蔽条件下评估 LLM 临床推理,揭示了 GPT-4o-mini 和 HuatuoGPT-o1 等模型中存在的失败模式,如冗长偏见、隐藏知识悖论以及推理与输出不匹配。
EHRBench:用于大语言模型临床决策的自动化可靠电子健康记录基准
EHRBench是一个自动化且可靠的基准测试,利用真实电子健康记录评估大语言模型在临床决策任务上的表现,涵盖诊断、治疗和预后任务,包含近100万个问答条目。
一个用于医学大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。
面向可靠LLM判断的边际自适应置信度排序
本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。