人在回路的大语言模型框架用于皮肤免疫相关不良事件识别

arXiv cs.CL 论文

摘要

本文提出了一种检索增强的多智能体LLM框架,结合人在回路机制,用于从临床记录中检测皮肤免疫相关不良事件。与人工审查相比,该框架实现了更高的准确率(F1=0.88 vs 0.77)、更优的评估者间一致性(Cohen's kappa系数为0.82 vs 0.50),并将平均审查时间缩短约一半。

arXiv:2607.20428v1 公告类型:新 摘要:本研究评估了一种检索增强的多智能体大语言模型(LLM)驱动、人在回路的框架,用于从临床记录中检测皮肤免疫相关不良事件(cirAEs)。与无辅助的人工审查相比,LLM辅助工作流程提高了准确率(F1=0.88 vs 0.77)、评估者间一致性(Cohen's kappa系数为0.82 vs 0.50),并将平均审查时间减少约一半。该框架示范了如何将LLM应用于识别跨器官系统的免疫相关毒性,并更广泛地实现准确、可扩展且透明的不良事件数据提取。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:15

# 面向皮肤免疫相关不良事件识别的人机协同大语言模型框架
来源:https://arxiv.org/abs/2607.20428
作者:Charles Lu (https://arxiv.org/search/cs?searchtype=author&query=Lu,+C), Olivia Burke (https://arxiv.org/search/cs?searchtype=author&query=Burke,+O), Debby Cheng (https://arxiv.org/search/cs?searchtype=author&query=Cheng,+D), Adam Kashlan (https://arxiv.org/search/cs?searchtype=author&query=Kashlan,+A), Caitlyn Duffy (https://arxiv.org/search/cs?searchtype=author&query=Duffy,+C), Zeyun Lu (https://arxiv.org/search/cs?searchtype=author&query=Lu,+Z), Lirit Fuksman (https://arxiv.org/search/cs?searchtype=author&query=Fuksman,+L), Jin Ning Tian (https://arxiv.org/search/cs?searchtype=author&query=Tian,+J+N), Andrew Sedlack (https://arxiv.org/search/cs?searchtype=author&query=Sedlack,+A), Priya Katyal (https://arxiv.org/search/cs?searchtype=author&query=Katyal,+P), Eudora Lee (https://arxiv.org/search/cs?searchtype=author&query=Lee,+E), Ralina Karagenova (https://arxiv.org/search/cs?searchtype=author&query=Karagenova,+R), Chuck Lin (https://arxiv.org/search/cs?searchtype=author&query=Lin,+C), Kun-Hsing Yu (https://arxiv.org/search/cs?searchtype=author&query=Yu,+K), Nicole LeBoeuf (https://arxiv.org/search/cs?searchtype=author&query=LeBoeuf,+N), Alexander Gusev (https://arxiv.org/search/cs?searchtype=author&query=Gusev,+A), Yevgeniy R. Semenov (https://arxiv.org/search/cs?searchtype=author&query=Semenov,+Y+R)

查看 PDF (https://arxiv.org/pdf/2607.20428)

> 摘要:本研究评估了一种检索增强、多智能体大语言模型(LLM)驱动、且包含人机协同环节的框架,用于从临床记录中检测皮肤免疫相关不良事件(cirAEs)。与无辅助的人工审核相比,LLM辅助工作流提升了准确率(F1=0.88 vs 0.77),提高了评估者间一致性(Cohen's kappa = 0.82 vs 0.50),并将平均审核时间缩短约一半。该框架展示了LLM如何应用于跨器官系统的免疫相关毒性识别,并更广泛地实现准确、可扩展且透明的不良事件数据提取。

## 提交历史

来自:Lirit Fuksman [查看邮件 (https://arxiv.org/show-email/e33cc725/2607.20428)] **[v1]** 2026年5月9日 星期六 16:37:49 UTC (829 KB)

相似文章

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。

针对免疫介导疾病的专科医学语言模型

arXiv cs.CL

本文提出了一种针对免疫介导和感染性疾病的专科医学语言模型,用于从临床叙述中提取信息。该模型采用BiLSTM-CNN-Char架构,在371份病例报告的精标语料库上训练,F1得分达到0.89。