人在回路的大语言模型框架用于皮肤免疫相关不良事件识别
摘要
本文提出了一种检索增强的多智能体LLM框架,结合人在回路机制,用于从临床记录中检测皮肤免疫相关不良事件。与人工审查相比,该框架实现了更高的准确率(F1=0.88 vs 0.77)、更优的评估者间一致性(Cohen's kappa系数为0.82 vs 0.50),并将平均审查时间缩短约一半。
arXiv:2607.20428v1 公告类型:新
摘要:本研究评估了一种检索增强的多智能体大语言模型(LLM)驱动、人在回路的框架,用于从临床记录中检测皮肤免疫相关不良事件(cirAEs)。与无辅助的人工审查相比,LLM辅助工作流程提高了准确率(F1=0.88 vs 0.77)、评估者间一致性(Cohen's kappa系数为0.82 vs 0.50),并将平均审查时间减少约一半。该框架示范了如何将LLM应用于识别跨器官系统的免疫相关毒性,并更广泛地实现准确、可扩展且透明的不良事件数据提取。
查看缓存全文
缓存时间: 2026/07/24 05:15
# 面向皮肤免疫相关不良事件识别的人机协同大语言模型框架 来源:https://arxiv.org/abs/2607.20428 作者:Charles Lu (https://arxiv.org/search/cs?searchtype=author&query=Lu,+C), Olivia Burke (https://arxiv.org/search/cs?searchtype=author&query=Burke,+O), Debby Cheng (https://arxiv.org/search/cs?searchtype=author&query=Cheng,+D), Adam Kashlan (https://arxiv.org/search/cs?searchtype=author&query=Kashlan,+A), Caitlyn Duffy (https://arxiv.org/search/cs?searchtype=author&query=Duffy,+C), Zeyun Lu (https://arxiv.org/search/cs?searchtype=author&query=Lu,+Z), Lirit Fuksman (https://arxiv.org/search/cs?searchtype=author&query=Fuksman,+L), Jin Ning Tian (https://arxiv.org/search/cs?searchtype=author&query=Tian,+J+N), Andrew Sedlack (https://arxiv.org/search/cs?searchtype=author&query=Sedlack,+A), Priya Katyal (https://arxiv.org/search/cs?searchtype=author&query=Katyal,+P), Eudora Lee (https://arxiv.org/search/cs?searchtype=author&query=Lee,+E), Ralina Karagenova (https://arxiv.org/search/cs?searchtype=author&query=Karagenova,+R), Chuck Lin (https://arxiv.org/search/cs?searchtype=author&query=Lin,+C), Kun-Hsing Yu (https://arxiv.org/search/cs?searchtype=author&query=Yu,+K), Nicole LeBoeuf (https://arxiv.org/search/cs?searchtype=author&query=LeBoeuf,+N), Alexander Gusev (https://arxiv.org/search/cs?searchtype=author&query=Gusev,+A), Yevgeniy R. Semenov (https://arxiv.org/search/cs?searchtype=author&query=Semenov,+Y+R) 查看 PDF (https://arxiv.org/pdf/2607.20428) > 摘要:本研究评估了一种检索增强、多智能体大语言模型(LLM)驱动、且包含人机协同环节的框架,用于从临床记录中检测皮肤免疫相关不良事件(cirAEs)。与无辅助的人工审核相比,LLM辅助工作流提升了准确率(F1=0.88 vs 0.77),提高了评估者间一致性(Cohen's kappa = 0.82 vs 0.50),并将平均审核时间缩短约一半。该框架展示了LLM如何应用于跨器官系统的免疫相关毒性识别,并更广泛地实现准确、可扩展且透明的不良事件数据提取。 ## 提交历史 来自:Lirit Fuksman [查看邮件 (https://arxiv.org/show-email/e33cc725/2607.20428)] **[v1]** 2026年5月9日 星期六 16:37:49 UTC (829 KB)
相似文章
一个用于医学大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
AIPatient Arena:基于电子健康记录的大语言模型在端到端临床咨询工作流中的评估
介绍了AIPatient Arena,一个基于电子健康记录的评估框架,用于评估大语言模型在临床能力的多个维度。研究揭示了在问诊和伦理方面的优势,但在处理模糊性和诊断准确性方面的弱点。
语言模型作为接口,而非预言机:用于儿童阑尾炎的混合LLM-ML系统
本文介绍了ClaMPAPP,一种混合架构,使用LLM作为接口从临床叙述中提取特征,然后将这些特征传递给XGBoost分类器进行儿童阑尾炎诊断,展示了相比端到端LLM基线更高的鲁棒性和安全性。
针对免疫介导疾病的专科医学语言模型
本文提出了一种针对免疫介导和感染性疾病的专科医学语言模型,用于从临床叙述中提取信息。该模型采用BiLSTM-CNN-Char架构,在371份病例报告的精标语料库上训练,F1得分达到0.89。