标签
本文介绍了Guideline-as-Oracle(GAO),一种通过将美国眼科学会指南编译成70行规则表并用于生成3000个训练对话,从而对多轮眼科电话分诊代理进行零标注训练的方法。在此语料上微调一个9B模型,可将与操作参考的一致性从61.7%提升至74.1%,紧急病例召回率从9.5%提升至69.0%,且在推理时无需前沿模型即可超越多个通用系统。
介绍了RESPClinBench,一个用于呼吸科临床决策的真实世界场景基准,评估了七个LLM在COPD和肺结节病例上的表现。发现了任务特定的局限性,包括影像幻觉和用药安全风险。
ClinFusion 是阿里巴巴达摩院推出的新开源医学多模态 LLM,提供 8B 和 32B 两种参数规模(Apache 2.0),具备统一的 2D + 3D 图像理解能力,并在医学基准测试上取得了最先进的结果。
本文介绍了PatTree,一种基于图的多模态患者表示方法,能够自动对异构临床数据进行结构化处理,以用于医学分类任务。在ADNI-1队列上,它达到了最先进的性能,阿尔茨海默病分类的平衡准确率为98.5%。
介绍了OncoTriad-QA,一个整合放射学、病理学、基因组学和临床数据的患者级基准,用于泛癌推理;同时介绍了OncoVLM,一个参考多模态模型,在微调后性能优于现有的医学大语言模型。
TumorBoard 是一个用于纵向神经肿瘤学的多智能体决策支持系统,它利用共享的纵向病例状态和可审计的声明-证据账本。在包含360个病例的基准测试中,它优于基线模型,并且安全治理机制减少了有害推荐。
介绍了MedPIC-Bench,一个包含反事实问题的基准测试,用于评估大型语言模型在患者特定条件变化时是否正确应用药物安全规则;在28个LLM中,反事实问题的准确率显著下降,揭示了模型普遍无法修正判断的缺陷。
《自然医学》上一项由MIT主导的新研究发现,AI辅助和可解释性方法对皮肤病诊断准确率的影响因用户专业水平而异:非专家过度信任AI解释,而临床医生仅在模型预测(无解释)时表现最佳。结果凸显了考虑自动化偏见的以用户为中心的AI设计之必要性。
TreeProbe 是首个针对大语言模型中藏医学文化偏见的基准,包含 4,719 个专家裁决条目,覆盖 467 种疾病和 10 个子任务,揭示了当前模型中系统性的外部本体漂移。
EarlyDx is a new large-scale benchmark for evaluating LLMs on open-ended, evidence-supported diagnosis generation at emergency department admission, built from 154,834 MIMIC-IV encounters. It reveals that even frontier and medical-specialized models struggle to synthesize admission-time evidence, with post-training only partially improving inference-dependent recall.
MyoCardBench是一个用于评估心血管护理领域大型语言模型的真实世界基准,包含13个任务共2,263个条目。GPT-5.4获得了最高总分,展现了在全周期护理和多模态解读方面的优势。
提出了一种用于痴呆症病因诊断的协作元知识增强(COME)框架,该框架将异质性感知嵌入注入到统一的Transformer架构中,在多个独立队列上实现了最先进的性能。
本文提出了一种检索增强的多智能体LLM框架,结合人在回路机制,用于从临床记录中检测皮肤免疫相关不良事件。与人工审查相比,该框架实现了更高的准确率(F1=0.88 vs 0.77)、更优的评估者间一致性(Cohen's kappa系数为0.82 vs 0.50),并将平均审查时间缩短约一半。
本文表明,蒙特卡洛丢弃法能够为胸部X光片分类器提供认知不确定性信号,当以二元错误风险标志的方式传达时,可改善临床决策支持代理的错误检测,并减少自信误诊。
OpenAI 正在向所有美国用户推出 ChatGPT Health,允许他们连接医疗记录和健康追踪数据,并声称具备临床医生级别的推理能力,且与 GPT-5.6 Sol 集成。
本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。
本文描述了TalTech系统,该系统直接利用医患对话音频生成SOAP笔记,采用通过监督学习和DAPO强化学习微调的Voxtral模型。他们的提交在BeTraC挑战赛的两个赛道均排名第一,实现了高概念准确率和低幻觉率。
Tri-Net v2 是Scientific Reports论文中关于统一的皮肤病变和基于症状的猴痘检测的开源实现。
Kimi K3 人工智能模型在 OpenMed 从 DICOM 数据中移除所有 23 个患者标识符后成功读取了一张胸片,从而确保了隐私。该模型正确识别出左侧白肺(left-sided whiteout)。