标签
Introduces CANOE, a multi-agent neuro-symbolic framework for open-ended care plan coordination that uses argumentative computation and human-in-the-loop contestation to improve transparency, safety, and clinical correctness.
本文提出了一种利用具有挑战性的真实临床案例对多轮多模态诊断推理进行评估的方法,旨在衡量AI模型处理复杂医疗场景的能力。
本文介绍了PATHFinder Agent,一个端到端的对话式AI系统,该系统根据ACOG的PATH指南生成个性化产前护理计划,整合了患者信息采集、动态对话、计划合成及临床医生监督。对包括GPT-5.2在内的前沿大语言模型的评估显示出有希望但不完全的性能,凸显了产前检测建议方面的不足。
MissHyper是一种新的超图预测模型,通过在消息传递之前聚合共时间戳记录来恢复临床同步性,在PhysioNet 2012、MIMIC-III和MIMIC-IV基准测试上取得了一致的性能提升。
提出一种用于零样本ICU谵妄预测的轻量化知识注入框架,该框架在推理时用外部临床知识增强结构化电子健康记录数据摘要,在无需微调的LLaMA模型上,AUROC提升高达8.57个百分点。
本文构建了一个多维框架,用于评估基于机器学习的2型糖尿病风险预测模型的区分度、校准度、可解释性和算法公平性,揭示了在现实世界分布偏移下性能显著下降以及按年龄和肥胖程度存在的偏差。
CardioMeta是一个校准的多任务框架,用于在NHANES和MIMIC-IV数据上联合预测糖尿病、高血压和心血管疾病,强调泄漏控制、校准和透明可靠性。
梅奥诊所前研究主任指控该医院忽视了其AI工具(MAYA)的高错误率,并因她举报而进行报复,引发了关于AI在医疗保健中部署的严重担忧。
Pythia是一个多智能体系统,能够自主编写和优化用于临床概念的提取提示,无需手动提示工程或微调,使用本地托管的开放权重模型。在临床症状检测中,其平均敏感度为0.76,特异度为0.95,在特异度上优于基于词典的方法。
本研究提出了一种基于特征引导的零样本框架,利用大语言模型进行早期慢性肾病筛查,在异构数据集上使用最少的社区可获取特征实现了一致的改进。
提出了一种图约束遍历策略,将ICD-10-CM代码预测重构为在剪枝后的代码层级上的有限时域决策过程,在MIMIC-IV出院小结上优于平面基线。
本文提出了一种用于临床预测的显式多模态路由框架,利用EHR数据,通过离散的单模态、双模态和三模态路径,以及推理时路径掩码来模拟缺失模态,实现对结构化变量、临床笔记和胸部X射线的可解释、鲁棒且可审计的推理。
作者分享参与国内头部医院训练垂直医疗模型的个人观点,指出医疗数据不出医院、本地化部署成本高、付费意愿弱等核心挑战,并建议与硬件厂商绑定。同时认为通用医疗模型(如百川)已表现良好。
本综述考察了医学LLMs的最新进展,提出了一种连接临床实践与计算方法双重视角的方法,并引入了一个基准数据集,用于评估18个最先进模型的医学推理能力。
本文提出了FedDualAtt,一种用于ECG分类的个性化联邦学习方法,该方法将Transformer注意力头分为全局聚合和局部私有分支,以处理临床站点间的数据异质性。在FedCVD基准上的实验表明,其性能优于现有方法。
本文提出CISM,一种通道独立的频谱图框架,将缺失视为临床多变量时间序列预测中的预测信号。在MIMIC-IV上的实验表明,它在住院死亡率预测方面优于基线方法。
本文提出了一种基于注意力的多实例学习(ABMIL)框架,利用癌症登记处的患者级别标签来训练用于肿瘤组分类的深度学习分类器,无需每份报告的注释,在BC癌症登记处的任务上实现了0.83的宏F1。
生育公司正在利用AI通过更好地预测怀孕结果和筛选胚胎来提高试管婴儿成功率,尽管专家提出了伦理和隐私方面的担忧。2023年的一项审查发现,AI模型在预测成功怀孕方面比胚胎学家更准确。
本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。