标签
本文介绍了LiverRisk,一个用于NAFLD风险预测的机器学习框架,它结合了梯度提升决策树和一致性预测,为个体风险评估提供校准后的无分布覆盖保证,在内部和外部队列上均实现了高AUROC。
PathPocket是一个多模态AI智能体协同助手,专门用于基于证据的病理学,利用全面的证据语料库和超图,在超过20万个真实病例上超越了现有最先进的方法。
本文评估了开源权重的大语言模型LLaMA 3.1在从荷兰语脑部MRI报告中自动提取结构化数据方面的表现。该模型在视觉评分方面取得了高性能,并准确检测了发现结果,而少样本提示改进了对数值变量的提取。
这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。
本文介绍了StenCE,一个预训练框架,利用ECG与X射线血管造影表征之间的跨模态对比学习,从ECG中检测重度冠状动脉狭窄,实现了高性能,并能够在无症状患者中实现早期诊断。
研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。
本文研究了基于大型语言模型合成数据微调的紧凑型任务特定双编码器是否能在非英语语言的临床编码检索中超越通用嵌入,并在西班牙语基准测试CodiESP和DISTEMIST上取得了最先进的结果。
EHRBench是一个自动化且可靠的基准测试,利用真实电子健康记录评估大语言模型在临床决策任务上的表现,涵盖诊断、治疗和预后任务,包含近100万个问答条目。
AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。
一位医疗专业人士分享了使用ChatGPT辅助诊断病理学的积极经验,展示了AI提供准确、详细分析的能力,其水平可与皮肤病理学家相媲美。
本文提出了一种混合神经符号流水线,用于从临床笔记中提取随访指令,使用BioBERT和确定性日期算术。与生成式基线相比,实现了高性能(Pair F1约0.99)。
本文针对医疗AI代理中的工具故障问题,提出了一种基于GRPO的强化学习框架,利用实例级选择、分歧感知协同学习和熵引导采样来纠正错误的工具共识,并在七个医疗基准测试中提高了可靠性。
MedGuideX 将临床实践指南转化为可执行的决策逻辑,以生成事实性和反事实性的问答数据用于训练医学大语言模型,在临床推理基准测试中实现了平均准确率相对提升 10.28%。
本文介绍HRVConformer,一种混合卷积-Transformer架构,用于直接从原始心率信号中分类新生儿缺氧缺血性脑病,实现了83.23%的AUC,性能优于ResNet50和Transformer等基线模型。
提出RAG4Outcome,一种整合多模态临床数据(PET-CT报告、手术记录、随访笔记)的检索增强生成框架,用于改善慢性骨髓炎的预后预测,增强可解释性和临床可靠性。
提出MedExpMem,一个经验记忆框架,使医学视觉语言模型能够从过往病例中积累和检索具有鉴别性的诊断经验,在放射学基准上将鉴别诊断准确率最多提升7.0%。
Marc Andreessen在Joe Rogan播客中分享了17个关于AI的极具争议的观点,包括声称AGI已经到来,顶级模型超越人类专家,以及AI正在改变医学、心理治疗、编程和科学。
本研究评估了提示语言(英语与法语)如何影响五个大型语言模型的诊断推理和准确性,使用了180个临床案例,发现大多数模型在英语下表现显著更好,只有o3是例外。
本文提出了一种残差间隙感知变换器,将混合效应统计参考与基于变换器的残差学习相结合,利用ADNI临床和生物标志物历史数据预测24个月CDR-SB变化,在均方误差和相关性上均优于基线模型。