标签
现在提供基于医疗维基百科文章的免费RAG API,可为本地LLM提供准确的医疗事实,通过纠正关于Lhermitte征的幻觉示例进行了展示。
MedGuards 提出了一种多智能体框架,通过专门智能体和置信度引导的仲裁机制来检测和纠正医疗文本中的错误,无需额外训练即可提升可靠性。在多语言临床记录上的实验表明,该框架带来了显著改进。
MMed-Bench-IR是一个跨六种语言的多语言医学信息检索异构基准,评估跨语言对齐、概念区分和证据检索。它揭示了非英语查询的严重性能下降,凸显了现有仅英语评估的不足。
该研究表明,人工智能可以使专家主导的旧病例定期再分析更具可扩展性,帮助临床医生随着医学知识的进步重新审视病例,挖掘值得调查的线索,并可能为更多此前难以分析的病例找到答案。
本文系统地综述了医学具身AI的核心组成部分,强调了在临床环境中感知、决策与行动的协同整合,并回顾了代表性应用、数据集及未来研究方向。
提出了MSAIC-Net,一种多尺度注意力增强的卷积网络,用于从心电图信号中检测心肌基质异常,采用不平衡感知对比学习和逐导联置换重要性以提高模型可解释性。
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。
本文提出了一个用于审计医疗多源RAG系统中来源依赖性的框架,发布了TransplantQA基准、HERO-QA检索策略以及一个结构化输出裁判,用于衡量跨来源答案关系。研究表明,更好的检索揭示出比先前估计更多的分歧,并主张将NLP评估从答案正确性转向跨来源关系分析。
提出 EAMS,一种轻量级等变网格分割框架,能够泛化到不同的解剖任务,并在细微特征上展现出等变性与准确性之间的权衡。
MedicalBench是一个新的基准测试,用于评估大型语言模型从电子健康记录中提取医学概念的能力,重点关注隐含推理和证据支撑。它包含823个专家标注的示例,并显示当前模型表现一般,突显了提取隐含表述的医学概念的难度。
COTCAgent是一个用于纵向电子健康记录的分层推理框架,采用概率链式思维完成方法,在自建数据集上达到90.47%的Top-1准确率,超越了现有的医疗代理。
OpenAI 推出 OpenAI for Healthcare,这是一套企业级产品,包括 ChatGPT for Healthcare 和 API 解决方案,旨在支持医疗组织采用符合 HIPAA 标准的人工智能。该产品提供针对医疗优化的 GPT-5 模型、带有引用的基于证据的检索、策略集成以及工作流自动化工具,这些工具已在斯坦福医学院和加州大学旧金山分校等主要机构中部署。