标签
就诊问问能力升级,从健康问答扩展到持续守护,做通用 AI 工具不做也不愿做的事。
这篇《Wired》文章探讨了人工智能如何通过分析电子健康记录和实验室报告,更早地发现脂肪肝,从而有望预防并逆转肝脏损伤。
本文介绍了反事实临床审计(CCA)框架,用于评估ICU脓毒症管理的离线强化学习智能体,揭示了‘毒性模仿’——智能体复制标准指标无法检测的有害治疗模式。使用MIMIC-III数据,表明医学决策Transformer在乳酸升高时未能升级血管加压药,而因果Transformer表现安全。
介绍了TAF-MED,一个经过医生审查的500个多轮医疗安全场景基准,表明当用户声明自我治疗意图时,大型语言模型常常从安全的初始拒绝崩溃为不安全的响应。对8个大型语言模型在4000个对话中的评估发现,71.6%的对话包含不安全响应,而首轮安全性不足以作为对话安全持续性的代理指标。
Google Research 和 Google DeepMind 的 AMIE 医疗 AI 系统在一项首创性随机研究中展示了专家级的实时视听临床会诊能力,临床评估人员在核心能力方面给予其好评。
微软研究院推出了CARE-X,一个统一的胸部X射线视觉-语言模型,它结合了灵活推理、校准预测和工具增强测量,用于临床有用的放射学解读。
Google 开发了一款 AI 医生,通过在线强化学习在模拟医疗住院实习中进行训练,诊断准确率达到 88%,并且在 87.6% 的盲法比较中优于委员会认证的专家。该系统能处理长程患者对话和对抗性模拟患者,标志着临床 AI 的重大飞跃。
一篇研究论文提出了一种潜在神经微分方程框架,可从稀疏测量数据推断未知凝血参数并预测血栓增长,其中随机神经微分方程取得了最佳预测性能。
中国BGI-Research的研究人员发布了OneGenome,这是一个开源AI系统,可解读基因突变用于临床诊断,性能优于DeepSeek-v4等通用大语言模型,旨在缩短罕见病患者的诊断之路。
本文介绍了Guideline-as-Oracle(GAO),一种通过将美国眼科学会指南编译成70行规则表并用于生成3000个训练对话,从而对多轮眼科电话分诊代理进行零标注训练的方法。在此语料上微调一个9B模型,可将与操作参考的一致性从61.7%提升至74.1%,紧急病例召回率从9.5%提升至69.0%,且在推理时无需前沿模型即可超越多个通用系统。
介绍了RESPClinBench,一个用于呼吸科临床决策的真实世界场景基准,评估了七个LLM在COPD和肺结节病例上的表现。发现了任务特定的局限性,包括影像幻觉和用药安全风险。
ClinFusion 是阿里巴巴达摩院推出的新开源医学多模态 LLM,提供 8B 和 32B 两种参数规模(Apache 2.0),具备统一的 2D + 3D 图像理解能力,并在医学基准测试上取得了最先进的结果。
本文介绍了PatTree,一种基于图的多模态患者表示方法,能够自动对异构临床数据进行结构化处理,以用于医学分类任务。在ADNI-1队列上,它达到了最先进的性能,阿尔茨海默病分类的平衡准确率为98.5%。
介绍了OncoTriad-QA,一个整合放射学、病理学、基因组学和临床数据的患者级基准,用于泛癌推理;同时介绍了OncoVLM,一个参考多模态模型,在微调后性能优于现有的医学大语言模型。
TumorBoard 是一个用于纵向神经肿瘤学的多智能体决策支持系统,它利用共享的纵向病例状态和可审计的声明-证据账本。在包含360个病例的基准测试中,它优于基线模型,并且安全治理机制减少了有害推荐。
介绍了MedPIC-Bench,一个包含反事实问题的基准测试,用于评估大型语言模型在患者特定条件变化时是否正确应用药物安全规则;在28个LLM中,反事实问题的准确率显著下降,揭示了模型普遍无法修正判断的缺陷。
《自然医学》上一项由MIT主导的新研究发现,AI辅助和可解释性方法对皮肤病诊断准确率的影响因用户专业水平而异:非专家过度信任AI解释,而临床医生仅在模型预测(无解释)时表现最佳。结果凸显了考虑自动化偏见的以用户为中心的AI设计之必要性。
TreeProbe 是首个针对大语言模型中藏医学文化偏见的基准,包含 4,719 个专家裁决条目,覆盖 467 种疾病和 10 个子任务,揭示了当前模型中系统性的外部本体漂移。
EarlyDx is a new large-scale benchmark for evaluating LLMs on open-ended, evidence-supported diagnosis generation at emergency department admission, built from 154,834 MIMIC-IV encounters. It reveals that even frontier and medical-specialized models struggle to synthesize admission-time evidence, with post-training only partially improving inference-dependent recall.