标签
Midjourney 宣布成立名为“Midjourney Medical”的新部门,强调其不依赖风险投资、自筹资金的成功。
OpenAI宣布通过使用GPT-5.5 Instant,在ChatGPT中显著提升了健康相关回答的质量,其准确性与前沿模型相当,并通过医生主导的评估将事实性问题减少了71%。
本文介绍了ClaMPAPP,一种混合架构,使用LLM作为接口从临床叙述中提取特征,然后将这些特征传递给XGBoost分类器进行儿童阑尾炎诊断,展示了相比端到端LLM基线更高的鲁棒性和安全性。
Midjourney CEO David Holz 宣布了 Midjourney Scanner,这是一款使用 Butterfly Network 芯片的全身超声波设备,并计划在旧金山开设一家水疗中心,用于预防性扫描。
本文提出自适应分箱(Adaptive Binning),一种针对表格自监督学习的、与学习过程耦合的特征级粗到细课程,能够自适应地离散化特征,在医学数据集上提升表示质量,并建立了统一的基准测试。
Google的研究表明,其医疗AI——AMIE能够长期有效管理健康状况,在推理能力上与临床医生相当,在计划的精确性和与指南的一致性方面更胜一筹,据发表在Nature上的一项研究所示。
RubricsTree 提出了一种可扩展且与专家对齐的个人健康智能体评估框架,使用超过100个原子布尔规则,在Gemini、GPT和Qwen模型系列的HealthBench上实现了高达66%的相对提升。
介绍了AIPatient Arena,一个基于电子健康记录的评估框架,用于评估大语言模型在临床能力的多个维度。研究揭示了在问诊和伦理方面的优势,但在处理模糊性和诊断准确性方面的弱点。
本文系统评估了用于多模态癌症分析的基础模型表征,在真实世界队列上对单模态与多模态融合策略进行基准测试,并通过共形预测评估可信度。
ACIE是一款用于临床信息提取的智能体RAG系统,在核医学医师对7,326个实例的判断中达到96.5%的接受率,解决了异质性患者背景和缺失元数据的挑战。
PRAG框架将传统RAG与波你尼规则引擎相结合,用于更安全的医疗AI,在MedQA上实现了不安全答案减少71%。它提供可审计的规则追踪,并且是开源的。
本文提出了VIBEMed,一种具有自进化机制和安全沙箱的多智能体框架,用于稳健的临床决策支持,集成了专门用于诊断、治疗计划以及随时间演化临床知识的智能体。
本综述回顾了知识图谱在医学中五个关键领域——临床决策支持、疾病预测、健康推荐系统、精准医学和医学问答——中的应用,讨论了挑战与未来方向。
MedLatentDx提出了一种用于跨医院罕见病诊断的潜在多智能体通信框架,利用潜在KV块共享诊断证据而不暴露临床文本,并引入了CrossRare-Bench基准测试。
文章展望了2050年的未来:家家有AI助手、教育个性化、医疗先进、城市智慧,人机协作普及。
本文介绍了LungKG,这是第一个结构化的肺部知识图谱,以及Lung-R1,这是一个通过知识图谱约束推理和强化学习训练的大语言模型,用于从电子病历中进行肺部诊断推理。Lung-R1-14B在电子病历诊断上达到了最先进的性能。
本文介绍了LiverRisk,一个用于NAFLD风险预测的机器学习框架,它结合了梯度提升决策树和一致性预测,为个体风险评估提供校准后的无分布覆盖保证,在内部和外部队列上均实现了高AUROC。
PathPocket是一个多模态AI智能体协同助手,专门用于基于证据的病理学,利用全面的证据语料库和超图,在超过20万个真实病例上超越了现有最先进的方法。
本文评估了开源权重的大语言模型LLaMA 3.1在从荷兰语脑部MRI报告中自动提取结构化数据方面的表现。该模型在视觉评分方面取得了高性能,并准确检测了发现结果,而少样本提示改进了对数值变量的提取。
这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。