标签
本研究评估了九种心电图基础模型在Brugada综合征检测中的表现,发现预训练提供了优化稳定性,但未提供可迁移的临床知识,这对大规模预训练对罕见疾病有益这一假设提出了挑战。
作者感叹医院是思考AI价值的好地方,但AI在医疗领域的实际应用仍未带来普惠性突破,例如Fable 5和豆包等AI工具的效果有限。
本文介绍了IRFE-ECG,一种用于持续ECG部署的方法,该方法利用ECGFounder的冻结特征将专家保留与自主源推断分离,在无需回放原始ECG的情况下实现了强劲性能。
本文改编了一种扩散语言模型用于交互式放射学报告起草,表明其在准确性上与自回归模型相当,同时提供独特的填充能力,使放射科医生能够修复报告片段并让模型填充它们之间的文本。
本文提出了一种结合稀疏随机投影与多项逻辑回归的新型机器学习方法,用于从DNA甲基化数据中对中枢神经系统肿瘤进行分类,其准确率较现有方法提高了4-5个百分点,达到了最先进水平。
介绍RareDxR1,一种端到端的以推理为中心的大语言模型,用于从非结构化临床笔记中进行开放域罕见病诊断,采用渐进式训练框架和反思增强推理采样,实现了最先进的准确率。
CLExEval 引入了一种人机交互框架,用于在渐进信息遮蔽条件下评估 LLM 临床推理,揭示了 GPT-4o-mini 和 HuatuoGPT-o1 等模型中存在的失败模式,如冗长偏见、隐藏知识悖论以及推理与输出不匹配。
本文提出了一种多视图门控图注意力网络,用于从自发言语中检测阿尔茨海默病,利用语义图、依存图和共现图,并采用自适应门控融合机制。该模型在ADReSSo数据集上达到90.00%的准确率,源代码已公开。
本文报告了一项针对临床AI工具的盲评,采用医生在临床即时提出的真实查询,比较了专用模型与通用模型在五个维度上的表现。专用工具(OpenEvidence)在所有维度上均优于通用模型,作者同时发布了Real-POCQi基准测试集。
MedEvoEval是一个纵向评估医生代理的框架,它模拟门诊病例,评估代理如何获取证据、使用资源,并通过记忆和反思机制在多个病例中进化。
本文表明,大型语言模型在内部编码了临床证据对主张的强度,但在被询问时未能准确表达这一强度,其陈述的证据等级表现近乎随机。
NASA 正在测试 Red Hat 的开放源代码工具 RamaLama,以在深空任务中为医疗 AI 助手运行本地 LLM 和 VLM 推理,实现无需与地球通信的自主实时诊断。
作者使用Claude Code(搭配Opus 4.8)分析MRI扫描,发现与初始诊断存在差异,并讨论了AI在医学影像解读中的潜力与局限性。
本文提出了临床管控框架,一种用于注册、编排、保护和监控AI赋能临床能力的运行时治理架构,并以骨质疏松症为例进行演示。
本文介绍了RaDaR,一个320亿参数的开源推理型大语言模型,基于公开和合成的罕见病病例进行训练。在诊断基准测试中,其表现优于DeepSeek-R1等更大模型,并在随机试验中将医生诊断准确率提升了21.44个百分点。
MedBench v5 是一个面向临床多模态模型的动态、过程导向的基准测试,集成了幻觉检测和压力测试,超越静态问答,评估在信息流压力下的推理和稳定性。
本文介绍了REVEAL++,一种用于视觉-语言对比学习的可微分表型分组方法,应用于视网膜眼底图像和临床风险叙述,以预测阿尔茨海默病风险,其性能优于离散分组基线方法。
来自Boston Children's Hospital、Harvard和OpenAI的研究人员使用OpenAI o3 Deep Research reasoning模型重新分析了376例未解决的罕见疾病病例,经过专家审查和临床确认后,额外确诊了18例(确诊率4.8%)。这项发表在NEJM AI上的研究展示了人工智能辅助工作流程如何帮助专家在科学知识不断发展的情况下重新审视疑难病例。
OpenAI 强调 o3 Deep Research 如何通过整合临床特征、遗传模式、变异证据和科学文献,为专家提供可操作的假设,从而帮助罕见病诊断。
Midjourney 宣布成立名为“Midjourney Medical”的新部门,强调其不依赖风险投资、自筹资金的成功。