标签
本文介绍R-GEAN,一个用于预测住院期间药物变更的非对称候选评分网络,并建立了一个泄漏控制的基准以准确评估编辑级别的性能。
本文设计了一个用于多模态医学图像智能诊断的四层实验教学系统,将研究成果转化为本科实验室教学,以解决临床人工智能教育中的空白。
斯坦福+牛津关于 MedRSI 的论文显示,医疗AI智能体可以通过在新患者身上测试新能力并使用防护栏来保持准确性,从而从错误中自我改进。
该研究系统评估了用于预测阿片类药物使用障碍治疗保留的机器学习模型中的算法公平性,发现患者亚组之间存在性能差距,并评估了具有权衡的偏差缓解技术。
Vals AI 对 Grok 4.7 进行了评估,发现其在 Vals 指数中排名第 24,得分 54.2%,较 Grok 4.6 下降,但在法律和医疗领域显示改进。
本研究表明,使用全血细胞计数(CBC)数据的机器学习模型在区分儿科患者的细菌和病毒感染方面优于单独的CRP。
PhysioBench引入了一个统一的生理信号问答基准,整合22个数据集成6140万道问题,涵盖30项任务,以评估各种AI模型的性能。
TALON 引入了一个用于放射学报告生成的时间感知纵向框架,该框架通过双通道时间融合模块适应性地整合可变长度的患者病史,以提高检测间期变化和持续发现的准确性。
HERMES 是一个基于图的框架,它通过LLM引导的提取和对比逻辑建模,从临床笔记构建个性化知识图谱,并应用图注意力网络以改善患者预后预测,在MIMIC数据集上性能优于仅文本基线。
Neuralink的脑机接口通过实时解码神经信号使ALS患者能够恢复语言能力,展示了通信技术的重大突破。
本文提出了一种新的统一预训练框架,用于医学代码序列,能够捕获层次结构和复杂交互,并在临床事件预测和阿尔茨海默病的药物重定位案例研究中展示了优越的性能。
本文展示了利用 Sharpness-Aware Minimization (SAM) 来增强机器学习模型在分类细菌拉曼光谱数据时的泛化能力,将精度提高了高达 10.5%,并推进了用于抗菌素耐药性的便携式诊断工具。
本文提出CLEAR,一种用于跨源证据裁决的代理框架,旨在通过处理来自多个知识源的冲突来提升医学领域大语言模型的性能。该框架在多个基准测试中表现出竞争力,在直接推理或检索能力较弱的场景中取得了显著提升。
本文介绍了R-U-Net,一种ECG分界模型,将ResNet-18编码器与U-Net解码器配对,在半监督学习设置中取得了优于现有方法的性能。
本文介绍了Japanese Stroke LLM Evaluation,一个用于评估大型语言模型在日语安全卒中护理中的对话基准,显示Claude Fable 5获得了最高分并满足安全阈值,而其他模型犯了严重错误。
本文提出了一个用于衡量大型语言模型临床时序推理中后见之明偏差的基准,表明暴露于未来数据会导致偏差,而时间掩蔽能降低偏差且不降低准确性。
本文提出了 MedSNIP,一种片段级的医学事实验证方法,以及配套的人工标注基准 MedSNIP-Bench。研究证明该方法在保持临床结构和减少验证器调用方面具有改进效果。
本文开发并比较了深度强化学习策略,用于在肿瘤异质性下的自适应化疗给药,揭示了虚拟患者队列中肿瘤减少疗效和给药一致性之间的权衡。