标签
提出FOCUS,一种通过正交分解和专家门控模块解耦大语言模型中专家人格的微调方法,在金融、法律和医学基准上提高了特定领域任务的准确性。
Reasoning-Medical-27B 是一个基于 Qwen3.6-27B 微调的高级医学推理模型,使用 GRPO 和 Unsloth 优化方法,在 37 万个问答示例上通过思维链推理进行训练。
MedLoCoMo 是一个新基准,用于评估大语言模型在长上下文、多会话医疗对话推理上的表现,基于 MIMIC-IV 数据构建。它测试了单次入院、跨入院以及对抗性不可回答的问题,揭示出即使对于拥有长上下文窗口的模型,跨入院推理仍然具有挑战性。
本文研究了医学语言模型中的跨语言临床正确性漂移,发现本地可部署模型在用豪萨语查询时相比英语表现出显著的安全退化,而前沿模型保持能力,突显了低资源环境中安全评估的关键差距。
本文介绍了ThReadMed-QA多轮医疗对话数据集,并评估了五种大语言模型在纠正患者误解方面的表现,发现后续轮次中性能显著下降。
MedRealMM是一个基于真实医患交互构建的新的多模态基准,用于评估大语言模型在在线医疗咨询中的下一响应生成能力,并配有临床评价标准。
OpenMed 1.8 是一款 Apache-2.0 临床去标识化工具包,完全本地运行,新增对 Android、iOS 和浏览器平台的支持,并邀请社区为 1.9 版本贡献力量。
MedPMC是一个自动化框架,将医学文献转化为用于基础模型的高保真多模态数据,在多个基准测试和临床场景中取得了显著改进。
本文介绍了MedCalc-Pro,这是一个新的基准测试,用于评估LLMs在复杂医疗计算中的表现,涉及单计算器、多计算器和嵌套计算器设置,以及一个通过多工具选择和结构化验证提升性能的代理框架。
一条推文分享了一篇《自然·医学》的文章,但由于浏览器问题,链接内容显示为错误页面。
FaithMed 是一个框架,通过将临床医生设计的评分标准与使用步骤级过程奖励分配的强化学习相结合,训练LLMs进行忠实的循证医学推理,在多个医学基准上相比基线取得了显著改进。
本文提出MedKGTab,一种知识注入框架,利用生物医学知识图谱扩展表格医疗数据中的跨域特征,通过生成高保真生物医学档案解决数据稀缺问题。
本文适配了一个混合专家扩散语言模型DiffusionGemma-26B用于交互式放射报告起草,结果表明其在医学视觉问答中匹配或超越自回归模型,解码速度提高3.5-4.4倍,并具备双向填充能力。
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。
本文提出TriageRA-CCF,一种用于医学问答中LoRA自适应秩预算的方法。它利用源端信号(基座模型置信度、临床覆盖、反事实代理)动态选择秩预算,在Qwen3-8B和Llama3.1-8B上取得了适度的准确率提升。
成立一年后,OpenMed已实现3.4亿次模型下载,提供超过1500个采用Apache 2.0许可的开放医学模型,其中650+个能够在iPhone上本地运行。
本文应用集成机器学习模型(随机森林、梯度提升、XGBoost、极端随机树)检测丙型肝炎患者的肝硬化,使用了来自2038名埃及患者的28个特征。极端随机树模型仅用16个特征就达到了96.92%的准确率,优于其他模型。