标签
本文探讨了人为干预在多智能体医疗系统中的故障点如何影响诊断准确性,正确干预可提高准确性,错误干预则会导致性能下降。
本研究探讨了如何通过编码的GenAI虚拟患者对话,为医学教育中的临床推理提供教师可解释的过程证据,利用学习分析来分析医学生的对话日志。
本文评估了治疗机器人对Generation Alpha的安全风险,发现大型语言模型难以正确校准临床风险,导致显著的词汇理解差距,可能造成危机遗漏。
ClinFusion 是阿里巴巴达摩院推出的新开源医学多模态 LLM,提供 8B 和 32B 两种参数规模(Apache 2.0),具备统一的 2D + 3D 图像理解能力,并在医学基准测试上取得了最先进的结果。
介绍GuideSkill,一种外部推理层,将临床实践指南编译为可执行的诊断技能,在无需更新骨干模型的情况下提高LLM在临床推理基准上的准确性。
DeepLens诊断代理采用五阶段智能体工作流,结合小型医疗推理模型(7B),在包含915个病例的基准测试中实现了60.14%的诊断准确率,以更低成本超越了Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大语言模型。仅工作流设计就比基础模型提升了36个百分点,表明结构化流程约束对于诊断推理至关重要。
本文首次严格研究了LLM水印方案如何影响医学性能,在多个LLM和VLM上评估了五种水印在临床推理任务中的效果。作者发现,水印可能导致医学文本质量下降,包括幻觉和词汇损坏,而这些在通用领域的基准测试中被掩盖。
Cura 1T 是一款专注于医疗领域的LLM,通过人工门控的自我进化循环进行训练,该循环在患者咨询、临床推理和智能体医疗任务上不断改进,在医学基准测试中取得了顶尖性能,同时保持了通用推理能力。
本文为血液肿瘤学中的临床推理开发了一个代理式评估框架,发现大语言模型的主要失败原因在于系统性的信息寻求缺陷,而非知识不足,其错误模式类似于新手临床医生的认知偏差。
本文评估了检索增强生成(RAG)与长上下文提示在电子健康记录临床推理任务中的表现,发现RAG在令牌效率上具有竞争力,尤其在影像提取和抗生素时间线重建方面表现突出。
本文介绍HCC-STAR,一个临床对齐的大语言模型,用于肝细胞癌的风险分层和治疗指导,旨在通过利用电子病历改进精准治疗。
AegisDx是一个面向安全的框架,它利用专门的LLM组件和验证门进行假设演绎临床推理,在医学病例报告上,将鉴别诊断准确率比单独的LLM提高了7-17个百分点。
CLExEval 引入了一种人机交互框架,用于在渐进信息遮蔽条件下评估 LLM 临床推理,揭示了 GPT-4o-mini 和 HuatuoGPT-o1 等模型中存在的失败模式,如冗长偏见、隐藏知识悖论以及推理与输出不匹配。
介绍MRPO,一种利用步骤过程奖励来减轻临床多模态推理中级联错误的强化学习算法,在医学VQA基准上优于现有方法。
本文介绍了SkeMex,一个自我演进的框架,通过将交互轨迹提炼为结构化技能记忆来增强医学智能体,并利用上下文相关的效用估计与治理实现更好的长期临床推理。
ChatHealthAI 是一个多模态推理框架,它将结构化 EHR 表示与冻结的 LLM 对齐,从而在保持预测性能的同时实现基于临床的推理。
MedGuideX 将临床实践指南转化为可执行的决策逻辑,以生成事实性和反事实性的问答数据用于训练医学大语言模型,在临床推理基准测试中实现了平均准确率相对提升 10.28%。
SEMA-RAG是一种自进化多智能体RAG框架,用于医学问答,它将解读、探索和裁决解耦为三个专业智能体,在多个基准测试中相较于基线取得了显著的准确率提升。
ClinSeekAgent是一个自动化智能体框架,使大语言模型能够主动从原始数据源获取和综合多模态临床证据,提高纯文本和多模态任务中的决策准确性。它引入了ClinSeek-Bench基准和一个蒸馏模型ClinSeek-35B-A3B,该模型在智能体临床推理上取得了强劲性能。
本文介绍了Checkup2Action,这是一个用于从临床体检报告生成面向患者的行动卡片的多模态数据集和基准测试,旨在解决普通患者理解医疗报告的困难。