迈向自主且可审计的医学影像模型开发
摘要
介绍AMID,一个用于医学影像模型开发的自主多智能体框架,利用LLM智能体来规划、执行和验证实验。在20项医学影像任务中,它优于通用MLE系统,并接近人类设计的解决方案。
查看缓存全文
缓存时间: 2026/07/15 16:22
论文页面 - 走向自主且可审计的医学影像模型开发
来源: https://huggingface.co/papers/2607.10522 作者:
,
,
,
,
,
,
,
,
,
摘要
大语言模型(LLM)智能体正通过结合规划、代码执行、调试和经验反馈,开始自动化机器学习工程(MLE)。将这一能力迁移到医学影像仍面临困难,因为每项任务都施加了针对特定模态的实验要求、严格的验证协议标准以及预测工件的约束。本文提出AMID,一个用于医学影像模型开发的自主多智能体框架。AMID首先提出数据条件化方法规划(Data-Conditioned Method Planning),将粗糙的任务级搜索空间精炼为可执行、可并行化的方法通道(method lanes),这些通道基于任务特定数据分析和可运行的医学影像资源。随后,它发展出验证引导的两阶段优化(Verification-Guided Two-Stage Optimization),从对多样化方法通道的广泛早期探索转向对有前景候选者的选择性利用,同时在优化全程对验证协议、指标计算和预测工件实施严格验证。在跨越多种模态和预测类型的20项医学影像挑战任务中,AMID的表现优于所评估的通用MLE系统,并在几项任务上接近或媲美人类设计的强挑战解决方案。这些结果表明,AMID能够将特定任务的医学影像模型开发从定制的繁琐手工工程转化为一种智能体工作流,从而在异质任务中产生高性能且可审计的模型工件。
查看 arXiv 页面 (https://arxiv.org/abs/2607.10522) 查看 PDF (https://arxiv.org/pdf/2607.10522) GitHub (9) (https://github.com/CUHK-AIM-Group/AMID) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10522)
在你的智能体中获取该论文:
hf papers read 2607.10522
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 (0)
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.10522 以在此页面建立链接。
引用该论文的数据集 (0)
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.10522 以在此页面建立链接。
引用该论文的 Spaces (0)
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.10522 以在此页面建立链接。
包含该论文的收藏 (0)
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以在此页面建立链接。
相似文章
AutoMedBench:迈向基于智能体AI模型的医学自动研究
AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。
MedAction:迈向主动式多轮临床诊断大语言模型
本文介绍了 MedAction 框架,该框架通过模拟迭代式的检查开具与假设更新,训练大语言模型(LLM)进行主动的多轮临床诊断。文章提出了一个新的数据集 MedAction-32K,并展示了开源模型在医学基准测试上的最先进水平(SOTA)性能。
一个用于医学大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。
MedExAgent:在嘈杂的临床环境中训练大语言模型代理进行询问、检查与诊断
本文介绍了 MedExAgent,这是一个将临床诊断形式化为部分可观测马尔可夫决策过程(POMDP)以处理嘈杂和不完整信息的框架。该框架提出了一种结合监督微调与强化学习的两阶段训练流程,以提高医疗大语言模型的诊断准确性和成本效益。
IMCBench:面向图像基础医疗对话的多模态大语言模型基准
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。