迈向自主且可审计的医学影像模型开发

Hugging Face Daily Papers 论文

摘要

介绍AMID,一个用于医学影像模型开发的自主多智能体框架,利用LLM智能体来规划、执行和验证实验。在20项医学影像任务中,它优于通用MLE系统,并接近人类设计的解决方案。

大型语言模型(LLM)智能体正通过结合规划、代码执行、调试和实证反馈来开始自动化机器学习工程(MLE)。将这一能力迁移到医学影像领域仍然困难,因为每项任务都要求模态特定的实验以及对验证协议和预测产出的严格规定。本文介绍AMID,一个用于医学影像模型开发的自主多智能体框架。AMID首先提出数据条件化方法规划(Data-Conditioned Method Planning),将粗略的任务级搜索空间细化为可执行、可并行化的方法通道,这些通道基于任务特定的数据分析和可运行的医学影像资源。随后,它开发了验证引导的两阶段优化(Verification-Guided Two-Stage Optimization),从对多样化方法通道的广泛早期探索转向对候选方案的选择性利用,同时在优化过程中严格执行对验证协议、度量计算和预测产出的验证。在涵盖多种模态和预测类型的20项医学影像挑战任务中,AMID优于所评估的通用MLE系统,并在多个任务上接近或媲美强大的手工设计的挑战解决方案。这些结果表明,AMID能够将任务特定的医学影像模型开发从定制化手工工程转变为一种智能体工作流,用于在异构任务上生成高性能且可审计的模型产出。
查看原文
查看缓存全文

缓存时间: 2026/07/15 16:22

论文页面 - 走向自主且可审计的医学影像模型开发

来源: https://huggingface.co/papers/2607.10522 作者:

,

,

,

,

,

,

,

,

,

摘要

大语言模型(LLM)智能体正通过结合规划、代码执行、调试和经验反馈,开始自动化机器学习工程(MLE)。将这一能力迁移到医学影像仍面临困难,因为每项任务都施加了针对特定模态的实验要求、严格的验证协议标准以及预测工件的约束。本文提出AMID,一个用于医学影像模型开发的自主多智能体框架。AMID首先提出数据条件化方法规划(Data-Conditioned Method Planning),将粗糙的任务级搜索空间精炼为可执行、可并行化的方法通道(method lanes),这些通道基于任务特定数据分析和可运行的医学影像资源。随后,它发展出验证引导的两阶段优化(Verification-Guided Two-Stage Optimization),从对多样化方法通道的广泛早期探索转向对有前景候选者的选择性利用,同时在优化全程对验证协议、指标计算和预测工件实施严格验证。在跨越多种模态和预测类型的20项医学影像挑战任务中,AMID的表现优于所评估的通用MLE系统,并在几项任务上接近或媲美人类设计的强挑战解决方案。这些结果表明,AMID能够将特定任务的医学影像模型开发从定制的繁琐手工工程转化为一种智能体工作流,从而在异质任务中产生高性能且可审计的模型工件。

查看 arXiv 页面 (https://arxiv.org/abs/2607.10522) 查看 PDF (https://arxiv.org/pdf/2607.10522) GitHub (9) (https://github.com/CUHK-AIM-Group/AMID) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.10522)

在你的智能体中获取该论文:

hf papers read 2607.10522

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 (0)

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.10522 以在此页面建立链接。

引用该论文的数据集 (0)

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.10522 以在此页面建立链接。

引用该论文的 Spaces (0)

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.10522 以在此页面建立链接。

包含该论文的收藏 (0)

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以在此页面建立链接。

相似文章

AutoMedBench:迈向基于智能体AI模型的医学自动研究

Hugging Face Daily Papers

AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。

MedAction:迈向主动式多轮临床诊断大语言模型

arXiv cs.CL

本文介绍了 MedAction 框架,该框架通过模拟迭代式的检查开具与假设更新,训练大语言模型(LLM)进行主动的多轮临床诊断。文章提出了一个新的数据集 MedAction-32K,并展示了开源模型在医学基准测试上的最先进水平(SOTA)性能。

IMCBench:面向图像基础医疗对话的多模态大语言模型基准

arXiv cs.AI

IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。