一种用于CT扫描中可靠且可审计的空间关系验证的模块化代理
摘要
本文提出了一种模块化的医学成像代理,通过将任务分解为解析、定位和几何规则来验证CT扫描中的空间关系,实现了94.1%的准确率,并在基准测试中以42.5个百分点的优势超越了端到端视觉语言模型,同时确保了可审计的推理过程。
查看缓存全文
缓存时间: 2026/08/27 11:19
论文页面 - 用于CT扫描中可靠且可审计空间关系验证的模块化智能体
来源:https://huggingface.co/papers/2608.21140
摘要
模块化医学成像智能体将空间关系验证分解为解析、解剖定位和几何规则,在CT空间推理任务上超越端到端视觉-语言模型。
可靠的空间理解是未来医学视觉-语言系统支持放射报告生成和结构化图像理解的重要前提。虽然现代视觉-语言模型(https://huggingface.co/papers?q=vision-language%20models)(VLMs)在许多医学成像任务上展现出良好性能,但近期证据表明它们在可控空间推理(https://huggingface.co/papers?q=spatial%20reasoning)方面仍然薄弱,且往往无法可靠地将空间关系与图像证据关联。鉴于放射学推理依赖于理解解剖结构和发现的相对位置,这种空间推理弱点对诊断准确性构成风险。我们提出一种模块化医学成像智能体,用于轴位CT切片的二元空间关系验证。该系统不再直接端到端预测空间答案,而是将任务分解为明确的阶段:语言解析、解剖定位(https://huggingface.co/papers?q=anatomical%20localization)和确定性几何验证(https://huggingface.co/papers?q=deterministic%20geometric%20verification)。自然语言查询被转换为结构化关系元组,目标器官通过基于YOLO的检测器(https://huggingface.co/papers?q=YOLO-based%20detector)进行定位,最终空间决策基于目标中心点使用确定性几何规则计算得出。我们在保留的MIRP空间问答基准测试(https://huggingface.co/papers?q=MIRP%20spatial%20QA%20benchmark)上评估了该方法,并与代表性端到端VLM基线进行比较。表现最佳的混合配置达到94.1%准确率和94.2% F1值,在保持可解释中间表示和可审计推理阶段的同时,比直接Qwen2-VL(https://huggingface.co/papers?q=Qwen2-VL)提示方法的准确率高出42.5个百分点。结果表明,显式模块化空间验证可作为未来面向报告的医学成像智能体的有前景构建模块。
查看arXiv页面 (https://arxiv.org/abs/2608.21140) 查看PDF (https://arxiv.org/pdf/2608.21140) GitHub0 (https://github.com/DeveloperNomis/MICCAI-Medical-Agent) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.21140)
引用本文的模型0
暂无链接本文的模型
在模型README.md中引用 arxiv.org/abs/2608.21140 即可从本页链接该模型。
引用本文的数据集0
暂无链接本文的数据集
在数据集README.md中引用 arxiv.org/abs/2608.21140 即可从本页链接该数据集。
引用本文的空间0
暂无链接本文的空间
在空间README.md中引用 arxiv.org/abs/2608.21140 即可从本页链接该空间。
包含本文的收藏集0
暂无包含本文的收藏集
将本文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接。
相似文章
RadAgent:用于胸部CT逐步解读的工具型AI代理
RadAgent是一种使用工具的AI代理,通过可解释的逐步推理生成胸部CT报告,将临床准确率相对提升36.4%,并实现37%的忠实度——这是现有3D视觉语言模型所不具备的能力。该系统提供完全可检查的推理轨迹,使临床医生能够验证和优化诊断输出。
用于放射学报告结构化和质量保证的多智能体AI系统及独立放射科医生评估
本文介绍了一种本地部署的多智能体AI系统,用于放射学报告结构化和质量保证,放射科医生评估显示其性能良好。
迈向自主且可审计的医学影像模型开发
介绍AMID,一个用于医学影像模型开发的自主多智能体框架,利用LLM智能体来规划、执行和验证实验。在20项医学影像任务中,它优于通用MLE系统,并接近人类设计的解决方案。
质询的艺术:一致性增强空间推理中的事实性
本文提出一种自监督强化学习框架,利用一致性验证器(检查变换下几何和语义一致性的奖励函数)来提升大型推理模型的空间推理能力,无需真实标注。该方法接近监督微调的准确率,并能泛化到多种任务。
SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。