一种用于CT扫描中可靠且可审计的空间关系验证的模块化代理

Hugging Face Daily Papers 论文

摘要

本文提出了一种模块化的医学成像代理,通过将任务分解为解析、定位和几何规则来验证CT扫描中的空间关系,实现了94.1%的准确率,并在基准测试中以42.5个百分点的优势超越了端到端视觉语言模型,同时确保了可审计的推理过程。

可靠的空间理解是未来旨在支持放射学报告生成和结构化图像理解的医学视觉语言系统的重要前提。虽然现代视觉语言模型(VLMs)在许多医学成像任务上表现出色,但最近的证据表明它们在受控空间推理方面仍然薄弱,且常常无法可靠地将空间关系与图像证据关联起来。鉴于放射学推理依赖于理解解剖结构和发现的相对位置,这种空间弱点对诊断准确性构成了风险。我们提出了一种用于轴向CT切片中二元空间关系验证的模块化医学成像代理。该系统不是直接端到端地预测空间答案,而是将任务分解为明确的阶段:语言解析、解剖定位和确定性几何验证。自然语言查询被转换为结构化关系元组,查询的器官通过基于YOLO的检测器进行定位,最终的空间决策使用确定性几何规则从对象中心计算得出。我们在保留的MIRP空间QA基准上评估了该方法,并将其与代表性的端到端VLM基线进行比较。最佳混合配置达到94.1%的准确率和94.2%的F1分数,在准确率上比直接使用Qwen2-VL提示高出42.5个百分点,同时保持了可解释的中间表示和可审计的推理阶段。结果表明,显式模块化空间验证可以作为未来面向报告的医学成像代理的一个有前景的构建块。
查看原文
查看缓存全文

缓存时间: 2026/08/27 11:19

论文页面 - 用于CT扫描中可靠且可审计空间关系验证的模块化智能体

来源:https://huggingface.co/papers/2608.21140

摘要

模块化医学成像智能体将空间关系验证分解为解析、解剖定位和几何规则,在CT空间推理任务上超越端到端视觉-语言模型。

可靠的空间理解是未来医学视觉-语言系统支持放射报告生成和结构化图像理解的重要前提。虽然现代视觉-语言模型(https://huggingface.co/papers?q=vision-language%20models)(VLMs)在许多医学成像任务上展现出良好性能,但近期证据表明它们在可控空间推理(https://huggingface.co/papers?q=spatial%20reasoning)方面仍然薄弱,且往往无法可靠地将空间关系与图像证据关联。鉴于放射学推理依赖于理解解剖结构和发现的相对位置,这种空间推理弱点对诊断准确性构成风险。我们提出一种模块化医学成像智能体,用于轴位CT切片的二元空间关系验证。该系统不再直接端到端预测空间答案,而是将任务分解为明确的阶段:语言解析、解剖定位(https://huggingface.co/papers?q=anatomical%20localization)和确定性几何验证(https://huggingface.co/papers?q=deterministic%20geometric%20verification)。自然语言查询被转换为结构化关系元组,目标器官通过基于YOLO的检测器(https://huggingface.co/papers?q=YOLO-based%20detector)进行定位,最终空间决策基于目标中心点使用确定性几何规则计算得出。我们在保留的MIRP空间问答基准测试(https://huggingface.co/papers?q=MIRP%20spatial%20QA%20benchmark)上评估了该方法,并与代表性端到端VLM基线进行比较。表现最佳的混合配置达到94.1%准确率和94.2% F1值,在保持可解释中间表示和可审计推理阶段的同时,比直接Qwen2-VL(https://huggingface.co/papers?q=Qwen2-VL)提示方法的准确率高出42.5个百分点。结果表明,显式模块化空间验证可作为未来面向报告的医学成像智能体的有前景构建模块。

查看arXiv页面 (https://arxiv.org/abs/2608.21140) 查看PDF (https://arxiv.org/pdf/2608.21140) GitHub0 (https://github.com/DeveloperNomis/MICCAI-Medical-Agent) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.21140)

引用本文的模型0

暂无链接本文的模型

在模型README.md中引用 arxiv.org/abs/2608.21140 即可从本页链接该模型。

引用本文的数据集0

暂无链接本文的数据集

在数据集README.md中引用 arxiv.org/abs/2608.21140 即可从本页链接该数据集。

引用本文的空间0

暂无链接本文的空间

在空间README.md中引用 arxiv.org/abs/2608.21140 即可从本页链接该空间。

包含本文的收藏集0

暂无包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接。

相似文章

RadAgent:用于胸部CT逐步解读的工具型AI代理

Hugging Face Daily Papers

RadAgent是一种使用工具的AI代理,通过可解释的逐步推理生成胸部CT报告,将临床准确率相对提升36.4%,并实现37%的忠实度——这是现有3D视觉语言模型所不具备的能力。该系统提供完全可检查的推理轨迹,使临床医生能够验证和优化诊断输出。

迈向自主且可审计的医学影像模型开发

Hugging Face Daily Papers

介绍AMID,一个用于医学影像模型开发的自主多智能体框架,利用LLM智能体来规划、执行和验证实验。在20项医学影像任务中,它优于通用MLE系统,并接近人类设计的解决方案。

质询的艺术:一致性增强空间推理中的事实性

arXiv cs.AI

本文提出一种自监督强化学习框架,利用一致性验证器(检查变换下几何和语义一致性的奖励函数)来提升大型推理模型的空间推理能力,无需真实标注。该方法接近监督微调的准确率,并能泛化到多种任务。

SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力

Hugging Face Daily Papers

SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。