一种智能体AI框架克服大语言模型在眼底照相青光眼检测中的根本性局限

arXiv cs.AI 论文

摘要

这篇arXiv论文介绍了一种智能体AI框架,将大语言模型与专门的深度学习工具集成,用于从眼底图像检测青光眼,与仅使用大语言模型的方法相比,准确率提高了16至47个百分点,并降低了运行间变异性。

arXiv:2608.07651v1 公告类型:新 摘要:大语言模型(LLMs)在医学图像解读中显示出潜力,但存在幻觉、准确性有限和运行间不一致的问题。我们开发并验证了一种智能体AI框架,将LLMs与专门的深度学习工具集成,用于从眼底照片中检测青光眼。工作流程包括三个步骤:(1)LLM初步评估;(2)函数调用,调用专门的工具进行图像质量(QAModel, FundaQ-8)、青光眼分类(SwinV2-Tiny)和视盘/视杯分割(SegFormer-B0);(3)LLM反思,将初步印象与工具输出整合。在两种视野(未裁剪和裁剪)下,对两个公共数据集(ORIGA, n=100; RIM-ONE-v3, n=100)上的两个LLM(Gemini 2.5 Flash, GPT-5.4 mini)进行了评估;所有图像均由一位设盲的、接受过专科培训的青光眼专家独立分级。智能体工作流在所有条件下将分类准确率提高了16到47个百分点,达到与专家相差6个百分点以内;在RIM-ONE-v3上,最佳配置达到了与专家一致的88%准确率。仅使用LLM的方法在两个方面失败:GPT-5.4 mini表现出正偏倚(敏感性95-100%,特异性0-5%),而Gemini 2.5 Flash在运行之间随机变化;智能体工作流纠正了这两个问题。杯盘比误差下降了15-50%(MAE从0.156-0.228降至0.104-0.132),与专家分级的相关性从弱(r=0.12-0.39)上升至中强(r=0.59-0.84)。运行间一致性从接近随机(kappa低至-0.01)提高到接近完美(kappa高达0.96)。将LLMs与专门工具集成解决了仅使用LLM方法的关键局限性,包括过度诊断和运行间变异性。两个LLM均获得了收益,表明在不同骨干网络之间具有泛化性,并可能标志着医学AI从单体模型向协同多智能体系统的转变。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:03

# 一种智能体AI框架克服了大语言模型在眼底照相青光眼检测中的根本局限性
来源:https://arxiv.org/abs/2608.07651
作者:Jalil Jalili (https://arxiv.org/search/cs?searchtype=author&query=Jalili,+J),Hossein Taghizad (https://arxiv.org/search/cs?searchtype=author&query=Taghizad,+H),Anuwat Jiravarnsirikul (https://arxiv.org/search/cs?searchtype=author&query=Jiravarnsirikul,+A),Christopher Bowd (https://arxiv.org/search/cs?searchtype=author&query=Bowd,+C),Akram Belghith (https://arxiv.org/search/cs?searchtype=author&query=Belghith,+A),Raheleh Kafieh (https://arxiv.org/search/cs?searchtype=author&query=Kafieh,+R),Christopher A\. Girkin (https://arxiv.org/search/cs?searchtype=author&query=Girkin,+C+A),Sally L\. Baxter (https://arxiv.org/search/cs?searchtype=author&query=Baxter,+S+L),Robert N\. Weinreb (https://arxiv.org/search/cs?searchtype=author&query=Weinreb,+R+N),Linda M\. Zangwill (https://arxiv.org/search/cs?searchtype=author&query=Zangwill,+L+M),Mark Christopher (https://arxiv.org/search/cs?searchtype=author&query=Christopher,+M)

查看 PDF (https://arxiv.org/pdf/2608.07651)

> 摘要:大语言模型(LLMs)在医学影像解读方面展现出潜力,但存在幻觉、准确性有限以及运行间不一致的问题。我们开发并验证了一种智能体AI框架,将LLMs与专用深度学习工具相结合,用于从眼底照相中进行青光眼检测。该工作流包含三个步骤:(1)LLM初步评估;(2)函数调用以调用专用工具进行图像质量(QAModel、FundaQ-8)、青光眼分类(SwinV2-Tiny)以及视盘/视杯分割(SegFormer-B0);(3)LLM反思,将初步印象与工具输出整合。两个LLM(Gemini 2.5 Flash、GPT-5.4 mini)在两个公共数据集(ORIGA,n=100;RIM-ONE-v3,n=100)上、在未裁剪和裁剪视野条件下进行了评估;所有图像均由一名设盲的、接受过专科培训的青光眼专家独立分级。智能体工作流在所有条件下将分类准确率提高了16至47个百分点,与专家的差距缩小到6个百分点以内;在RIM-ONE-v3上,最佳配置与专家88%的准确率持平。仅使用LLM的方法在两个方面失败:GPT-5.4 mini表现出正向偏倚(灵敏度95-100%,特异度0-5%),而Gemini 2.5 Flash在运行之间呈现随机变化;智能体工作流纠正了这两个问题。杯盘比误差下降15%-50%(MAE从0.156-0.228降至0.104-0.132),与专家分级的相关性从弱相关(r=0.12-0.39)上升到中等至强相关(r=0.59-0.84)。运行间一致性从接近随机(kappa低至-0.01)提高到接近完美(kappa高达0.96)。将LLMs与专用工具相结合,解决了仅使用LLM方法的关键局限性,包括过度诊断和运行间变异性。两个LLM均获得了收益,表明该方法在不同骨干网络上具有泛化能力,并可能预示着医学AI从单体模型向编排式多智能体系统的转变。

## 提交历史

来自:Jalil Jalili \[查看电子邮件 (https://arxiv.org/show-email/345ac49b/2608.07651)\] **\[v1\]** 2026年8月7日星期五 17:33:12 UTC(17,491 KB)

相似文章

DeepLens诊断代理:智能体工作流设计让小推理模型能与前沿大语言模型竞争

arXiv cs.AI

DeepLens诊断代理采用五阶段智能体工作流,结合小型医疗推理模型(7B),在包含915个病例的基准测试中实现了60.14%的诊断准确率,以更低成本超越了Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大语言模型。仅工作流设计就比基础模型提升了36个百分点,表明结构化流程约束对于诊断推理至关重要。

人在回路的大语言模型框架用于皮肤免疫相关不良事件识别

arXiv cs.CL

本文提出了一种检索增强的多智能体LLM框架,结合人在回路机制,用于从临床记录中检测皮肤免疫相关不良事件。与人工审查相比,该框架实现了更高的准确率(F1=0.88 vs 0.77)、更优的评估者间一致性(Cohen's kappa系数为0.82 vs 0.50),并将平均审查时间缩短约一半。

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。