多模态大语言模型能理解OCT吗?
摘要
本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。
查看缓存全文
缓存时间: 2026/07/21 14:37
论文页面 - 多模态大语言模型能否理解OCT图像?
来源:https://huggingface.co/papers/2607.16609
摘要
光学相干断层扫描(OCT)成像对于视网膜疾病的诊断与治疗至关重要。尽管多模态大语言模型(MLLMs)在医学图像分析中展现出巨大潜力,但现有基准测试主要将OCT理解简化为粗粒度的疾病分类或孤立的视觉问答,未能充分评估从视觉感知到临床推理的完整认知过程。为弥补这一不足,我们提出了OCT-Bench,一个专用于OCT图像理解的综合基准测试。OCT-Bench包含从七个公开数据集的4137张OCT图像中构建的10076道高质量选择题。遵循真实世界的临床解读流程,我们建立了一个分层能力分类体系,包含感知、认知和推理三个维度的20项细粒度任务。这些任务涵盖了广泛的能力,包括成像属性、视网膜解剖、病变特征、空间关系、疾病评估、治疗决策和预后管理。我们系统评估了20个代表性MLLM,包括专有模型、开源通用模型和医学领域模型。实验结果表明,当前模型在可靠的OCT理解方面仍存在明显不足。此外,无论是医学领域适配还是增加模型规模,均未能持续提升各能力层面的性能。OCT-Bench能够对MLLM进行全面且细粒度的评估,为识别能力瓶颈和推动面向临床的OCT理解提供了基础。
查看 arXiv 页面 (https://arxiv.org/abs/2607.16609)查看 PDF (https://arxiv.org/pdf/2607.16609)GitHub3 (https://github.com/baochenfu/OCT-Bench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.16609)
在你的智能代理中获取此论文:
hf papers read 2607\.16609
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在一个模型 README.md 中引用 arxiv.org/abs/2607.16609 以将其链接至此页面。
引用此论文的数据集0
没有数据集链接此论文
请在一个数据集 README.md 中引用 arxiv.org/abs/2607.16609 以将其链接至此页面。
引用此论文的空间0
没有 Space 链接此论文
请在一个 Space README.md 中引用 arxiv.org/abs/2607.16609 以将其链接至此页面。
包含此论文的收藏1
相似文章
超越文本主导:理解全模态大语言模型的模态偏好
# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
超越API:探究MLLMs在物理工具使用中的极限
本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。
多模态大语言模型评估中我们缺失了什么?
本文回顾了当前多模态大语言模型评估基准,找出了关键差距,如时空连贯性、物理世界理解、多模态一致性和选择性注意力,并指出现有的孤立任务基准无法衡量真正的跨模态整合。