多模态大语言模型能理解OCT吗?
摘要
本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。
查看缓存全文
缓存时间: 2026/07/21 14:37
论文页面 - 多模态大语言模型能否理解OCT图像?
来源:https://huggingface.co/papers/2607.16609
摘要
光学相干断层扫描(OCT)成像对于视网膜疾病的诊断与治疗至关重要。尽管多模态大语言模型(MLLMs)在医学图像分析中展现出巨大潜力,但现有基准测试主要将OCT理解简化为粗粒度的疾病分类或孤立的视觉问答,未能充分评估从视觉感知到临床推理的完整认知过程。为弥补这一不足,我们提出了OCT-Bench,一个专用于OCT图像理解的综合基准测试。OCT-Bench包含从七个公开数据集的4137张OCT图像中构建的10076道高质量选择题。遵循真实世界的临床解读流程,我们建立了一个分层能力分类体系,包含感知、认知和推理三个维度的20项细粒度任务。这些任务涵盖了广泛的能力,包括成像属性、视网膜解剖、病变特征、空间关系、疾病评估、治疗决策和预后管理。我们系统评估了20个代表性MLLM,包括专有模型、开源通用模型和医学领域模型。实验结果表明,当前模型在可靠的OCT理解方面仍存在明显不足。此外,无论是医学领域适配还是增加模型规模,均未能持续提升各能力层面的性能。OCT-Bench能够对MLLM进行全面且细粒度的评估,为识别能力瓶颈和推动面向临床的OCT理解提供了基础。
查看 arXiv 页面 (https://arxiv.org/abs/2607.16609)查看 PDF (https://arxiv.org/pdf/2607.16609)GitHub3 (https://github.com/baochenfu/OCT-Bench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.16609)
在你的智能代理中获取此论文:
hf papers read 2607\.16609
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在一个模型 README.md 中引用 arxiv.org/abs/2607.16609 以将其链接至此页面。
引用此论文的数据集0
没有数据集链接此论文
请在一个数据集 README.md 中引用 arxiv.org/abs/2607.16609 以将其链接至此页面。
引用此论文的空间0
没有 Space 链接此论文
请在一个 Space README.md 中引用 arxiv.org/abs/2607.16609 以将其链接至此页面。
包含此论文的收藏1
相似文章
MMOOC:多模态大语言模型上下文外评估的综合基准
MMOOC 是一个大规模基准,包含超过 41K 个图像-问题对,用于评估多模态大语言模型在拒绝上下文外问题的同时回答上下文偏移问题的能力,结果显示当前模型难以平衡这两种能力。
超越文本主导:理解全模态大语言模型的模态偏好
# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa
PerceptionBench:评估多模态大语言模型中的原子视觉感知
PerceptionBench 是一个基准测试,旨在评估多模态大语言模型(MLLMs)的原子视觉感知能力,采用了由十种原子感知能力组成的自底向上分类法。对16个前沿MLLM的测试结果显示,没有任何模型达到60%的准确率,表明视觉感知问题在很大程度上仍未解决。
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。