MMOOC:多模态大语言模型上下文外评估的综合基准
摘要
MMOOC 是一个大规模基准,包含超过 41K 个图像-问题对,用于评估多模态大语言模型在拒绝上下文外问题的同时回答上下文偏移问题的能力,结果显示当前模型难以平衡这两种能力。
多模态大语言模型(MLLMs)在各种视觉-语言任务上表现出了强大的性能,但在不完美或偏移的上下文下常常失败。一个可靠的 MLLM 应拒绝真正上下文外(OOC)的问题(涉及主体级上下文偏移),同时仍回答上下文偏移但可回答的问题(Shifted IC,涉及非主体上下文偏移)。现有基准主要针对 OOC 或视觉上不可回答的问题,但忽略了可回答的 Shifted IC 情况,并且覆盖的 OOC 偏移类型有限。为填补这一空白,我们提出了 MMOOC,一个用于评估 MLLMs 拒绝能力和稳健回答能力的大规模基准。MMOOC 包含超过 41K 个图像-问题对,包括可回答的 Shifted IC 案例和不可回答的 OOC 案例,涵盖三种问题格式、八种偏移类型和六种视觉场景,并通过基于 MLLM 的过滤和人工验证确保数据质量。我们使用准确率和拒绝率评估模型响应,并进一步引入 LLM-as-a-Judge 指标来评估模型推理的正确性。在多种 MLLMs 上的实验表明,当前模型在偏移上下文下仍难以平衡可回答性和拒绝能力。我们进一步分析了关键的失败模式,并展示了后训练可以提升鲁棒性。MMOOC 将公开发布。
查看缓存全文
缓存时间: 2026/08/12 08:23
论文页面 - MMOOC:多模态大语言模型中上下文外评估的综合基准
来源:https://huggingface.co/papers/2607
相似文章
多模态大语言模型能理解OCT吗?
本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。
KMMMU:韩语及韩国文化背景下的大规模多学科多模态理解评估
KMMMU 是一个用于评估韩语多模态理解的本地化韩文基准,包含 3,466 道题目,涵盖九个学科和视觉模态类别,通过测试韩国特定文化和制度背景下的性能,填补了以英文为中心的基准的空白。
MedLoCoMo:面向大语言模型的长上下文多会话医疗对话基准
MedLoCoMo 是一个新基准,用于评估大语言模型在长上下文、多会话医疗对话推理上的表现,基于 MIMIC-IV 数据构建。它测试了单次入院、跨入院以及对抗性不可回答的问题,揭示出即使对于拥有长上下文窗口的模型,跨入院推理仍然具有挑战性。
超越当前观察:在可控非马尔可夫游戏中评估多模态大语言模型
本文介绍了RNG-Bench,一个基准测试套件,用于评估多模态基础模型在多步交互中重建过去观察并利用它们进行决策的能力。该套件包含两个游戏(Matching Pairs和3D Maze),具有可控难度参数和一个记忆差距指标,用于区分遗忘与糟糕的决策。