WorldBench:一个具有挑战性且视觉多样化的多模态推理基准

Hugging Face Daily Papers 论文

摘要

介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。

在现实应用中,模型需要能在多样化的环境中可靠执行。然而,许多现有的多模态基准扩展了任务类型,却未能捕捉处理开放式视觉输入所需的视觉多样性。我们提出了WorldBench,一个具有挑战性且视觉多样化的推理基准,用于评估多模态大语言模型(MLLMs)。我们构建了一个涵盖多个领域(如生物)的数千个视觉概念的分类体系。在该分类体系的指导下,我们从搜索引擎和现有数据集中收集了广泛的图像,以全面代表视觉世界。通过结构化的试错过程,我们手动设计了前沿MLLMs无法回答的具有挑战性的问题。在定量评估和人工评估中,WorldBench的视觉多样性超过了任何现有的多样化基准。对15个MLLMs在WorldBench上的评估揭示了视觉理解的弱点:即使是最强的模型也仅达到64.0%的准确率,而有些模型的表现仅略高于随机水平。我们希望我们的工作能强调视觉多样性在构建多模态基准中的重要性。
查看原文
查看缓存全文

缓存时间: 2026/06/08 03:29

论文页面 - WorldBench:一个具有挑战性且视觉多样的多模态推理基准

来源:https://huggingface.co/papers/2606.06538 作者:

,

,

,

,

,

,

,

,

,

,

摘要

WorldBench 被引入作为一个视觉多样的推理基准,用于评估多模态大语言模型,揭示了当前模型在视觉理解能力上的显著局限。

在现实世界的应用中,模型被期望能够在多样化的场景中可靠运行。然而,许多现有的多模态基准(https://huggingface.co/papers?q=multimodal%20benchmarks)扩展了任务类型,但未能捕捉处理开放式视觉输入所需的视觉多样性(https://huggingface.co/papers?q=visual%20diversity)。我们提出了 WorldBench,这是一个具有挑战性且视觉多样的推理基准(https://huggingface.co/papers?q=reasoning%20benchmark),用于评估多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)。我们构建了一个涵盖多个领域(例如,生物)的数千个视觉概念(https://huggingface.co/papers?q=visual%20concepts)的分类体系。在该分类体系的指导下,我们从搜索引擎和现有数据集中精选了大量图像,以全面代表视觉世界。通过结构化的试错过程,我们手动设计了前沿 MLLMs 无法回答的具有挑战性的问题。根据定量评估和人类评估,WorldBench 实现了比任何现有多样化基准更高的视觉多样性(https://huggingface.co/papers?q=visual%20diversity)。在 WorldBench 上评估了 15 个 MLLMs 后,揭示了它们在视觉理解上的弱点:即使最强的模型也仅达到 64.0% 的准确率,而有些模型的表现仅略高于随机水平。我们希望我们的工作能够突显视觉多样性(https://huggingface.co/papers?q=visual%20diversity)在构建多模态基准(https://huggingface.co/papers?q=multimodal%20benchmarks)中的重要性。

查看 arXiv 页面(https://arxiv.org/abs/2606.06538)查看 PDF(https://arxiv.org/pdf/2606.06538)项目页面(https://worldbench-vl.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.06538)

引用本文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.06538 以将其链接到此页面。

引用本文的数据集1

zlab-princeton/WorldBench 查看器• 更新于约 2 小时前 • 2k • 21 (https://huggingface.co/datasets/zlab-princeton/WorldBench)

引用本文的空间0

没有空间链接此论文

请在空间 README.md 中引用 arxiv.org/abs/2606.06538 以将其链接到此页面。

包含本文的收藏0

没有收藏包含此论文

请将此论文添加到收藏(https://huggingface.co/new-collection)中以将其链接到此页面。

相似文章

MultivationBench:多模态序列动机推理基准

arXiv cs.AI

介绍了MultivationBench,这是一个基于马斯洛需求层次和赖斯基本欲望的故事驱动视觉叙事,用于评估多模态大语言模型序列动机推理能力的基准。结果表明,所有测试模型在动态动机推断方面均表现不佳。

M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准

arXiv cs.CL

本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。