WorldBench:一个具有挑战性且视觉多样化的多模态推理基准
摘要
介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。
查看缓存全文
缓存时间: 2026/06/08 03:29
论文页面 - WorldBench:一个具有挑战性且视觉多样的多模态推理基准
来源:https://huggingface.co/papers/2606.06538 作者:
,
,
,
,
,
,
,
,
,
,
摘要
WorldBench 被引入作为一个视觉多样的推理基准,用于评估多模态大语言模型,揭示了当前模型在视觉理解能力上的显著局限。
在现实世界的应用中,模型被期望能够在多样化的场景中可靠运行。然而,许多现有的多模态基准(https://huggingface.co/papers?q=multimodal%20benchmarks)扩展了任务类型,但未能捕捉处理开放式视觉输入所需的视觉多样性(https://huggingface.co/papers?q=visual%20diversity)。我们提出了 WorldBench,这是一个具有挑战性且视觉多样的推理基准(https://huggingface.co/papers?q=reasoning%20benchmark),用于评估多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)。我们构建了一个涵盖多个领域(例如,生物)的数千个视觉概念(https://huggingface.co/papers?q=visual%20concepts)的分类体系。在该分类体系的指导下,我们从搜索引擎和现有数据集中精选了大量图像,以全面代表视觉世界。通过结构化的试错过程,我们手动设计了前沿 MLLMs 无法回答的具有挑战性的问题。根据定量评估和人类评估,WorldBench 实现了比任何现有多样化基准更高的视觉多样性(https://huggingface.co/papers?q=visual%20diversity)。在 WorldBench 上评估了 15 个 MLLMs 后,揭示了它们在视觉理解上的弱点:即使最强的模型也仅达到 64.0% 的准确率,而有些模型的表现仅略高于随机水平。我们希望我们的工作能够突显视觉多样性(https://huggingface.co/papers?q=visual%20diversity)在构建多模态基准(https://huggingface.co/papers?q=multimodal%20benchmarks)中的重要性。
查看 arXiv 页面(https://arxiv.org/abs/2606.06538)查看 PDF(https://arxiv.org/pdf/2606.06538)项目页面(https://worldbench-vl.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.06538)
引用本文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.06538 以将其链接到此页面。
引用本文的数据集1
zlab-princeton/WorldBench 查看器• 更新于约 2 小时前 • 2k • 21 (https://huggingface.co/datasets/zlab-princeton/WorldBench)
引用本文的空间0
没有空间链接此论文
请在空间 README.md 中引用 arxiv.org/abs/2606.06538 以将其链接到此页面。
包含本文的收藏0
没有收藏包含此论文
请将此论文添加到收藏(https://huggingface.co/new-collection)中以将其链接到此页面。
相似文章
MultivationBench:多模态序列动机推理基准
介绍了MultivationBench,这是一个基于马斯洛需求层次和赖斯基本欲望的故事驱动视觉叙事,用于评估多模态大语言模型序列动机推理能力的基准。结果表明,所有测试模型在动态动机推断方面均表现不佳。
WildTableBench:在真实场景中评估多模态基础模型的表格理解能力
WildTableBench 提出了首个针对真实世界表格图像的问答应答基准,揭示了现有多模态基础模型在结构感知和数值推理方面存在显著困难,仅有1个模型准确率超过50%。
BEAR-Bench:一个面向多模态模型的双语企业与学术推理基准
BEAR-Bench引入了一个双语(英语和俄语)基准,用于评估多模态模型在文本丰富的专业文档上的推理能力,评估了16个模型并突出了性能差距。
The Unwritten Benchmark: 多模态机器学习在抽象感知推理中的新挑战
本文介绍了The Unwritten Benchmark,这是一个用于评估多模态AI模型抽象感知推理能力的新挑战,揭示了人类与当前模型如GPT-4o和Gemini 2.5-Pro之间的显著性能差距。
M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准
本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。