Almieyar-Oryx-BloomBench:一种用于认知驱动评估视觉语言模型的双语多模态基准
摘要
BloomBench是一个基于认知理论的双语(英语-阿拉伯语)多模态视觉语言模型基准,系统评估基于布鲁姆分类学的六个认知层次。实验揭示了当前模型中显著的认知不对称和跨语言性能差距。
查看缓存全文
缓存时间: 2026/06/08 23:18
论文页面 - Almieyar-Oryx-BloomBench:用于认知驱动评估视觉语言模型的双语多模态基准测试
来源:https://huggingface.co/papers/2606.05531
摘要
BloomBench 提出了一个基于认知理论的双语多模态基准测试,用于评估视觉语言模型,揭示了当前模型在认知层面存在显著的不对称性以及跨语言性能差距。
尽管视觉语言模型(https://huggingface.co/papers?q=Vision-Language%20Models)(VLM)取得了快速进展,但该领域仍缺乏能够严格诊断其真实推理能力、并为迈向类人多模态智能提供有意义的进步轨迹的基准测试。大多数现有评估依赖于零散的或互不关联的任务,掩盖了关键的认知弱点,且几乎无法为针对性改进提供洞见。为填补这一空白,我们推出了 BloomBench,这是 Almieyar 系列基准测试的一部分,也是首个基于人类认知理论、双语(英语-阿拉伯语)的视觉语言模型多模态基准测试(https://huggingface.co/papers?q=multimodal%20benchmark)。BloomBench 基于布鲁姆分类学(https://huggingface.co/papers?q=Bloom%27s%20Taxonomy),通过精心设计的图像-问题-答案任务,系统地评估六层认知水平(记忆、理解、应用、分析、评价、创造)。该基准测试采用半自动化流水线构建,并通过分层混合质量保障协议进行验证,确保了可扩展性、文化包容性和语言保真度。利用这一框架,我们对最先进的 VLM 进行了全面研究,以诊断其认知轮廓。分析揭示了显著的认知不对称性(https://huggingface.co/papers?q=cognitive%20asymmetry):尽管最先进的模型在语义理解方面达到了较高的性能上限,但在事实回忆和创造性综合方面却存在明显困难。这表明当前通用的多模态能力掩盖了特定认知层次的更深层次局限性。此外,我们的研究突出了阿拉伯语与英语之间关键的性能差距,暴露了当前跨语言多模态推理(https://huggingface.co/papers?q=cross-lingual%20multimodal%20reasoning)的局限。这些发现为开发更符合认知特性且更具包容性的 VLM 奠定了基础。基准测试框架与数据集可在以下地址获取:https://github.com/qcri/Almieyar-Oryx-BloomBench。
查看 arXiv 页面(https://arxiv.org/abs/2606.05531) 查看 PDF(https://arxiv.org/pdf/2606.05531) GitHub7(https://github.com/qcri/Almieyar-Oryx-BloomBench) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05531)
在你的智能体中获取此论文:
hf papers read 2606.05531
还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.05531 以在此页面建立链接。
引用此论文的数据集 1
QCRI/BloomBench 查看器 • 更新于 1 天前 • 8.01k • 74(https://huggingface.co/datasets/QCRI/BloomBench)
引用此论文的 Spaces 0
暂无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.05531 以在此页面建立链接。
包含此论文的收藏集 0
暂无收藏集包含此论文
请将此论文添加到收藏集(https://huggingface.co/new-collection)以在此页面建立链接。
相似文章
WorldBench:一个具有挑战性且视觉多样化的多模态推理基准
介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。
BEAR-Bench:一个面向多模态模型的双语企业与学术推理基准
BEAR-Bench引入了一个双语(英语和俄语)基准,用于评估多模态模型在文本丰富的专业文档上的推理能力,评估了16个模型并突出了性能差距。
MuseBench: 对多模态大语言模型中意图层面视听艺术理解的基准评估
MuseBench是一个全面基准,旨在评估多模态大语言模型对视听艺术中细微意图层面的理解,结果显示即使最佳模型也仅达到48.29%的准确率,而人类专家为87.18%。
LEVANTE-bench:使用认知任务对VLM与儿童进行多尺度比较(或者,“你的VLM比五年级学生更聪明吗?”)
本文介绍了LEVANTE-bench,这是一个系统评估视觉-语言模型在六项认知任务上的表现,并将其与5-12岁儿童的表现进行比较的基准测试,发现当前的VLM仅部分与儿童的认知能力相符。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。