Almieyar-Oryx-BloomBench:一种用于认知驱动评估视觉语言模型的双语多模态基准

Hugging Face Daily Papers 论文

摘要

BloomBench是一个基于认知理论的双语(英语-阿拉伯语)多模态视觉语言模型基准,系统评估基于布鲁姆分类学的六个认知层次。实验揭示了当前模型中显著的认知不对称和跨语言性能差距。

尽管视觉语言模型(VLM)取得了快速进展,但该领域仍缺乏能够严格诊断其真正推理能力并描绘向类人多模态智能有意义进展的基准。大多数现有评估侧重于零散或脱节的任务,忽视了关键的认知弱点,并为针对性改进提供了很少的见解。为弥补这一差距,我们引入了BloomBench,这是Almieyar基准系列的一部分,也是首个基于认知的人类基础的双语(英语-阿拉伯语)多模态VLM基准。基于布鲁姆分类学,BloomBench通过精心设计的图像-问题-答案任务系统评估六个认知层次(记忆、理解、应用、分析、评估、创造)。通过半自动化流水线构建,并经分层混合质量保证协议验证,确保了可扩展性、文化包容性和语言保真度。利用这一框架,我们对最先进的VLM进行了全面研究,以诊断其认知特征。我们的分析揭示了显著的认知不对称:虽然最先进的模型在语义理解方面实现了强大的性能上限,但在事实回忆和创造性综合方面却举步维艰。这表明当前通用的多模态能力掩盖了特定认知层中的更深层局限性。此外,我们的研究突出了阿拉伯语和英语之间的关键性能差距,暴露了当前跨语言多模态推理的局限性。这些发现为开发更符合认知且更具包容性的VLM奠定了基础。基准框架和数据集可在以下网址获取:https://github.com/qcri/Almieyar-Oryx-BloomBench。
查看原文
查看缓存全文

缓存时间: 2026/06/08 23:18

论文页面 - Almieyar-Oryx-BloomBench:用于认知驱动评估视觉语言模型的双语多模态基准测试

来源:https://huggingface.co/papers/2606.05531

摘要

BloomBench 提出了一个基于认知理论的双语多模态基准测试,用于评估视觉语言模型,揭示了当前模型在认知层面存在显著的不对称性以及跨语言性能差距。

尽管视觉语言模型(https://huggingface.co/papers?q=Vision-Language%20Models)(VLM)取得了快速进展,但该领域仍缺乏能够严格诊断其真实推理能力、并为迈向类人多模态智能提供有意义的进步轨迹的基准测试。大多数现有评估依赖于零散的或互不关联的任务,掩盖了关键的认知弱点,且几乎无法为针对性改进提供洞见。为填补这一空白,我们推出了 BloomBench,这是 Almieyar 系列基准测试的一部分,也是首个基于人类认知理论、双语(英语-阿拉伯语)的视觉语言模型多模态基准测试(https://huggingface.co/papers?q=multimodal%20benchmark)。BloomBench 基于布鲁姆分类学(https://huggingface.co/papers?q=Bloom%27s%20Taxonomy),通过精心设计的图像-问题-答案任务,系统地评估六层认知水平(记忆、理解、应用、分析、评价、创造)。该基准测试采用半自动化流水线构建,并通过分层混合质量保障协议进行验证,确保了可扩展性、文化包容性和语言保真度。利用这一框架,我们对最先进的 VLM 进行了全面研究,以诊断其认知轮廓。分析揭示了显著的认知不对称性(https://huggingface.co/papers?q=cognitive%20asymmetry):尽管最先进的模型在语义理解方面达到了较高的性能上限,但在事实回忆和创造性综合方面却存在明显困难。这表明当前通用的多模态能力掩盖了特定认知层次的更深层次局限性。此外,我们的研究突出了阿拉伯语与英语之间关键的性能差距,暴露了当前跨语言多模态推理(https://huggingface.co/papers?q=cross-lingual%20multimodal%20reasoning)的局限。这些发现为开发更符合认知特性且更具包容性的 VLM 奠定了基础。基准测试框架与数据集可在以下地址获取:https://github.com/qcri/Almieyar-Oryx-BloomBench。

查看 arXiv 页面(https://arxiv.org/abs/2606.05531) 查看 PDF(https://arxiv.org/pdf/2606.05531) GitHub7(https://github.com/qcri/Almieyar-Oryx-BloomBench) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05531)

在你的智能体中获取此论文:

hf papers read 2606.05531

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.05531 以在此页面建立链接。

引用此论文的数据集 1

QCRI/BloomBench 查看器 • 更新于 1 天前 • 8.01k • 74(https://huggingface.co/datasets/QCRI/BloomBench)

引用此论文的 Spaces 0

暂无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.05531 以在此页面建立链接。

包含此论文的收藏集 0

暂无收藏集包含此论文

请将此论文添加到收藏集(https://huggingface.co/new-collection)以在此页面建立链接。

相似文章