PerceptionBench:评估多模态大语言模型中的原子视觉感知
摘要
PerceptionBench 是一个基准测试,旨在评估多模态大语言模型(MLLMs)的原子视觉感知能力,采用了由十种原子感知能力组成的自底向上分类法。对16个前沿MLLM的测试结果显示,没有任何模型达到60%的准确率,表明视觉感知问题在很大程度上仍未解决。
查看缓存全文
缓存时间: 2026/07/29 03:50
论文页面 - PerceptionBench:评估多模态大语言模型中的原子视觉感知
来源:https://huggingface.co/papers/2607.24957 作者: , , , , , , , , , , , , , , , , , , ,
摘要
我们提出了PerceptionBench,一个专门用于评估多模态大语言模型(MLLMs)原子视觉感知能力的基准测试。现有基准测试往往无法隔离感知:整体评估将感知误差与推理或领域知识的失败混为一谈,而应用驱动的基准测试仅覆盖由启发式设计塑造的狭窄、碎片化领域。为解决这些局限性,PerceptionBench采用自下而上的方法:通过诊断前沿MLLMs在42个现有基准测试中响应的最早失败点,我们构建了一个错误分类法,其感知分支定义了十种原子感知能力。在此分类法的指导下,我们构建了3000个经过验证的问题,每个问题有简短明确的答案,且每个问题隔离单一能力,难度源于感知而非推理或知识。对十六个前沿MLLMs的基准测试结果显示,原子感知在很大程度上仍未解决——没有模型达到60%的准确率,与感知相关的幻觉平均是最弱的能力,而相似的总分掩盖了能力轮廓的显著差异。因此,PerceptionBench为测量和诊断MLLMs的视觉感知边界提供了能力层面的标准。
查看arXiv页面(https://arxiv.org/abs/2607.24957)查看PDF(https://arxiv.org/pdf/2607.24957)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.24957)
在您的代理中获取此论文:
hf papers read 2607.24957
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用arxiv.org/abs/2607.24957以从本页面链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2607.24957以从本页面链接。
引用此论文的Spaces0
没有Space关联此论文
在Space README.md中引用arxiv.org/abs/2607.24957以从本页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页面链接。
相似文章
多模态大语言模型能理解OCT吗?
本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。
MuseBench: 对多模态大语言模型中意图层面视听艺术理解的基准评估
MuseBench是一个全面基准,旨在评估多模态大语言模型对视听艺术中细微意图层面的理解,结果显示即使最佳模型也仅达到48.29%的准确率,而人类专家为87.18%。
Artifact-Bench:评估多模态大语言模型在检测与评估AI生成视频伪影方面的能力
Artifact-Bench是一个综合性基准,用于评估多模态大语言模型在检测和分析AI生成视频伪影方面的表现,揭示了它们的显著局限性以及与人类感知的错位。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。
WorldBench:一个具有挑战性且视觉多样化的多模态推理基准
介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。