PerceptionBench:评估多模态大语言模型中的原子视觉感知

Hugging Face Daily Papers 论文

摘要

PerceptionBench 是一个基准测试,旨在评估多模态大语言模型(MLLMs)的原子视觉感知能力,采用了由十种原子感知能力组成的自底向上分类法。对16个前沿MLLM的测试结果显示,没有任何模型达到60%的准确率,表明视觉感知问题在很大程度上仍未解决。

我们引入了 PerceptionBench,这是一个专门用于评估多模态大语言模型(MLLMs)原子视觉感知能力的基准测试。现有的基准测试往往无法孤立地评估感知能力:整体评估会将感知错误与推理或领域知识的失败混为一谈,而应用驱动的基准测试仅涵盖由启发式设计形成的狭窄、碎片化的领域。为了解决这些局限性,PerceptionBench 采用了自底向上的方法:通过诊断前沿 MLLM 在 42 个现有基准测试响应中的最早失败点,我们构建了一个错误分类法,其感知分支定义了十种原子感知能力。在此分类法的指导下,我们构建了 3,000 个经过验证的问题,每个问题都有简短明确的答案,且各自隔离单一能力,其难度源于感知而非推理或知识。对十六个前沿 MLLM 的基准测试结果显示,原子感知在很大程度上仍未得到解决——没有模型达到 60% 的准确率,与感知相关的幻觉是平均最弱的能力,并且相似的整体分数掩盖了截然不同的能力分布。因此,PerceptionBench 为测量和诊断 MLLM 的视觉感知边界提供了一个能力级别的标准。
查看原文
查看缓存全文

缓存时间: 2026/07/29 03:50

论文页面 - PerceptionBench:评估多模态大语言模型中的原子视觉感知

来源:https://huggingface.co/papers/2607.24957 作者: , , , , , , , , , , , , , , , , , , ,

摘要

我们提出了PerceptionBench,一个专门用于评估多模态大语言模型(MLLMs)原子视觉感知能力的基准测试。现有基准测试往往无法隔离感知:整体评估将感知误差与推理或领域知识的失败混为一谈,而应用驱动的基准测试仅覆盖由启发式设计塑造的狭窄、碎片化领域。为解决这些局限性,PerceptionBench采用自下而上的方法:通过诊断前沿MLLMs在42个现有基准测试中响应的最早失败点,我们构建了一个错误分类法,其感知分支定义了十种原子感知能力。在此分类法的指导下,我们构建了3000个经过验证的问题,每个问题有简短明确的答案,且每个问题隔离单一能力,难度源于感知而非推理或知识。对十六个前沿MLLMs的基准测试结果显示,原子感知在很大程度上仍未解决——没有模型达到60%的准确率,与感知相关的幻觉平均是最弱的能力,而相似的总分掩盖了能力轮廓的显著差异。因此,PerceptionBench为测量和诊断MLLMs的视觉感知边界提供了能力层面的标准。

查看arXiv页面(https://arxiv.org/abs/2607.24957)查看PDF(https://arxiv.org/pdf/2607.24957)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.24957)

在您的代理中获取此论文:

hf papers read 2607.24957

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

在模型README.md中引用arxiv.org/abs/2607.24957以从本页面链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2607.24957以从本页面链接。

引用此论文的Spaces0

没有Space关联此论文

在Space README.md中引用arxiv.org/abs/2607.24957以从本页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页面链接。

相似文章

多模态大语言模型能理解OCT吗?

Hugging Face Daily Papers

本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。