@yanawei_:感谢AK推荐我们的工作!更多详情:http://weiyana.github.io/PerceptionRubrics…

X AI KOLs Following 论文

摘要

介绍了PerceptionRubrics,这是一个基于评分标准的多模态AI评估框架,从整体匹配转向原子级审计,使用了1,038张图像和超过10,000个实例特定评分标准,并通过门控评分来强制执行严格的感知保真度。

感谢AK推荐我们的工作!更多详情:http://weiyana.github.io/PerceptionRubrics…
查看原文
查看缓存全文

缓存时间: 2026/07/03 22:42

感谢AK推荐我们的工作!更多详情:http://weiyana.github.io/PerceptionRubrics…


PerceptionRubrics

来源:https://weiyana.github.io/PerceptionRubrics/

PerceptionRubrics:校准多模态评估以对齐人类感知

ICML 2026

彭宏博*¹、赖彦霖*³、赵亮²、林康恒²、余恩²、吕科宇²、周涵²、唐寅⁴、李浩东²、Mitt Huang²、郭航宇²、孙健健 (https://scholar.google.com/citations?user=MVZrGkYAAAAJ&hl=en)²、葛政²、张翔宇²、江大欣²、Vishal M. Patel (https://engineering.jhu.edu/faculty/vishal-patel/)†¹

**▶**约翰霍普金斯大学 **▶**StepFun **▶**清华大学 **▶**独立研究者 *核心贡献 †通讯作者

概述

当前的感知基准存在一个评估悖论:排行榜日益饱和,但模型在实际使用中仍表现出感知上的脆弱性。我们提出PerceptionRubrics,一个基于评分量规的评估框架,将评估从整体语义匹配转变为严格的原子化审计。它包含了1,038张信息密集的图像,以及通过新颖的循环同行评审共识流程生成的超过10,000条实例级评分量规,这些量规来源于黄金标注,并提炼为必对(基本事实)和易错(细粒度细节)的双流系统。

关键的是,PerceptionRubrics实现了门控评分机制:与线性平均不同,在强制性视觉事实上的失败会触发锐利的二元惩罚。大量实验揭示了三点见解:

(1) 可靠性差距。模型通常能正确验证零散元素,但无法通过严格的合取约束,暴露出在GUI等密集领域的脆弱性。
(2) 开源-闭源分层。与推理领域的趋势相反,开源前沿模型与闭源领导者之间存在约8% 的持续感知差距。
(3) 与人类对齐的严格性。我们的门控指标与人类偏好的对齐程度显著优于传统基准,验证了严格的感知保真度是可靠生成的前提条件。

PerceptionRubrics的动机
图1:动机。现有基准可能偏好存在关键遗漏的回答,而人类更偏好捕捉更多感知重要细节的回答。PerceptionRubrics比DetailCaps和DOCCI更清晰地分辨了模型能力。

基准构建

为了绕过直接从图像生成量规时存在的视觉-语言对齐差距,我们采用了以标注为中心的流程。首先将每张图像转录为全面的黄金标注,然后从中提炼出评分量规。

  • 步骤1——循环同行评审。三个顶级多模态大模型作为“陪审团与生成器”组合:它们独立生成描述,然后迭代地比较、排序并基于视觉证据重写,以合成更优的共识标注。
  • 步骤2——严格共识过滤。人类专家作为最终验证者,采用“分歧即丢弃”协议——仅保留高共识样本并进行轻度验证,将人力集中于高置信度数据。
  • 双流量规。从每条黄金标注中,使用领域自适应提示提取必对量规(先验的基本事实)和易错量规(从模型错误模式池中挖掘的后验陷阱)。

PerceptionRubrics构建流程
图2:构建流程。通过循环同行评审合成黄金标注(上方),然后作为锚点通过领域自适应提示生成必对和易错量规(下方)。 最终基准包含1,038张图像和10,718条量规(4,053条必对 + 6,665条易错;平均每张图像约10.3条量规),涵盖七个领域:自然场景、文档与OCR、数字用户界面/体验、结构化数据、STEM与专家、逻辑与谜题、创意与文化。黄金标注平均770词——比之前的详细标注基准密集5–6倍。

门控评分

我们使用LLM作为评判者来验证每条量规的布尔值(真/假),然后应用非线性、门控聚合来镜像人类的错误敏感性:

  • 必对作为门控。如果回答未能满足任何必对标准,则门关闭(G= 0)且得分归零——一个致命的幻觉就是二元失败,而非微小波动。
  • 易错用于区分。对于通过门控(G= 1)的回答,最终得分为易错量规的通过率,奖励对微妙、密集认知陷阱的鲁棒性。

这确保了高得分反映的是真正的感知可靠性,而非粗略的语义近似,从而区分可接受的近似与灾难性的失败。

主要结果

我们评估了25个领先的多模态大模型。PerceptionRubrics揭示了传统整体基准所掩盖的显著性能分层。最强模型仅达到70.07%,而广泛使用的闭源模型(GPT-4o)仅得12.59%。性能在自然场景上最高,在GUI领域最低;最好的开源模型仍落后于闭源最优模型超过8% ——这一差距在推理任务趋于收敛的情况下依然存在。

#模型参数文档逻辑创意GUI自然STEM结构化总体
表1:细粒度性能(七领域)。点击列标题可排序;每列最优值高亮显示。所有数值均为百分比(%)。

分析

可靠性差距与失败模式

比较原子准确率(单条量规的平均通过率)与更严格的必对通过率(所有约束全部满足),揭示了一个系统性的可靠性差距:模型能通过大多数原子检查,但无法通过它们的严格合取。随着能力提升,差距缩小。GUI领域在模型的感知失败中占据主导地位。

失败分析
图3:失败分析。(左)不同模型错误来源的分布。(右)原子准确率 vs. 更严格的“必对全部通过”率。

感知能力的一致性

我们发现必对通过率与易错准确率之间近乎完美的线性相关(R²≈ 0.98):无法定位基本事实的模型必然在细微细节和幻觉方面表现挣扎。鲁棒的细粒度理解关键依赖于基础感知。

相关性分析
图4:基础感知可靠性与抗幻觉能力之间的相关性

与人类偏好的对齐

在与Vision Arena人类偏好排行榜的对比中,PerceptionRubrics在可比对的标注基准中展现出最强的对齐度,皮尔逊相关系数达0.916,斯皮尔曼等级相关系数完美1.000。相比之下,DOCCI和DetailCaps对人类评分差异显著的模型给出了几乎无法区分(甚至负相关)的分数。

人类对齐
图5:人类对齐。重叠模型在基准得分 vs. Vision Arena Elo评分上的对比。PerceptionRubrics与人类偏好的相关性最强。

对长度偏差的抵抗

标注长度与PerceptionRubrics得分之间的关系可忽略,表明该指标奖励的是精确、可验证的感知,而非冗长。

长度偏差 Gemini
长度偏差 Kimi

图6:长度偏差。代表性模型的得分 vs. 回答词数。

评估鲁棒性与量规覆盖率

更换评判模型能保持排名顺序,且评估稳定性随量规覆盖率增加而单调提升——这证实了量规生成流程及所得指标对评判模型选择和采样变异的鲁棒性。

评判模型鲁棒性
量规覆盖率 vs. 稳定性

图7: (左)不同评判模型下一致的排名。(右)稳定性随覆盖率提升而提高。

BibTeX

如果您觉得这项工作有用,请考虑引用:

@article{wei2026perceptionrubrics,
  title={PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception},
  author={Wei, Yana and Peng, Hongbo and Lai, Yanlin and Zhao, Liang and Lin, Kangheng
  and Yu, En and Lv, Keyu and Zhou, Han and Tang, Yin and Li, Haodong and Huang, Mitt
  and Guo, Hangyu and Sun, Jianjian and Ge, Zheng and Zhang, Xiangyu and Jiang, Daxin
  and Patel, Vishal M.},
  journal={arXiv preprint arXiv:2606.28322},
  year={2026}
}

感谢您的阅读和支持!如有问题或建议,欢迎联系我们: [email protected], [email protected]

AK (@_akhaliq): PerceptionRubrics

将多模态评估校准到人类感知

相似文章

C2:基于二元偏好的可扩展评分增强奖励建模

Hugging Face Daily Papers

C2 提出了一种可扩展的评分增强奖励建模框架,该框架仅通过二元偏好训练一个协作的评分生成器和一个批判性验证器,无需昂贵的评分标注,同时在 RM-Bench 上实现了最高 6.5 分的提升。