PerceptionRubrics: 校准多模态评估以契合人类感知

Hugging Face Daily Papers 论文

摘要

PerceptionRubrics 引入了一种基于评分准则的多模态评估框架,通过原子审计和门控评分,使基准分数更好地与人类感知对齐,揭示了可靠性差距和开闭分层。

我们提出了 PerceptionRubrics,一种基于评分准则的评估框架,旨在解决饱和的基准分数与现实世界脆弱性之间的鸿沟。PerceptionRubrics 将评估从整体语义匹配转向严格的原子审计,将 1,038 张信息密集的图像与超过 12,000 条特定实例的评分准则配对。这些准则来源于通过一种新颖的循环同行评审共识流程构建的黄金描述,然后提炼为一个双流系统,包含 Must-Right(关键事实)和 Easy-Wrong(细粒度细节)评分准则。关键的是,PerceptionRubrics 实现了一种门控评分机制:与线性平均不同,在强制性的视觉事实上的失败会触发尖锐的二元惩罚。广泛的评估得出了关键见解:(1) 可靠性差距:模型通常能正确验证零散元素,但在严格的合取约束上失败,暴露了在密集领域的脆弱性;(2) 开闭分层:与推理趋势相反,我们揭示了开源与闭源前沿之间持续存在 8% 的感知差距;(3) 人类对齐的严谨性:我们的门控指标显著优于传统基准,验证了严格的感知保真度是可靠生成的前提。
查看原文
查看缓存全文

缓存时间: 2026/07/02 07:47

论文页面 - PerceptionRubrics: 将多模态评估校准至人类感知

来源:https://huggingface.co/papers/2606.28322 作者:

摘要

PerceptionRubrics 提出了一个基于评分标准的评估框架,通过原子级审计和门控评分机制,识别基准分数与现实世界性能之间的差距。

我们引入了 PerceptionRubrics,一个基于评分标准的评估 (https://huggingface.co/papers?q=rubric-based%20evaluation) 框架,旨在解决饱和基准分数与实际脆弱性之间的差距。PerceptionRubrics 将评估从整体语义匹配转向严格的原子级审计 (https://huggingface.co/papers?q=atomic%20auditing),配对了 1,038 张信息密集的图像与超过 12,000 条实例专属评分标准。这些准则源于通过新颖的循环同行评审共识 (https://huggingface.co/papers?q=Circular%20Peer-Review%20consensus) 流水线构建的黄金描述 (https://huggingface.co/papers?q=golden%20captions),然后被提炼成一个双流系统 (https://huggingface.co/papers?q=dual-stream%20system),包含必对 (https://huggingface.co/papers?q=Must-Right)(基本事实)和易错 (https://huggingface.co/papers?q=Easy-Wrong)(细粒度细节)评分标准。关键的是,PerceptionRubrics 实现了门控评分机制 (https://huggingface.co/papers?q=Gated%20Scoring%20mechanism):与线性平均不同,在强制性视觉事实上失败会触发尖锐的二元惩罚。广泛的评估得出了关键洞察:(1) 可靠性差距 (https://huggingface.co/papers?q=Reliability%20Gap):模型通常能正确验证零散元素,但在严格的合取约束下却会失败,揭示了在密集领域的脆弱性;(2) 开闭源分层 (https://huggingface.co/papers?q=Open-Closed%20Stratification):与推理趋势相反,我们揭示了开源与闭源前沿之间存在持续的 8% 感知差距;(3) 人类对齐的严格性 (https://huggingface.co/papers?q=Human-Aligned%20Rigor):我们的门控指标大幅超越传统基准的对齐度,验证了严格的感知保真度是可靠生成的前提。

查看 arXiv 页面 (https://arxiv.org/abs/2606.28322)查看 PDF (https://arxiv.org/pdf/2606.28322)项目页面 (https://weiyana.github.io/PerceptionRubrics/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.28322)

在你的代理中获取此论文:

hf papers read 2606\.28322

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.28322 以从此页面链接。

引用此论文的数据集1

M1chaelPeng/PerceptionRubrics 查看器• 更新于 1 天前 • 1.04k • 10 (https://huggingface.co/datasets/M1chaelPeng/PerceptionRubrics)

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.28322 以从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将本论文添加到一个收藏 (https://huggingface.co/new-collection)中以从此页面链接。

相似文章

PerceptionBench:评估多模态大语言模型中的原子视觉感知

Hugging Face Daily Papers

PerceptionBench 是一个基准测试,旨在评估多模态大语言模型(MLLMs)的原子视觉感知能力,采用了由十种原子感知能力组成的自底向上分类法。对16个前沿MLLM的测试结果显示,没有任何模型达到60%的准确率,表明视觉感知问题在很大程度上仍未解决。

C2:基于二元偏好的可扩展评分增强奖励建模

Hugging Face Daily Papers

C2 提出了一种可扩展的评分增强奖励建模框架,该框架仅通过二元偏好训练一个协作的评分生成器和一个批判性验证器,无需昂贵的评分标注,同时在 RM-Bench 上实现了最高 6.5 分的提升。