PerceptionRubrics: 校准多模态评估以契合人类感知
摘要
PerceptionRubrics 引入了一种基于评分准则的多模态评估框架,通过原子审计和门控评分,使基准分数更好地与人类感知对齐,揭示了可靠性差距和开闭分层。
查看缓存全文
缓存时间: 2026/07/02 07:47
论文页面 - PerceptionRubrics: 将多模态评估校准至人类感知
来源:https://huggingface.co/papers/2606.28322 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
PerceptionRubrics 提出了一个基于评分标准的评估框架,通过原子级审计和门控评分机制,识别基准分数与现实世界性能之间的差距。
我们引入了 PerceptionRubrics,一个基于评分标准的评估 (https://huggingface.co/papers?q=rubric-based%20evaluation) 框架,旨在解决饱和基准分数与实际脆弱性之间的差距。PerceptionRubrics 将评估从整体语义匹配转向严格的原子级审计 (https://huggingface.co/papers?q=atomic%20auditing),配对了 1,038 张信息密集的图像与超过 12,000 条实例专属评分标准。这些准则源于通过新颖的循环同行评审共识 (https://huggingface.co/papers?q=Circular%20Peer-Review%20consensus) 流水线构建的黄金描述 (https://huggingface.co/papers?q=golden%20captions),然后被提炼成一个双流系统 (https://huggingface.co/papers?q=dual-stream%20system),包含必对 (https://huggingface.co/papers?q=Must-Right)(基本事实)和易错 (https://huggingface.co/papers?q=Easy-Wrong)(细粒度细节)评分标准。关键的是,PerceptionRubrics 实现了门控评分机制 (https://huggingface.co/papers?q=Gated%20Scoring%20mechanism):与线性平均不同,在强制性视觉事实上失败会触发尖锐的二元惩罚。广泛的评估得出了关键洞察:(1) 可靠性差距 (https://huggingface.co/papers?q=Reliability%20Gap):模型通常能正确验证零散元素,但在严格的合取约束下却会失败,揭示了在密集领域的脆弱性;(2) 开闭源分层 (https://huggingface.co/papers?q=Open-Closed%20Stratification):与推理趋势相反,我们揭示了开源与闭源前沿之间存在持续的 8% 感知差距;(3) 人类对齐的严格性 (https://huggingface.co/papers?q=Human-Aligned%20Rigor):我们的门控指标大幅超越传统基准的对齐度,验证了严格的感知保真度是可靠生成的前提。
查看 arXiv 页面 (https://arxiv.org/abs/2606.28322)查看 PDF (https://arxiv.org/pdf/2606.28322)项目页面 (https://weiyana.github.io/PerceptionRubrics/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.28322)
在你的代理中获取此论文:
hf papers read 2606\.28322
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.28322 以从此页面链接。
引用此论文的数据集1
M1chaelPeng/PerceptionRubrics 查看器• 更新于 1 天前 • 1.04k • 10 (https://huggingface.co/datasets/M1chaelPeng/PerceptionRubrics)
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.28322 以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将本论文添加到一个收藏 (https://huggingface.co/new-collection)中以从此页面链接。
相似文章
@yanawei_:感谢AK推荐我们的工作!更多详情:http://weiyana.github.io/PerceptionRubrics…
介绍了PerceptionRubrics,这是一个基于评分标准的多模态AI评估框架,从整体匹配转向原子级审计,使用了1,038张图像和超过10,000个实例特定评分标准,并通过门控评分来强制执行严格的感知保真度。
PerceptionBench:评估多模态大语言模型中的原子视觉感知
PerceptionBench 是一个基准测试,旨在评估多模态大语言模型(MLLMs)的原子视觉感知能力,采用了由十种原子感知能力组成的自底向上分类法。对16个前沿MLLM的测试结果显示,没有任何模型达到60%的准确率,表明视觉感知问题在很大程度上仍未解决。
通过感知扰动与奖励建模缓解多模态LLM评判中的感知判断偏差
本文识别出多模态LLM评判者存在的感知判断偏差,即它们倾向于过度奖励流畅但视觉错误的回答,并提出了数据集PPJD以及利用GRPO与批量排序奖励训练的模型Perception-Judge,以缓解此偏差并提升基于感知的评估质量。
CalibratedRubric:面向开放式LLM评估的任务自适应评分标准库
CalibratedRubric是一个任务自适应框架,用于为开放式LLM评估构建紧凑且可测量的评分标准库,通过贝叶斯可测量性过滤和基于IRT的选择,在金融、医疗、通用和法律基准上提升人类-金标准一致性和排序保真度。
C2:基于二元偏好的可扩展评分增强奖励建模
C2 提出了一种可扩展的评分增强奖励建模框架,该框架仅通过二元偏好训练一个协作的评分生成器和一个批判性验证器,无需昂贵的评分标注,同时在 RM-Bench 上实现了最高 6.5 分的提升。