MM-JudgeBias:评测 MLLM-as-a-Judge 组合偏差的基准

Hugging Face Daily Papers 论文

摘要

研究者发布 MM-JudgeBias 基准,揭示多模态大模型在充当自动评判器时的系统性组合偏差,对 26 个 SOTA MLLM 在 1,800 条样本上进行测试。

多模态大语言模型(MLLM)越来越多地被用作自动评估器,这一范式被称为 MLLM-as-a-Judge。然而,其可靠性以及对偏差的脆弱性仍缺乏深入探讨。我们发现,许多 MLLM 评判器无法可靠整合关键的视觉或文本线索,在证据缺失或错位时给出不可靠的评价,并对语义无关的扰动表现出不稳定性。为此,我们系统定义了 MLLM-as-a-Judge 中的“组合偏差”,并推出评测基准 MM-JudgeBias。MM-JudgeBias 在 Query、Image 与 Response 三个维度引入受控扰动,通过互补的 Bias-Deviation(BD,敏感度)与 Bias-Conformity(BC,稳定性)两项指标评估模型行为。数据集包含 1,800 余条经精心策划与精炼的多模态样本,源自 29 个原始基准,可在多种任务与领域中细粒度诊断九类偏差。对 26 个 SOTA MLLM 的实验揭示了系统性的模态忽视与非对称评估倾向,凸显了构建更可靠评判器的迫切需求。
查看原文
查看缓存全文

缓存时间: 2026/04/22 06:17

论文页面 - MM-JudgeBias:评估 MLLM-as-a-Judge 组合偏差的基准

来源:https://huggingface.co/papers/2604.18164

摘要

研究发现,作为自动评估器的多模态大语言模型存在系统性偏差,暴露出可靠性问题,并提出通过受控扰动和特定指标测量组合偏差的基准。

多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)越来越多地被用作自动评估器——这一范式被称为 MLLM-as-a-Judge(https://huggingface.co/papers?q=MLLM-as-a-Judge)。然而,其可靠性及对偏差的脆弱性仍缺乏深入探索。我们发现,许多 MLLM 评委无法可靠地整合关键视觉或文本线索,在证据缺失或不匹配时给出不可靠的评价,并在语义无关的扰动下表现出不稳定。为此,我们系统定义了 MLLM-as-a-Judge 系统中的组合偏差(https://huggingface.co/papers?q=Compositional%20Bias),并推出 MM-JudgeBias(https://huggingface.co/papers?q=MM-JudgeBias)基准来评估该偏差。MM-JudgeBias 在 Query、Image 与 Response 三个维度引入受控扰动,并通过两个互补指标评估模型行为:偏差偏离(https://huggingface.co/papers?q=Bias-Deviation)(BD)衡量敏感性,偏差一致性(https://huggingface.co/papers?q=Bias-Conformity)(BC)衡量稳定性。我们基于 29 个源基准精选并完善 1,800 余条多模态样本,可在多种任务与领域对九类偏差进行细粒度诊断。在 26 个前沿 MLLM 上的实验揭示了系统性的模态忽视与不对称评估倾向,凸显了对更可靠评委的迫切需求。

查看 arXiv 页面(https://arxiv.org/abs/2604.18164)
查看 PDF(https://arxiv.org/pdf/2604.18164)
项目主页(https://mm-judgebias.github.io/)
GitHub0(https://github.com/naver-ai/MM-JudgeBias)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.18164)

引用该论文的模型 0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2604.18164,即可在此页面显示链接。

引用该论文的数据集 0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2604.18164,即可在此页面显示链接。

引用该论文的 Spaces 0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2604.18164,即可在此页面显示链接。

包含该论文的收藏 0

暂无收藏包含此论文

创建收藏 并添加该论文,即可在此页面显示链接。

相似文章

多视频摘要中多模态大语言模型位置偏差的系统性评估

arXiv cs.CL

吉林大学研究人员对多模态大语言模型(MLLMs)在多视频摘要任务中的位置偏差进行了系统性评估,基于 ActivityNet 和新闻视频构建了评测基准,并采用覆盖率、方向性位置偏差(DPB)和中间-边缘差距(MEG)等指标对九个模型进行了全面评估。结果表明,位置效应因领域和模型而异,且增加视觉输入或生成预算并不能统一消除这种不平衡现象。

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges

arXiv cs.CL

A research paper introducing Chain-of-Models (CoM), an automated pipeline where a second LLM audits a first model's reasoning trace to correct cognitive biases. It finds that auditor effectiveness depends on model family and bias type, and proposes a bias-specific auditor selection rule that improves judgment accuracy.

评判电路

arXiv cs.CL

本文研究了LLM-as-a-judge的内部机制,发现模型在中期到后期的多层感知机(MLP)中共享一个稀疏的潜在评估器子图,该子图处理抽象评判,而格式特定的终端分支将评判映射到输出令牌,揭示了格式导致的不一致性的原因。