MM-JudgeBias:评测 MLLM-as-a-Judge 组合偏差的基准
摘要
研究者发布 MM-JudgeBias 基准,揭示多模态大模型在充当自动评判器时的系统性组合偏差,对 26 个 SOTA MLLM 在 1,800 条样本上进行测试。
查看缓存全文
缓存时间: 2026/04/22 06:17
论文页面 - MM-JudgeBias:评估 MLLM-as-a-Judge 组合偏差的基准
来源:https://huggingface.co/papers/2604.18164
摘要
研究发现,作为自动评估器的多模态大语言模型存在系统性偏差,暴露出可靠性问题,并提出通过受控扰动和特定指标测量组合偏差的基准。
多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)越来越多地被用作自动评估器——这一范式被称为 MLLM-as-a-Judge(https://huggingface.co/papers?q=MLLM-as-a-Judge)。然而,其可靠性及对偏差的脆弱性仍缺乏深入探索。我们发现,许多 MLLM 评委无法可靠地整合关键视觉或文本线索,在证据缺失或不匹配时给出不可靠的评价,并在语义无关的扰动下表现出不稳定。为此,我们系统定义了 MLLM-as-a-Judge 系统中的组合偏差(https://huggingface.co/papers?q=Compositional%20Bias),并推出 MM-JudgeBias(https://huggingface.co/papers?q=MM-JudgeBias)基准来评估该偏差。MM-JudgeBias 在 Query、Image 与 Response 三个维度引入受控扰动,并通过两个互补指标评估模型行为:偏差偏离(https://huggingface.co/papers?q=Bias-Deviation)(BD)衡量敏感性,偏差一致性(https://huggingface.co/papers?q=Bias-Conformity)(BC)衡量稳定性。我们基于 29 个源基准精选并完善 1,800 余条多模态样本,可在多种任务与领域对九类偏差进行细粒度诊断。在 26 个前沿 MLLM 上的实验揭示了系统性的模态忽视与不对称评估倾向,凸显了对更可靠评委的迫切需求。
查看 arXiv 页面(https://arxiv.org/abs/2604.18164)
查看 PDF(https://arxiv.org/pdf/2604.18164)
项目主页(https://mm-judgebias.github.io/)
GitHub0(https://github.com/naver-ai/MM-JudgeBias)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.18164)
引用该论文的模型 0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2604.18164,即可在此页面显示链接。
引用该论文的数据集 0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2604.18164,即可在此页面显示链接。
引用该论文的 Spaces 0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2604.18164,即可在此页面显示链接。
包含该论文的收藏 0
暂无收藏包含此论文
创建收藏 并添加该论文,即可在此页面显示链接。
相似文章
通过感知扰动与奖励建模缓解多模态LLM评判中的感知判断偏差
本文识别出多模态LLM评判者存在的感知判断偏差,即它们倾向于过度奖励流畅但视觉错误的回答,并提出了数据集PPJD以及利用GRPO与批量排序奖励训练的模型Perception-Judge,以缓解此偏差并提升基于感知的评估质量。
我们能否信任LLM评审者:基于能力的偏见研究与多评审者集成偏差校准
本研究调查了LLM评审者中基于能力的偏见,并引入了一种校准的加权多数投票集成方法,以在不需要标注数据的情况下提高自动化评估的可靠性。
多视频摘要中多模态大语言模型位置偏差的系统性评估
吉林大学研究人员对多模态大语言模型(MLLMs)在多视频摘要任务中的位置偏差进行了系统性评估,基于 ActivityNet 和新闻视频构建了评测基准,并采用覆盖率、方向性位置偏差(DPB)和中间-边缘差距(MEG)等指标对九个模型进行了全面评估。结果表明,位置效应因领域和模型而异,且增加视觉输入或生成预算并不能统一消除这种不平衡现象。
Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges
A research paper introducing Chain-of-Models (CoM), an automated pipeline where a second LLM audits a first model's reasoning trace to correct cognitive biases. It finds that auditor effectiveness depends on model family and bias type, and proposes a bias-specific auditor selection rule that improves judgment accuracy.
评判电路
本文研究了LLM-as-a-judge的内部机制,发现模型在中期到后期的多层感知机(MLP)中共享一个稀疏的潜在评估器子图,该子图处理抽象评判,而格式特定的终端分支将评判映射到输出令牌,揭示了格式导致的不一致性的原因。