通过感知扰动与奖励建模缓解多模态LLM评判中的感知判断偏差
摘要
本文识别出多模态LLM评判者存在的感知判断偏差,即它们倾向于过度奖励流畅但视觉错误的回答,并提出了数据集PPJD以及利用GRPO与批量排序奖励训练的模型Perception-Judge,以缓解此偏差并提升基于感知的评估质量。
查看缓存全文
缓存时间: 2026/06/03 15:38
论文页面 - 通过感知扰动和奖励建模缓解多模态LLM评判中的感知判断偏差
来源:https://huggingface.co/papers/2606.02578
我们识别并分析了感知判断偏差(Perceptual Judgment Bias),这是一种多模态LLM评判器在给定视觉证据时,过度奖励流畅或看似合理的回答(即使其中包含视觉错误)的失效模式。
重要的是,这不仅仅是一个感知问题。我们发现,即使评判器能够正确感知图像,它仍可能锚定于回答文本,在评估过程中无法运用自身的视觉证据。
为缓解此问题,我们构建了PPJD——一个包含受控感知扰动的数据集,并使用带有可验证批量排名奖励的GRPO训练了Perception-Judge。这有助于评判器区分正确回答与视觉错误但流畅的回答,从而实现更基于感知、更符合人类判断的多模态评估。
相似文章
MM-JudgeBias:评测 MLLM-as-a-Judge 组合偏差的基准
研究者发布 MM-JudgeBias 基准,揭示多模态大模型在充当自动评判器时的系统性组合偏差,对 26 个 SOTA MLLM 在 1,800 条样本上进行测试。
审计多模态LLM评分器:临床序数评分中的中央趋势偏差
本文研究了用于临床序数评分(画钟测试)的多模态LLM中的中央趋势偏差。研究发现,LLM将预测结果向量表中间压缩,对关键极端值造成不成比例的影响。该研究将LLM作为裁判的偏差文献扩展到临床评估领域,强调在部署前需要进行校准感知评估。
通过随机数生成缓解 LLM-as-a-Judge 中的评分偏差
本文提出了一种新方法,通过让 LLM 随机生成数字来测量其潜在的数字偏差,并据此修正 token 生成概率,从而缓解 LLM-as-a-Judge 中的评分偏差。在四个任务上的实验表明,该方法优于基线方法,并揭示了评分偏差在不同模型、任务和分数区间上的差异。
RoPoLL: 鲁棒的LLM评审团面板
本文提出了RoPoLL,一种鲁棒的LLM评审团面板,用几何中位数聚合替代标准平均,以处理个别评审的偏见污染,相比标准PoLL提供了理论保证和实证优势。
从提示到行为对齐:用于推荐评估的个性化LLM评判器
本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。