基于智能体评估与稳定性感知排序的多模态大语言模型鲁棒检查点选择

arXiv cs.LG 论文

摘要

本文解决了评估不确定性下多模态大语言模型的鲁棒检查点选择挑战,提出了一个多阶段框架,整合了精心策划的真实世界数据、基于LLM的判断以及带有置信度估计的排序协议。

arXiv:2605.18852v1 公告类型:新 摘要:当性能差异微小且评估信号易受噪声干扰时,多模态大语言模型(MLLMs)的检查点选择面临着重大挑战。现有方法严重依赖静态基准或逐点评分,这些方法常常与真实世界使用场景不一致,并且缺乏鲁棒的置信度估计,尤其是在OCR密集型场景中。本文将检查点选择形式化为一个评估不确定性下的鲁棒决策问题。我们提出了一个多阶段框架,整合了精心策划的真实世界数据、结构化的基于LLM的判断以及多阶段排序协议。评估系统通过逐点过滤、列表排序和成对比较实现渐进式细化。为了增强可靠性,我们引入了基于子采样的置信度估计和基于百分位的评分公式,该公式捕捉分布特征的同时惩罚尾部失败。此外,我们证明了数据质量,特别是OCR可读性,是评估有效性的关键决定因素。
查看原文

相似文章

面向可靠LLM判断的边际自适应置信度排序

arXiv cs.LG

本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。

论大型语言模型评估中提示排名的稳定性

arXiv cs.CL

本文系统研究了常见变异来源下,大型语言模型评估中提示排名的稳定性,发现表现最佳的提示经常发生变化。为此,提出了一种基于下置信界的稳定性感知选择策略,以提高鲁棒性。

量化LLM基准中的排名不确定性

arXiv cs.LG

本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。

分布鲁棒的列表级偏好优化

arXiv cs.AI

本文提出一种用于LLM对齐的分布鲁棒列表级偏好优化方法,处理排序标签不确定性,具有可处理的目标函数和强收敛性保证。