多模态大语言模型中的不确定性感知决策

arXiv cs.CL 论文

摘要

本综述整理了多模态大语言模型中不确定性感知决策的研究,涵盖了不确定性的来源、校准方法,以及提高系统可靠性和安全性的行动。

arXiv:2608.17084v1 Announce Type: new 摘要:多模态大语言模型(MLLMs)越来越多地回答其正确性依赖于视觉、文本、时间、听觉、文档、图表或具身证据的问题。因此,它们的失败不仅仅是语言上的。一个流畅的答案可能掩盖了输入质量差、感知错误、基础薄弱、模态间冲突、推理不稳定、分布偏移或无法从提供证据回答的问题。本综述围绕一个以决策为中心的框架组织了关于不确定性感知MLLMs的文献:不确定性来源产生可观察信号,信号必须针对风险进行校准或控制,校准后的不确定性应决定系统行动。我们回顾了关于token和logit不确定性、语义分歧、扰动不稳定性、基础和归因分数、口头化置信度、验证器和评判者分数、共形预测、选择性回答、拒绝、澄清、检索、自检和升级的工作。中心论点是,不确定性不应仅作为置信度数字来评估;而应通过它在不足、冲突、偏移或多模态证据风险高的情况下是否能改善行为来评估。我们将本综述定位在纯文本不确定性和拒绝综述、广泛MLLM综述、MLLM幻觉综述和面向安全的综述之间。最后,我们讨论了在来源感知分解、行动感知基准、偏移下的校准、黑盒不确定性估计、更广泛的模态覆盖、可重复报告和以人为中心的不确定性通信方面的开放问题。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:47

# 多模态大语言模型中的不确定性感知决策:关于来源、信号、校准与行动的综述

来源:https://arxiv.org/html/2608.17084

Abderrahmene Boudiaf  
邮箱:[[email protected]](mailto:[email protected])  
地址:阿拉伯联合酋长国阿布扎比哈利法科学技术大学  
通讯作者:Irfan Hussain  
Sajid Javed  
地址:阿拉伯联合酋长国阿布扎比哈利法科学技术大学

###### 摘要
多模态大语言模型(MLLMs)越来越多地处理那些答案正确性依赖于视觉、文本、时间、听觉、文档、图表或具身证据的问题。因此,它们的失败不仅仅是语言层面的。一个流畅的回答可能掩盖了低质量的输入、感知错误、较弱的定位、模态间的冲突、不稳定的推理、分布偏移,或者无法从提供的证据中回答的问题。本综述围绕一个以决策为中心的框架组织关于不确定性感知MLLMs的文献:不确定性来源产生可观察的信号,信号必须经过校准或风险控制,校准后的不确定性应决定系统行动。我们回顾了关于token和logit不确定性、语义分歧、扰动不稳定性、定位与归因分数、语言化置信度、验证器与评判器分数、保形预测、选择性回答、拒绝回答、澄清、检索、自我检查以及升级处理等方面的研究工作。核心论点是,不确定性不应仅被评估为一个置信度数值;它应当通过在证据不足、存在冲突、发生偏移或多模态证据具有高风险时,其是否改善了系统行为来评估。我们将本综述定位在与纯文本不确定性与拒绝回答综述、广泛的MLLM综述、MLLM幻觉综述以及面向安全的综述相对照的位置。最后,我们指出了在源感知分解、行动感知基准测试、偏移下的校准、黑盒不确定性估计、更广泛的模态覆盖、可复现报告以及以人为中心的不确定性沟通等方面存在的开放性问题。

###### 关键词:多模态大语言模型,不确定性量化,置信度校准,选择性回答,拒绝回答,可回答性,可信人工智能

## 1 引言
多模态大语言模型通过感知和结构化输入扩展了语言生成能力,这些输入包括图像、视频、音频、图表、文档和具身观察。这一扩展使得MLLMs在视觉问答、图表与文档理解、视频推理、医学图像解读、多模态对话和交互式智能体方面非常有用。这也改变了可靠性问题。一个生成的回答可能在语言上很流畅,但底层证据可能是模糊的、被遮挡的、不完整的、冲突的、超出模型训练分布的,或者根本不足以回答问题。这种区分很重要,因为MLLMs中的不确定性不是单一现象。一些不确定性始于输入:图像可能质量低,视频可能遗漏了相关时刻,或者音频可能有噪声。一些不确定性产生于感知和定位过程:模型可能识别了错误的对象,关注了错误的区域,或者生成了一个仅得到视觉证据弱支持的回答。其他不确定性则出现得更晚,例如当语言组件用先验知识填补缺失证据时,当推理路径变得不稳定时,或者当部署领域与校准设置不同时。在最直接的情况下,问题是根本无法从提供的多模态证据中回答。现有的关于不确定性量化、置信度校准、语义不确定性、选择性预测和拒绝回答的纯文本工作提供了重要的基础。这些基础仍然相关,但它们对于多模态系统来说还不够充分。一个纯文本置信度分数无法揭示证据是否可见、视觉和文本信号是否一致、回答是否基于正确区域,或者模型是否应该要求更清晰的输入。对于MLLMs,不确定性必须与证据质量以及由该证据引发的行动相关联。因此,本综述的核心论点是决策中心化的:当不确定性改变了系统的行为时,它才是有用的。一个报告置信度值但以相同方式回答所有问题的系统,在部署意义上还不能算是不确定性感知的。一个更可靠的MLLM应该在证据充分时回答,在置信度有限时有所保留,在证据缺失时拒绝回答或说“我不知道”,在用户查询未充分指定时要求澄清,在感知薄弱时请求更好的输入,在任务需要超出输入的外部知识时检索证据,在推理不稳定时进行自我检查,以及在情况过于危险而无法自主处理时进行升级。图1给出了本文的组织框架,并作为综述路线图。输入和上下文产生不确定性来源;来源产生可观察的信号;信号被转换为校准的置信度或受控风险;最终的估计支持一个行动策略。这条源-信号-校准-行动链使我们能够讨论各种方法,而不会让综述变成孤立论文的列表。

![图1:不确定性感知MLLMs的源-信号-校准-行动框架。多模态输入和领域上下文产生不确定性来源。这些来源通过模型内部、输出层面、证据定位、语言化、验证器或评判器信号进行观察。校准和风险控制方法将原始信号转换为与决策相关的估计。最终的策略选择一个行动:回答、保留、拒绝回答或说IDK、澄清、请求更好的输入、检索证据、自我检查,或将该案例转交给更强的模型或人类专家。](https://arxiv.org/html/2608.17084/S1.F1)
*图1:不确定性感知MLLMs的源-信号-校准-行动框架。多模态输入和领域上下文产生不确定性来源。这些来源通过模型内部、输出层面、证据定位、语言化、验证器或评判器信号进行观察。校准和风险控制方法将原始信号转换为与决策相关的估计。最终的策略选择一个行动:回答、保留、拒绝回答或说IDK、澄清、请求更好的输入、检索证据、自我检查,或将该案例转交给更强的模型或人类专家。*

围绕此框架的证据基础涵盖了多模态训练前后的校准、推理步骤的置信度边界、解耦的视觉与推理置信度、无需训练的多模态不确定性估计、选择性视觉问答、多模态自我感知与IDK行为、保形预测与风险控制、针对特定模态的不确定性基准测试,以及在视觉、视频、具身、音频和全模态设置中的拒绝或可回答性研究。这些研究相互关联,但分散在校准、幻觉检测、选择性预测、可回答性、保形风险控制和领域特定可信度等领域。本综述将它们整合到一个以决策质量为中心的叙述中。

#### 贡献
本综述有四项贡献。第一,它引入了不确定性感知MLLMs的源-信号-校准-行动分类法。第二,它综合了多模态系统特有的不确定性来源,包括感知歧义、感知错误、定位失败、跨模态冲突、语言先验主导、推理不稳定、可回答性不确定性和分布偏移。第三,它将不确定性估计与诸如拒绝回答、澄清、检索、自我检查和升级处理等响应行动联系起来。第四,它将评估重点从单纯的置信度质量重新组织为不确定性下的行为。

#### 范围
本综述专注于MLLMs、大型视觉-语言模型(LVLMs)以及相关的视觉-语言模型(VLM)桥接工作,前提是这些论文直接涉及不确定性估计、校准、风险控制、可回答性、拒绝回答或行动选择。纯文本LLM的不确定性和拒绝回答研究在定义方法类别、评估概念或有用的基线时作为背景参考。一般的幻觉、安全性和广泛的MLLM综述仅在澄清本综述边界时才进行讨论。

#### 组织结构
第2节定义了范围、定位和证据基础。第3节回顾了MLLMs中不确定性的来源。第4节组织了可观察的信号和估计方法。第5节讨论了校准和风险控制。第6节将不确定性与响应行动联系起来。第7节回顾了评估协议、基准测试和指标。第8节讨论了部署环境。第9节给出了研究议程。第10节和第11节结束全文。

## 2 范围、定位与证据基础
关于不确定性感知MLLMs的综述需要明确的边界。我们将不确定性感知决策定义为研究那些为了在多模态证据下改善行为而估计、表达、校准或控制不确定性的方法。该定义包括不确定性估计,但也包括下游策略:系统是否应该回答、保留、拒绝回答、要求澄清、请求更好的输入、检索证据、验证其响应或升级处理该案例。

### 2.1 问题定义与术语
假设用户提供多模态证据 $M$,一个提示或任务 $q$,以及可选的上下文 $c$(如领域、风险水平或检索到的信息)。一个不确定性感知的MLLM不仅产生一个答案 $y$。它还估计一个信号 $s$,将该信号转换为校准后的置信度或风险估计 $r$,并通过策略 $\pi$ 选择一个行动 $a$。非正式地,决策过程为 $(a,y,r)=\pi\big(q,M,c,s(q,M,c)\big)$。答案可以直接返回,加上限定词进行保留,替换为IDK(我不知道)响应,延迟到澄清或检索完成后再决定,或转交给另一个系统或人类专家。这种表述是刻意简化的。其目的是让综述专注于不确定性与行动之间的关系,而不是纠结于不确定性的单一数学定义。我们使用“不确定性源”指代一个响应可能不可靠的根本原因。我们使用“不确定性信号”指代可能揭示不可靠性的可观测数量或行为,如熵、logit间隔、语义分歧、视觉扰动不稳定性、定位分数、语言化置信度、预测集大小、可回答性分数或验证器分数。我们使用“校准”指代估计的置信度或风险与经验正确性或行动成本之间的一致性。我们使用“策略”指代将不确定性映射到响应行动的规则。

### 2.2 纳入标准
当不确定性是方法、基准、指标或响应策略的一部分时,该论文即属于本综述的核心。这包括MLLM和LVLM中关于置信度估计、校准、选择性回答、保形预测、当被构建为不确定性时的幻觉或错误检测、可回答性、IDK行为、拒绝回答、自我检查、检索决策和升级处理的研究。我们也纳入来自VLM和纯文本LLM的桥接工作,当它们定义了理解MLLM不确定性所必需的概念或方法时。我们并不试图综述关于多模态幻觉、安全、稳健性或广泛MLLM评估的每一篇论文。这些文献是相邻的且通常相关,但只有当它们将证据不确定性与校准置信度、风险控制或行动选择联系起来时,它们才成为本综述的核心。这一边界防止本综述成为一篇普通的MLLM可靠性评论。

### 2.3 相对于邻近综述的定位
最接近的综述类别涵盖了纯文本不确定性、纯文本拒绝回答、MLLM幻觉、MLLM安全性或广泛的MLLM评估。这些领域很重要,但它们没有完全以多模态证据的“从源到行动”链为中心。表1总结了分类性的定位。这种格式优于任意的双轴图,因为差异是概念性的而非几何性的。

*表1:相对于邻近综述类别的定位。该表将相关覆盖范围与本综述所解决的空白区分开来。前四行的引用是邻近综述类别的代表性锚点;最后一行陈述了本综述的定位。*

### 2.4 证据基础与可追溯性
核心证据基础包含67行聚焦证据,来源于MLLM和LVLM研究、VLM桥接工作、领域特定研究以及直接相关的综述。手稿还使用了额外的背景综述引文用于表1中的定位;这些背景引文不计入聚焦证据行。证据矩阵保留了一行额外的非计数桥接行以保持可追溯性。搜索日志、证据层级会计、提取字段和语料库刷新详情保留在附录A中。这种分离在保持可追溯性的同时不干扰主要的综合分析。在主要的综合表格中,附加在行标签上的引文是代表性锚点而非详尽列表;解释、行动和注意事项单元格综合了所引用文献和周围子章节中反复出现的模式。

确定了范围后,论文的其余部分遵循图1中的框架。我们首先确定不确定性进入多模态管道的位置,然后追问这些来源如何被观察、校准、转化为行动以及评估。

## 3 MLLMs中不确定性的来源
该框架中的第一个问题是不确定性的来源。对于MLLMs,这个问题不能仅仅通过查看最终答案或token分布来回答。不确定性可能起源于输入、感知编码器、跨模态对齐、推理路径、部署领域或任务的可回答性。一个源感知的分类很重要,因为不同的来源需要不同的行动。模糊可能需要更好的图像。缺失的证据可能需要拒绝回答。跨模态冲突可能需要自我检查或检索。高风险可能需要升级处理。

相似文章

基于大语言模型的运筹学不确定性感知仿真推断

arXiv cs.LG

本文提出了一种无需训练、不确定性感知的推断框架,用于在运筹学中应用大语言模型。该方法使用短视前瞻仿真和重要性重采样来提高数学公式表述的一致性,在OR基准测试上优于标准基线。