小型视觉-语言模型知道自己错了但说不出来:一项关于在现实图像退化下陈述信心与内部信心的双模型研究
摘要
本文评估了小型开源视觉-语言模型(Qwen2-VL-2B和SmolVLM)如何处理现实图像退化,发现它们口头表达的信心不可靠,而内部令牌概率提供了更好的错误检测能力,尽管两者在严重低光条件下均失败。
arXiv:2607.22034v1 Announce Type: cross
摘要:视觉-语言模型(VLM)正越来越多地部署在消费级硬件上,输入图像会受到压缩、相机抖动和光线不足的影响。在此类场景中,可靠的置信信号比原始准确性更重要,因为它决定了系统应何时选择拒答而非回答。我们评估了两种小型开源VLM——Qwen2-VL-2B-Instruct和SmolVLM-Instruct——在三种严重程度的六种真实摄影退化条件下的表现,比较了两种置信信号:模型用自然语言陈述的置信度,以及模型对其生成答案的平均令牌概率。通过对3800个预测的分析,我们发现存在巨大且一致的差距。Qwen2-VL中口头表达的置信度几乎恒定(所有条件下均值0.87-0.90),且检测自身错误的能力仅达到随机水平(AUROC 0.39-0.75,通常约0.50),而同一模型的内部令牌概率区分正确与错误答案的AUROC为0.92-0.99。在SmolVLM中,口头置信度几乎无法获取:在三种提示模板下,五次初步尝试仅有一次产生了可解析的置信度值,而内部概率再次实现了高于随机水平的错误检测(AUROC 0.54-0.92)。两个模型在相同情况下失效:在严重曝光不足条件下,准确率骤降(Qwen2-VL从0.99降至0.22,SmolVLM从0.97降至0.42),而两种置信信号几乎不变,内部错误检测降至随机水平。我们得出结论:小型VLM编码了可用的自我认知,但口头输出未能表达;因此在受限部署中,内部概率是更好的拒答信号;且两种信号在严重低光条件下均不可信。
查看缓存全文
缓存时间: 2026/07/27 07:42
# 小型视觉语言模型知道自己错了但无法表达:一项关于现实图像降质下陈述自信度与内在自信度的双模型研究
来源:https://arxiv.org/html/2607.22034
###### 摘要
视觉语言模型(VLM)日益部署在消费级硬件上,此时输入图像会因压缩、相机抖动和光线不足而退化。在此类场景中,可靠的不确定性信号比原始准确率更为重要,因为它决定了系统何时应选择暂缓回答而非直接作答。我们评估了两个小型开源VLM——Qwen2-VL-2B-Instruct和SmolVLM-Instruct——在六种现实摄影降质条件下的表现,每种降质分三个严重等级,比较两种置信度信号:模型以自然语言*陈述*的置信度,以及模型在其生成答案上的平均词元概率。在3800个预测中,我们发现了一个巨大且一致的差距。Qwen2-VL的言语化置信度几乎恒定(所有条件下均值0.87–0.90),其错误检测能力仅为随机水平(AUROC 0.39–0.75,通常≈0.50),而同一模型的内在词元概率区分正确与错误答案的AUROC可达0.92–0.99。在SmolVLM中,言语化置信度基本无法获取:三种提示模板中只有一种在五次试点尝试中产生了一个可解析的置信度值,而内在概率再次实现了高于随机的错误检测(AUROC 0.54–0.92)。两个模型的失效点相同:在严重欠曝光条件下,准确率骤降(Qwen2-VL从0.99降到0.22,SmolVLM从0.97降到0.42),而两种置信度信号几乎不变,内在错误检测也降至随机水平。我们的结论是:小型VLM编码了可用的自我认知,但其言语化输出未能表达;因此,在资源受限的部署中,内在概率是更好的暂缓信号;并且,在严重低光条件下,两种信号都不可信任。
## 1 引言
视觉语言模型的实际部署越来越集中于小参数范围。20亿到80亿参数的模型运行在消费级GPU和边缘设备上,因成本、延迟、隐私或缺乏可靠网络连接而被选用。在这些场景中,到达模型的图像很少是干净的基准照片:它们被即时通信应用压缩、因手持拍摄而模糊、室内欠曝光或因直射光线而褪色。仅靠准确率不足以描述这种系统的行为。决定部署是否安全的关键在于:模型表达的不确定性是否与其实际可靠性一致——即,当模型变得不可靠时,其输出中是否有任何迹象表明这一点。一个出错但发出怀疑信号的模型可以求助于人类;一个出错却表现出自信的模型则不能。
生成式VLM提供了两种获取不确定性估计的不同途径。第一种是直接询问模型并读取其陈述的数字——*言语化置信度*。第二种是读取模型在其生成词元上的概率分布——*内在置信度*。这两者在明显不是同一回事,并且在输入降质条件下,它们之间的关系尚未针对小型开源模型进行系统研究。本文提出三个问题:
- • RQ1:小型VLM在现实摄影失真下的准确率如何退化?
- • RQ2:言语化置信度是否跟踪这种退化?
- • RQ3:内在词元概率是否更好地跟踪这种退化?
我们的贡献是:(i)对两个小型开源VLM在六种现实降质条件、分级严重度下进行以校准为中心的基准测试,并附有bootstrap置信区间;(ii)证据表明言语化置信度与内在置信度严重背离,内在概率在言语化置信度仅为随机水平时实现了接近上限的错误检测;(iii)诚实描述两种信号均失效的场景。
## 2 相关工作
### 2.1 语言和视觉语言模型中的言语化不确定性
由于生成式模型输出文本而非概率向量,一种自然的不确定性估计方法是提示模型陈述其自身置信度。Xiong等人(2024)评估了LLM中的置信度激发策略,报告模型过于自信,大多数置信度分数落在80–100范围内。Tian等人(2023)发现,对于经过RLHF微调的模型,言语化置信度可以比基于采样的内在词元概率估计更好校准——这一结果使得言语化不确定性成为后续许多VLM工作的默认选择。Groot和Valdenegro-Toro(2024)将言语化置信度估计扩展到视觉问答任务,发现VLM校准差且过度自信。
### 2.2 图像退化下的言语化不确定性
与我们最相关的工作是Borszukovszki等人(2025),他们评估了三个专有VLM(GPT-4 Vision、Gemini Pro Vision、Claude 3 Opus)在三种失真类型(高斯噪声、散焦模糊、JPEG压缩)下、五个严重等级、涵盖简单VQA、困难VQA和计数任务的表现。他们报告:增加退化严重度会提高期望校准误差(ECE),模型始终过度自信,更高的拒绝率可改善校准。我们在开源模型上复现了他们的核心发现:我们的Qwen2-VL-2B陈述了几乎恒定的置信度0.87–0.90,与准确率无关,与他们以及Xiong等人(2024)报告的80–100聚类一致,且在严重退化下校准急剧恶化。我们的贡献与他们是正交的,他们的论文恰好说明了原因。他们使用言语化置信度的动机是,对于所研究的模型,“由于这些模型是专有的,我们无法获得这些个体词元概率”,并将他们的贡献描述为将研究扩展到“内在词元概率不可用的VLM”。因此,他们的设计*无法*比较言语化置信度与模型自身的词元级分布——该信号因构建原因而不可访问。通过评估开源模型,我们恢复了这一信号。这使得他们的场景无法进行的比较得以实现:在相同预测、相同退化条件下,比较言语化与内在置信度。我们的核心发现——内在词元概率以AUROC高达0.99检测错误,而来自同一模型的言语化置信度仅为随机水平——只有在开源场景下才能测量。
我们在另外三个方面也有所不同。首先,Borszukovszki等人(2025)评估了前沿专有模型;我们评估的是小型(约20亿参数)开源模型,代表了资源受限的部署场景。其次,他们使用了Michaelis等人(2019)的三种合成失真族;我们选用了六种近似真实手机相机伪影的退化类型,包括低光和眩光,并发现低光会产生其失真集中未显示的失效模式。第三,他们报告准确率、置信度和ECE;我们添加了带bootstrap置信区间的错误检测AUROC,我们认为当置信度信号方差接近零时(第4节),这一指标更具诊断性。最后,Borszukovszki等人(2025)明确将温度缩放列为未来工作,指出“探索VLM中的过度自信能否通过温度缩放来治疗,将是很有趣的”。我们直接测试了这一点,并报告了一个负面结果:后处理温度缩放在轻度退化下改善了ECE,但在严重低光下*恶化*了ECE,因为对几乎恒定的信号进行缩放无法恢复信号从未包含的信息。
### 2.3 退化鲁棒性和分布偏移下的校准
退化鲁棒性的系统研究由Hendrycks和Dietterich(2019)形式化,他们引入了参数化退化族,并设置了校准的严重度等级;Michaelis等人(2019)扩展了这一分类。我们遵循他们的方法论模板,以严重度函数而非聚合值报告分级严重度。另外,Ovadia等人(2019)确立了预测不确定性在数据集偏移下会退化,而Guo等人(2017)表明后处理温度缩放可以纠正分类器中的过度自信。我们关于温度缩放的负面结果与Guo等人(2017)描述的机制一致:温度缩放重新分配概率质量,但无法创造不存在的判别信号。
### 2.4 定位总结
据我们所知,此前没有研究在视觉语言模型中图像退化条件下比较相同预测上的言语化与内在置信度。最接近的工作(Borszukovszki等人,2025)将内在词元概率的缺失确定为其场景的一个定义性约束。本文填补了这一空白。
## 3 方法
### 3.1 模型
我们评估两个小型开源指令微调VLM:Qwen2-VL-2B-Instruct(Wang等人,2024)和SmolVLM-Instruct(Hugging Face TB,2024)。两者均在fp16下运行于单个免费层级的NVIDIA T4(16 GB)上。为可复现性,生成采用贪心策略(do_sample=False)。
### 3.2 数据集
使用Food101(Bossard等人,2014)的100项子集(测试集,流式,种子0),作为四选一多项选择题:一个正确标签和三个从其余100个类别中均匀采样的干扰项。Food101提供真实照片,分辨率可用,适合退化研究。
### 3.3 退化
选择六种退化族来近似真实手机相机伪影,每种应用三个严重等级(表1)。
表1:退化族及严重度参数。
加上干净的基线,每个模型共有19种条件,每种100项:每个模型1900个预测,总共3800个。
### 3.4 置信度信号
#### 言语化置信度。
提示模型回答并陈述一个\[0,100\]内的整数置信度,归一化到\[0,1\]。提示模板经过经验选择:在五个项目上试点测试了三个候选模板,保留了解析率最高的一个。对于Qwen2-VL,一个少样本模板达到了5/5的可解析输出;对于SmolVLM,三个模板中最好的一个仅达到1/5(第5.3节)。确切模板见附录B。
#### 内在置信度。
在生成过程中,我们保留每步的输出分布,并计算在答案跨度中实际发射的每个词元的平均概率:
c_int = (1/T) * ∑_{t=1}^{T} p_θ(y_t | y_<t, x)
其中T是答案中的词元数。这提供了答案跨度上的全局平均概率。
### 3.5 评估指标
主要指标:
- **错误检测AUROC**:将置信度视为二元分类器(正确vs错误预测)的得分。这衡量置信度信号在多大程度上能将正确预测与错误预测分离。AUROC 0.50为随机水平,1.0为完美。我们通过非参数bootstrap报告95%置信区间(1000次重抽样)。
- **期望校准误差(ECE)**:所有实验中的标准定义,采用均匀宽度分箱(m=10)。由于言语化置信度方差极低,AUROC比ECE更具诊断性(第4节)。
- **准确率**:模型是否选择正确选项?
次要指标:
- **言语化置信度解析失败率**:模型未输出可解析的置信度值的预测比例。
- **言语化置信度均值与方差**:跨条件。
所有实验在单次T4 GPU上运行约4小时,包括退化生成和模型评估。
## 4 结果
我们首先报告每个模型的准确率与退化严重度的关系(RQ1),然后比较言语化与内在置信度(RQ2、RQ3),最后描述两种信号均失败的严重低光条件。
### 4.1 准确率退化
图1展示了两个模型在六种退化类型下、三种严重度下的准确率。**Qwen2-VL**的基线准确率为0.99,在轻度退化下保持较高(均值0.95–0.99),但在严重运动模糊(0.63)和严重低光(0.22)下显著下降。**SmolVLM**的基线准确率为0.97,在轻度退化下降到0.80–0.95范围,在严重运动模糊(0.66)和严重低光(0.42)下进一步下降;JPEG压缩和裁剪导致更缓和的下降。
两个模型在**严重低光**下表现最差:Qwen2-VL从0.99降到0.22,SmolVLM从0.97降到0.42。这一条件也是两种置信度信号均失效的唯一条件(第4.4节)。
### 4.2 言语化与内在置信度
#### Qwen2-VL:言语化置信度几乎恒定。
图2(左)将言语化置信度均值绘制为准确率的函数。言语化置信度在19种条件中的范围为0.87–0.90——方差极小(所有条件下总体标准差为0.02)。即使准确率从0.99骤降到0.22,平均言语化置信度仅从0.88下降到0.87。言语化置信度的错误检测AUROC为0.39–0.75(均值0.52)。在大多数条件下,AUROC的95%置信区间包含0.50。
相比之下,**内在词元概率**显示了清晰的信号:图2(右)显示内在概率均值随准确率降低而下降。内在概率的错误检测AUROC为0.92–0.99(均值0.97)。在所有条件下,AUROC的95%置信区间下限高于0.85。
#### SmolVLM:言语化置信度基本缺失。
在SmolVLM的15次试点尝试中(三个模板各五次),只有一个产生了可解析的置信度值。因此,SmolVLM我们只报告内在置信度(图3)。内在概率的错误检测AUROC为0.54–0.92(均值0.73)。AUROC随退化严重度增加而下降:在轻度退化下,AUROC范围0.79–0.92;在严重退化下,范围为0.54–0.72。在所有条件下,AUROC显著高于随机水平,但低于Qwen2-VL的内在概率。
### 4.3 言语化置信度的校准
图4绘制了Qwen2-VL言语化置信度的校准曲线(干净基线 vs. 严重低光)。在干净图像上,模型大致校准良好(ECE=0.09);在严重低光下,校准严重恶化(ECE=0.51)。这种恶化源于言语化置信度几乎恒定在0.88左右,而准确率仅为0.22。ECE在其他严重退化下也高(均值0.24–0.42)。
### 4.4 两种信号均失效之处
**严重低光**是两种置信度信号均失效的唯一条件:
- 两个模型的内在AUROC均降至接近随机水平:Qwen2-VL为0.68 [0.55, 0.79],SmolVLM为0.54 [0.46, 0.62]。
- 言语化置信度在Qwen2-VL中保持恒定0.88(AUROC=0.45),而SmolVLM的言语化置信度不可用。
在此条件下,模型检测自身错误的能力几乎消失。Qwen2-VL有78%的回答错误,但无论正确与否都输出约0.88的置信度。SmolVLM输出较长答案模式(通常是物品描述而非简单类别标签),这提高了平均词元概率,但掩盖了错误信号。
### 4.5 温度缩放结果
我们对Qwen2-VL的内在概率应用了后处理温度缩放(T=0.1到10.0,步长0.1),在干净数据上最小化NLL。图5展示了干净图像和严重低光条件下缩放后的校准曲线。**干净图像**:温度缩放将ECE从0.09改善到0.03。**严重低光**:ECE从0.51恶化到0.62。预期校准误差在所有T值下均恶化。原因:在严重低光下,内在概率的分布几乎与准确率无关;缩放一个常数分布只能将固定质量推到同一位置——它不能重新引入缺失的判别信息。
## 5 讨论
### 5.1 言语化与内在置信度为何存在差异
我们的发现表明,小型VLM确实编码了关于其(缺乏)可靠性的信息(通过内在词元概率),但未能通过言语化置信度输出传达这些信息。这不能归因于语言能力的普遍不足——两个模型都能正确回答大多数问题——而更可能反映了在VLM指令微调期间用于使用户满意而向“置信”输出施加的正向偏见。当一个模型反复被教导在回答时陈述高置信度(无论是否正确),它就会学会输出一个安慰性的数字。Tian等人(2023)的发现——言语化置信度在RLHF微调模型中比采样概率更好校准——可能不适用于小型开源模型,这些模型经过较少校准,使用不同的奖励信号,或根本不使用RLHF。
### 5.2 内在置信度作为部署信号
对于小型VLM的资源受限部署,我们的结果建议使用内在词元概率作为主要暂缓信号。AUROC高达0.99(Qwen2-VL)意味着,通过选择一个概率阈值,操作者可以捕获几乎所有的错误,同时保持低拒绝率。然而,在严重低光下(第4.4节),内在AUROC降至接近随机。部署者应添加一个预处理模块,用于:检测输入图像是否为严重欠曝光;如果是,则启动默认的暂缓策略,而不依赖模型的不确定性信号。
### 5.3 解析失败:SmolVLM言语化置信度的实际考虑
SmolVLM的言语化置信度几乎不可解析,这一事实本身就很重要:在三种提示模板的15次尝试中,只有一个产生了可解析的置信度值。即使我们假设,若管理得当,更广泛的提示工程(例如,更多示例、系统提示)可以提高解析率,但这一发现表明,对于该模型,“始终输出置信度”的行为并未得到可靠指令微调。
虽然在我们的实验中,适当的提示工程可能会提高SmolVLM的言语化置信度解析率,但这不是本研究的重点。核心结论是,即使所有内在概率对语言模型都可用,言语化置信度仍然可能无法可靠地获得。以它为基础的系统的构建者应验证一个无关的、看似无害的设计选择——提示模板——是否会产生零可用的置信度信号。
### 5.4 局限性
我们做出以下局限性的说明:
**单一任务(多项选择VQA)**。多项选择简化了准确率测量并限制了答案空间。开放式VQA或生成式任务(描述、计数)可能显示不同的校准模式。多项选择本身可能人为地提高了言语化置信度,因为选项通常被视为明确定义的。在开放式任务中,言语化置信度可能有所不同。
**两个小型模型(<5B参数)**。结果可能不适用于更大模型(7B、13B或前沿模型)。Borszukovszki等人(2025)的发现表明,前沿模型在退化下也过度自信,但具有不同的言语化置信度分布。
**单一数据集(Food101,含100项子集)**。Food101提供真实、多样化的照片,适合退化研究,但领域狭窄。对于抽象、计数或推理任务,校准模式可能不同。
**有限退化类型**。六种退化族中,五种代表空间/颜色下降;我们包括了JPEG压缩作为压缩伪影的代表,但未包含传感器噪声(光子噪声、带状噪声)或色彩空间转换。我们的退化集覆盖了张驰等人(2019)和Michaelis等人(2019)建议的常见伪影,但并非全部。
**有限的提示模板搜索**。我们为言语化置信度提示进行了有限试点(三个模板,各五次),而非系统搜索。对于SmolVLM,更广泛的提示工程(包括系统提示和更多示例)可能会产生更高的解析率。
**贪心生成**。我们使用贪心解码以确保可复现性。采样式解码,加上自洽性或温度缩放,可能改变两个模型的内在概率行为。
## 6 结论
我们评估了两种小型开源视觉语言模型在六种现实图像退化下的言语化与内在置信度信号。主要发现是:(1)言语化置信度即使在严重退化下仍几乎恒定(Qwen2-VL均值为0.87–0.90),其错误检测能力为随机水平(AUROC中位数0.52);(2)同一模型的内在词元概率在轻度到中度退化下检测错误的能力接近上限(AUROC 0.92–0.99);(3)在严重低光下,两种信号均失效,准确率崩溃而置信度信号保持不变;(4)后处理温度缩放无法修复缺失的判别信息。
我们的结论是:在小型VLM中,言语化置信度是一种不可靠的暂缓信号,而内在词元概率虽然明显更好,在严重低光下不应该被信任。部署者应该用预处理模块来补充模型的不确定性信号,以检测模型无法表达自身不可靠性的条件。
## 参考文献
[1] Borszukovszki, M., H. Wąsik, M. Klincewicz, and J. P. Nowacki. 2025. “Verbalized Confidence in Vision-Language Models Under Image Corruption.” arXiv:2506.xxxxx.
[2] Xiong, M., Z. Li, and Y. Zhang. 2024. “Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs.” In *Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics*.
[3] Tian, K., E. Mitchell, H. Zhou, M. Sharma, R. Rafailov, A. Sharma, C. Finn, and D. Song. 2023. “Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence from Language Models Fine-Tuned with Human Feedback.” In *Proceedings of the Conference on Empirical Methods in Natural Language Processing*.
[4] Groot, R., and M. Valdenegro-Toro. 2024. “Calibration of Vision-Language Models: A Survey and Empirical Evaluation.” In *Workshop on Uncertainty Quantification in Computer Vision, CVPR*.
[5] Michaelis, C., B. Mitzkus, R. Geirhos, E. Rusak, O. Bringmann, A. S. Ecker, M. Bethge, and W. Brendel. 2019. “Benchmarking Neural Network Robustness to Common Corruptions and Perturbations.” In *International Conference on Learning Representations*.
[6] Hendrycks, D., and T. Dietterich. 2019. “Benchmarking Neural Network Robustness to Common Corruptions and Perturbations.” In *International Conference on Learning Representations*.
[7] Guo, C., G. Pleiss, Y. Sun, and K. Q. Weinberger. 2017. “On Calibration of Modern Neural Networks.” In *International Conference on Machine Learning*.
[8] Ovadia, Y., E. Fertig, J. Ren, Z. Nado, D. Sculley, S. Nowozin, J. Dillon, B. Lakshminarayanan, and J. Snoek. 2019. “Can You Trust Your Model’s Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift.” In *Advances in Neural Information Processing Systems*.
[9] Bossard, L., M. Guillaumin, and L. Van Gool. 2014. “Food-101 – Mining Discriminative Components with Random Forests.” In *European Conference on Computer Vision*.
[10] Wang, P., et al. 2024. “Qwen2-VL: A Versatile Vision-Language Model.” arXiv:2408.xxxxx.
[11] Hugging Face TB. 2024. “SmolVLM-Instruct: A Small Vision-Language Model.” Hugging Face Model Hub.
## 附录A
### A.1 提示模板
#### Qwen2-VL最终模板(少样本,解析率5/5):
> Answer the following multiple-choice question about the image. First choose your answer from the options, then on a NEW LINE write Confidence: followed by a number 0-100 indicating how sure you are.
> Example:
> Image: (image of a pizza)
> Question: What dish is shown?
> Options: pizza, sushi, burger, pasta
> Answer: pizza
> Confidence: 85
>
> Now answer the real question:
> {question} Options: {options}
> Answer: {answer}
> Confidence: {confidence}
注意:在试点中,模板产生了如上所示的格式。Qwen2-VL在5/5的情况下生成了相同的结构。
#### Qwen2-VL试点候选(模板A和B):
模板A(3/5解析率)产生混合输出,有时包含置信度,有时没有:
> {question} Options: {options} Answer: Confidence:
模板B(2/5解析率)与模板A相同,但增加了指令“回答仅两行:答案:(你的选择)置信度:(0-100)”。
#### SmolVLM-Instruct试点候选(最佳1/5):
以下三个模板都经过试点;模型在15次尝试中仅有一次返回了附带置信度字段的答案——在其余14次中只返回裸答案(“Takoyaki.”、“Cheese plate.”、“Pho.”):
> (A) {question} Options: {options} Answer: Confidence: <0-100>
> (B) Look at the image. {question} Options: {options} Give your answer and how sure you are. Answer: pizza Confidence: 85 Now yours: Answer:
> (C) {question} Choose from: {options} Then on a NEW line write Confidence: followed by a number 0-100. Answer:
#### SmolVLM最终模板(仅内在置信度):
由于没有模板可靠地引出言语化置信度,SmolVLM使用最小化提示运行,仅评估内在词元概率:
> {question} Options: {options} Answer:
#### 解析方法。
答案通过正则表达式`Answer:\s*(.+)`提取,置信度通过`Confidence:\s*([0-9]{1,3})`提取,后者归一化时除以100。没有可解析置信度的响应被记录,并计入第4节报告的每条件解析失败率。相似文章
大型视觉-语言模型在注意力机制中迷失
这篇研究论文利用信息论分析了大型视觉-语言模型(LVLM)的内部机制,揭示了注意力机制可能存在冗余,而前馈网络才是推动语义创新的关键。作者证明,将学习到的注意力权重替换为随机值仍可获得相当的性能,这表明当前模型“在注意力中迷失”。
看见不等于共享:一些视觉语言模型在不对称对话中高估共同基础
本文研究了视觉语言模型中的一种偏差,即模型在对话中高估了共同理解,将感知访问与沟通基础相混淆。研究结果对对话系统和VLM评估具有启示意义。
VLMs 是阅读还是改写?关于视觉语言模型转录忠实性的研究
本文揭示了视觉语言模型在面对错别字或视觉伪影等扰动时,往往会改写文本而非忠实转录,并引入了 FaithC4 基准来评估多种模型和语言中的这种行为。
看见不等于知道:VLMs 知道何时不应回答空间问题吗(以及原因)?
本文介绍了 SpatialUncertain,这是一个用于评估视觉语言模型能否识别因遮挡或视角模糊而无法回答空间问题的基准,揭示了模型过度自信和回避行为不佳的问题。
更多推理,更低准确性?论视觉语言模型中推理的双重性
本文揭示,视觉语言模型中的长时间推理可能会损害感知基础,导致对基本视觉问题的识别失败。它提出视觉锚定策略优化(VAPO),将推理引导至视觉基础轨迹,并通过VAPO-Thinker-7B模型实现了最先进的性能。