了解不该回答什么:视觉语言模型中的选择性不遵从
摘要
本文介绍了KoNA,一个评估视觉语言模型在混合查询中选择性不遵从的基准,并表明有针对性的微调可以在此类场景中提升模型性能。
查看缓存全文
缓存时间: 2026/09/07 16:16
论文页面 - 智知所不答:视觉语言模型的选择性拒绝行为
来源:https://huggingface.co/papers/2609.04720 发布于9月4日
·
由 https://huggingface.co/mz-kim 提交
mz-kim (https://huggingface.co/mz-kim) 于9月7日发布
摘要
KoNA 评估视觉语言模型在混合查询场景下的选择性拒绝能力,并通过针对性微调提升模型合规性。
视觉语言模型(VLMs)被期望对恰当请求提供帮助,同时拒绝执行错误、危险、不可行或无法回答的请求。然而现有基准测试主要从查询整体层面评估拒绝行为,假设每个请求要么需要合规执行,要么应当拒绝。实际上,现实查询常混合包含可回答内容与应拒绝执行的组成部分。本文提出 KoNA 基准测试,用于评估 VLMs 在五类场景中的选择性拒绝行为:错误前提、视觉不可及性、普遍未知性、任务可行性和安全性。每项任务评估两种能力:在配对的简单与复合查询下,查询级拒绝与组成级拒绝的能力。我们对多种 VLMs 的评估显示,模型常未能恰当执行拒绝、纠正或弃权操作,当查询需要选择性拒绝时,这些失误更为显著。为解决此问题,我们使用 KoNA 中需要选择性拒绝的示例,结合可完全回答的对照组数据集,对 VLMs 进行微调。微调后的模型在拒绝准确率上获得显著提升,同时基本保持了在完全可回答任务上的性能。这表明微调模型能够区分可回答部分与需拒绝执行的部分,并能做出任务适配的响应。
查看 arXiv 页面 (https://arxiv.org/abs/2609.04720) 查看 PDF (https://arxiv.org/pdf/2609.04720) GitHub (https://github.com/mz-kim/KoNA) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04720)
通过工具获取本文:
hf papers read 2609\.04720
未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无模型关联本文
在模型 README.md 中引用 arxiv.org/abs/2609.04720 即可从本页面链接。
引用本文的数据集1
mz-kim/KoNA Viewer• 更新于约14小时前 • 3.1k • 20 (https://huggingface.co/datasets/mz-kim/KoNA)
引用本文的Space0
暂无Space关联本文
在 Space README.md 中引用 arxiv.org/abs/2609.04720 即可从本页面链接。
包含本文的合集0
暂无包含本文的合集
将本文添加至合集即可从本页面链接。
相似文章
看见不等于知道:VLMs 知道何时不应回答空间问题吗(以及原因)?
本文介绍了 SpatialUncertain,这是一个用于评估视觉语言模型能否识别因遮挡或视角模糊而无法回答空间问题的基准,揭示了模型过度自信和回避行为不佳的问题。
波兰医学视觉问答:视觉语言模型未充分利用视觉证据
本文介绍了一个基于波兰委员会认证考试题目构建的波兰语医学视觉问答基准,评估了视觉语言模型,并表明模型相对于问题文本而言,未充分利用视觉证据。
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
KODA:面向视觉-语言基础模型的对比表示比较与对齐
本文介绍了KODA(Kernel Optimization for Discrepancy Analysis,差异分析核优化),一种基于核的框架,用于比较和对齐视觉-语言模型表示,通过识别在CLIP、SigLIP和BLIP等模型中聚类方式不同的样本子集。该方法使用对比嵌入聚类和随机低维近似,能够扩展到大型数据集,同时提供表示之间可解释的结构差异。
检索,而非重新训练:在测试时将视觉语言动作模型扩展到新任务
本文介绍了一种检索增强的视觉-语言-动作策略,通过使用预训练模型和索引演示,消除了每个任务的微调,实现了高效的跨本体泛化和测试时的任务适应。