标签
ReVA 引入了一个区域感知的视觉助手,通过整合全图和区域级表示,增强了视觉定位问答,并减少了多模态大语言模型中的幻觉问题。
EXPL-FR 是一种方法,通过将视觉语言嵌入与识别空间对齐来解释人脸识别模型,从而实现语义属性的无标签审计和模型比较,而无需访问模型架构。