Tag
ReVA introduces a region-aware visual assistant that enhances visually grounded question answering by integrating whole-image and region-level representations, reducing hallucinations in multimodal large language models.
EXPL-FR is a method that explains face recognition models by aligning vision-language embeddings to the recognition space, enabling label-free auditing of semantic attributes and model comparison without requiring architecture access.