Tag
ReVA introduces a region-aware visual assistant that enhances visually grounded question answering by integrating whole-image and region-level representations, reducing hallucinations in multimodal large language models.