vision-language-retrieval

Tag

Cards List
#vision-language-retrieval

Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

Hugging Face Daily Papers · 2026-07-06 Cached

Introduces SaMer, an object-aware token merging framework that compresses image-side tokens for vision-language retrieval while preserving object-level evidence, achieving significant storage reduction and improved retrieval performance.

0 favorites 0 likes
← Back to home

Submit Feedback