visual-token-compression

Tag

Cards List
#visual-token-compression

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

Hugging Face Daily Papers · 2026-07-14 Cached

VisCo is a training-efficient self-compression framework that reuses a pretrained vision-language model as an intrinsic encoder for visual token compression, achieving superior performance across all compression ratios without external modules.

0 favorites 0 likes
#visual-token-compression

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding

Hugging Face Daily Papers · 2026-05-28 Cached

PARCEL introduces a novel vision-language model architecture that uses pool-anchored resampling and conditioned elastic queries to improve efficiency and performance across different visual-token budgets, outperforming existing matryoshka baselines.

0 favorites 0 likes
#visual-token-compression

AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees

arXiv cs.AI · 2026-05-20 Cached

AQuaUI is a training-free inference-time token reduction method for GUI agent models that uses adaptive quadtrees to reduce spatial redundancy in screenshots, achieving up to 13.22% speedup and 29.52% fewer visual tokens while retaining 99.06% of performance.

0 favorites 0 likes
← Back to home

Submit Feedback