visual-encoder

Tag

Cards List
#visual-encoder

microsoft/Mage-VL · Hugging Face - An Efficient Codec-Native Streaming Multimodal Foundation Model

Reddit r/LocalLLaMA · 2026-07-28 Cached

Microsoft introduces Mage-VL, a codec-native streaming multimodal foundation model for image and video understanding that achieves up to 3.5x inference speedup by using a sparsity pattern inspired by video codecs, cutting visual tokens by over 75%.

0 favorites 0 likes
#visual-encoder

Stateful Visual Encoders for Vision-Language Models

Hugging Face Daily Papers · 2026-06-03 Cached

This paper introduces a stateful visual encoder for vision-language models that conditions visual representations on prior features, enabling better visual comparison in multi-image and agentic settings. The method shows consistent improvements across tasks such as cross-image spatial aggregation and longitudinal radiology.

0 favorites 0 likes
← Back to home

Submit Feedback