vision-encoder

Tag

Cards List
#vision-encoder

MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding

Hugging Face Daily Papers · 2026-08-18 Cached

This paper presents MoE-ViE, a mixture-of-experts vision encoder that efficiently scales for image and video understanding, outperforming larger dense models with lower inference latency.

0 favorites 0 likes
#vision-encoder

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

Hugging Face Daily Papers · 2026-07-25 Cached

UltraViT is a latency-optimized vision encoder for large vision-language models, designed for on-device deployment with a pyramidal architecture and a two-stage generative pre-training strategy, achieving state-of-the-art performance at 1.7x speed.

0 favorites 0 likes
#vision-encoder

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

Hugging Face Daily Papers · 2026-06-25 Cached

ViQ presents a visual quantization framework that balances semantic richness and detail preservation in discrete representations, enabling efficient multimodal training with native-resolution inputs by using text-aligned pre-training and proximal representation learning.

0 favorites 0 likes
#vision-encoder

EarlyTom: Early Token Compression Completes Fast Video Understanding

Hugging Face Daily Papers · 2026-05-28 Cached

EarlyTom is a training-free framework that compresses visual tokens early in the vision encoder to reduce time-to-first-token and computational costs while maintaining accuracy, achieving up to 2.65x TTFT reduction.

0 favorites 0 likes
#vision-encoder

LiteFrame Scales Video LLM Efficiency (6 minute read)

TLDR AI · 2026-05-21 Cached

LiteFrame introduces a highly efficient video encoder for Video LLMs that uses Compressed Token Distillation to enable up to 8x more frames and 35% latency reduction while maintaining accuracy, setting a new Pareto frontier for long-form video understanding.

0 favorites 0 likes
#vision-encoder

LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs

Hugging Face Daily Papers · 2026-05-17 Cached

LiteFrame proposes a lightweight video encoder with Compressed Token Distillation training that reduces latency and enables processing 8x more frames for long-form video understanding in Video LLMs, improving accuracy while reducing compute.

0 favorites 0 likes
#vision-encoder

Delta-Adapter: Scalable Exemplar-Based Image Editing with Single-Pair Supervision

Hugging Face Daily Papers · 2026-05-08 Cached

Delta-Adapter enables exemplar-based image editing using single-pair supervision by extracting semantic deltas from pre-trained vision encoders and injecting them via Perceiver-based adapters, improving accuracy and generalization.

0 favorites 0 likes
← Back to home

Submit Feedback