visual-document-retrieval

Tag

Cards List
#visual-document-retrieval

ColNanoVDR: Document-Free Query Distillation for Multi-Vector Visual Document Retrieval via Optimal Transport

Hugging Face Daily Papers ↗ · 3d ago Cached

ColNanoVDR introduces the first document-free query distillation framework for multi-vector visual document retrieval, using optimal transport to align student and teacher query embeddings, enabling faster encoding while retaining high performance.

0 favorites 0 likes
#visual-document-retrieval

Generative Late-Interaction Embeddings For Visual Document Retrieval

Hugging Face Daily Papers ↗ · 2026-09-10 Cached

Introduces Generative Late-Interaction Embeddings (GLIE) for compressing visual document retrieval vectors, improving accuracy under storage constraints by regenerating full embeddings on demand.

0 favorites 0 likes
#visual-document-retrieval

tencent/EVIE-Preview-4.5B · Hugging Face

Reddit r/LocalLLaMA ↗ · 2026-08-17 Cached

EVIE-Preview-4.5B is a state-of-the-art multilingual Visual Document Retrieval model from Tencent that uses ColBERT-style late interaction and achieves leading performance on ViDoRe benchmarks with 128-dimensional token embeddings.

0 favorites 0 likes
#visual-document-retrieval

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

Hugging Face Daily Papers ↗ · 2026-08-16 Cached

ConceptFormer learns continuous latent concept representations for visual document retrieval, bridging visual evidence and semantic relevance without text intermediates, achieving significant improvements over baselines.

0 favorites 0 likes
#visual-document-retrieval

DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation

Hugging Face Daily Papers ↗ · 2026-08-11 Cached

DistilVDR is a compact 524M visual document retriever distilled from an 8B teacher via cosine alignment, achieving near-teacher accuracy on ViDoRe with 15.6x smaller indexes and faster indexing.

0 favorites 0 likes
#visual-document-retrieval

@perdactor: 1/ Meet Argus-Retriever: the first late-interaction visual doc retriever where the document representation adapts to th…

X AI KOLs Following ↗ · 2026-06-06 Cached

Argus-Retriever is a new late-interaction visual document retriever that adapts document representation to the query, achieving SOTA performance on ViDoRe benchmarks with a smaller index.

0 favorites 0 likes
#visual-document-retrieval

Training and Finetuning Multimodal Embedding & Reranker Models with Sentence Transformers

Hugging Face Blog ↗ · 2026-04-16 Cached

This article provides a technical guide on training and fine-tuning multimodal embedding and reranker models using the Sentence Transformers library, demonstrating performance improvements on Visual Document Retrieval tasks with Qwen3-VL.

0 favorites 0 likes
← Back to home

Submit Feedback