visual-text

Tag

Cards List
#visual-text

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

Hugging Face Daily Papers · 2026-07-13 Cached

MonkeyOCRv2 is a visual-text foundation model for document AI, pretrained on a large corpus of 113 million images across 17 languages using joint image-to-text generation and pixel-level document reconstruction. It achieves state-of-the-art results on document parsing and understanding tasks, outperforming previous models with a smaller vision encoder.

0 favorites 0 likes
← Back to home

Submit Feedback