Tag
This paper demonstrates that unsupervised visual pretraining on documents, without text extraction, consistently outperforms text-only pretraining for language intelligence, providing an efficient and scalable approach for foundation models.