Tag
BEAR-Bench introduces a bilingual English-and-Russian benchmark for evaluating multimodal models' reasoning on text-rich professional documents, assessing 16 models and highlighting performance gaps.