Tag
Introduces JigShape, a jigsaw puzzle benchmark with interlocking pieces to evaluate visual-geometric reasoning in vision-language models. It finds that frontier VLMs largely fail at geometric reasoning and all models collapse on larger puzzle sizes, revealing a 'scaling cliff' for constraint satisfaction.
This paper introduces a jigsaw puzzle designed with comic-based infographics to promote AI literacy, explaining the workings, capabilities, limitations, and societal implications of generative AI like ChatGPT in an engaging, hands-on format.