Tag
This paper introduces an open-source benchmark for evaluating diagrammatic reasoning in geometry, revealing that foundation models like GPT and Claude struggle to produce faithful diagrams despite their problem-solving abilities.