Tag
MentalThink introduces a visual-symbolic reasoning paradigm for multimodal LLMs that uses SVG code as intermediate visual representations for multi-turn reasoning. The two-stage training with SFT and RL achieves strong performance on spatial reasoning benchmarks.
MentalThink enables multimodal large language models to perform visual-symbolic reasoning by generating and interpreting SVG code as an intermediate representation for spatial problem-solving.