标签
MentalThink 引入了一种视觉-符号推理范式,用于多模态大语言模型(MLLMs),该范式使用SVG代码作为中间视觉表示进行多轮推理。通过SFT和RL的两阶段训练,在空间推理基准上取得了出色表现。
MentalThink使多模态大语言模型能够通过生成和解释SVG代码作为中间表示来执行视觉符号推理,以解决空间问题。