标签
本文提出一个框架,通过几何视觉解析和符号求解来增强大型语言模型,使其在复杂几何问题上达到先进多模态模型的水平,并使用来自2025年中国中考的新基准进行评估。
本文审计了冻结的LLMs,以检查几何约束信息是如何编码的,以及它是否可用于生成、影响和引导,揭示了可解码性与可操作输出之间的差距。
介绍了 JigShape,一个带有互锁拼图块的拼图基准,用于评估视觉语言模型中的视觉-几何推理。研究发现,前沿视觉语言模型在几何推理方面大多失败,且所有模型在更大拼图尺寸下都会崩溃,揭示了约束满足方面的“扩展悬崖”。
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
本文提出P3D-Bench,一个用于评估多模态大语言模型在参数化3D生成任务上的基准测试,涵盖文本到3D、图像到3D和组装到3D,并采用几何精度、语义对齐和部件级结构等指标。
几何潜在推理(GLR)为LLM中的潜在推理引入了一种几何路径近似方法,能够在数学推理基准上保持准确性的同时实现更短的生成。