从符号感知到逻辑推理:一个引导语言模型进行几何推理的框架
摘要
本文提出一个框架,通过几何视觉解析和符号求解来增强大型语言模型,使其在复杂几何问题上达到先进多模态模型的水平,并使用来自2025年中国中考的新基准进行评估。
arXiv:2609.10335v1 公告类型:新
摘要:平面几何在人工智能中仍然是一个重大挑战,需要整合视觉感知和数学推理。虽然大型多模态模型能够自然地处理视觉语言输入,但它们往往计算密集且不透明。我们证明,一个纯大型语言模型在配备专门模块后,可以在复杂几何问题上与最先进的多模态模型相媲美。我们的框架集成了几何视觉解析器,将图示转化为符号形式,以及符号求解器,执行形式演绎,从而减少幻觉并促进可解释推理。为了进行严格评估,我们从2025年中国中考考试中精选了具有挑战性的问题,确保数据新颖性并测试更深层的演绎技能。实验表明,我们的方法达到了与Gemini 2.5 Pro相当的性能,同时提供了更清晰、更像人类的解决方案。
查看缓存全文
缓存时间: 2026/09/11 08:45
# 从符号感知到逻辑推导:引导语言模型进行几何推理的框架
来源:https://arxiv.org/html/2609.10335
## 从符号感知到逻辑推导:引导语言模型进行几何推理的框架致谢:通讯作者。
Rafael Medeiros Cabral Ziyi Shou Yan Cao 所属机构:Xin Shen, Dongcai Lu, Yi Zhou 11footnotemark:1
###### 摘要
平面几何在人工智能领域仍然是一个重大挑战,它需要视觉感知与数学推理的整合。虽然大型多模态模型能够自然地处理视觉-语言输入,但它们通常计算密集且不透明。我们证明,一个纯粹的大型语言模型,在配备专用模块后,可以在复杂的几何问题上媲美最先进的大型多模态模型。我们的框架整合了一个几何视觉解析器和一个符号求解器,前者将图表转化为符号形式,后者执行形式化演绎,从而缓解幻觉并促进可解释的推理。为了实现严格评估,我们从2025年中国中考考试中精心策划了一个具有挑战性的问题基准,确保数据新颖性并测试更深层次的演绎技能。实验表明,我们的方法达到了与Gemini 2.5 Pro相当的性能,同时提供了更清晰、更像人类的解题过程。
中国科学技术大学
## 引言
追求人工智能在数学领域的应用(AI for Math)代表了机器智能的一个重要前沿,而平面几何是其中最典型的宏大挑战之一。成功解决几何问题需要视觉感知与数学推理的精密协同——解析复杂的图表和文本、执行逻辑演绎,甚至通过辅助线构造展现出创造性。这一过程映射了从感知、认知到决策的进程,标志着迈向通用人工智能的一条关键路径。因此,几何问题求解已成为前沿人工智能研究的焦点。
开创性的工作,如InterGPS和AlphaGeometry,展示了形式化系统在实现高精度方面的强大能力。然而,它们对形式化语言的依赖带来了显著的开销,包括从自然问题翻译时可能的信息损失,以及基于规则系统的固有脆弱性。此外,其非人类可读的符号输出给用户阅读带来了相当大的挑战。这些形式化系统也总是不完备的,例如,InterGPS和AlphaGeometry都无法处理几何中的不等式或优化问题。
以Gemini 2.5 Pro等系统为代表的大型多模态模型的出现,开辟了一条前景广阔的新途径。通过原生处理视觉-语言信息,大型多模态模型绕过了显式形式化的需求,并提供了自然、交互式的用户体验。然而,它们的最先进性能并非没有代价。这些模型计算成本高昂,其推理过程可能不透明。更关键的是,它们在几何等专业领域的表现,往往受限于其通用训练数据与几何图表特定符号逻辑之间的分布差异。
本文挑战了端到端大型多模态模型是复杂几何推理终极解决方案的普遍假设。我们证明,一个强大的大型语言模型,在增强了几何感知和演绎推理的专用能力后,不仅可以匹敌,甚至可以超越领先的大型多模态模型。虽然像DeepSeek-R1这样的大型语言模型拥有强大的抽象推理能力,但其固有的视觉处理缺失以前使其不适合此类任务。我们的工作直接解决了这一局限性,引入了一个旨在赋能大型语言模型进行高级几何问题求解的新颖框架。其核心是两个关键组件:
一个几何视觉解析器,它将非结构化的图表图像转化为符号化、结构化的表示。通过整合OCR和几何基元检测,它为大型语言模型提供了其天然缺乏的精确、高保真视觉信息。
一个符号求解器模块,它针对角度关系执行针对性的形式化演绎——这是大型语言模型产生幻觉的常见原因。这不仅提高了模型的准确性,关键还引导其走向更优雅、更具演绎性的解法,避免了困扰许多当前模型并降低可读性的脆弱、蛮力坐标计算。
参见标题 图1:流程示意图。图1展示了整体工作流程。系统首先将问题陈述和相关图表转化为几何实体和约束的形式化表示。接下来,推理引擎应用定理数据库中可用的定理,对问题(图像和文本)中已提取的几何关系列表进行扩展。这些中间结果被转化为自然语言并提供给大型语言模型,后者将其综合成一个兼具演绎严谨性和解释清晰度的完整解决方案。
为了严格评估我们的方法并与最先进水平进行对比,我们发现现有基准测试中存在一个关键缺口。像GeoQA和Geometry3K这样的数据集虽然具有基础性,但性能已趋于饱和,并可能因公开多年而存在数据污染问题。例如,在附录B中,表5提供了Gemini-2.5-Pro中一些疑似数据污染的案例。
更重要的是,它们的结构简单性无法挑战模型执行复杂的多步骤推理或进行辅助线构造的必要性。为此,我们引入了一个新的、具有挑战性的基准,它源自2025年中国中考(全国中学考试)的数学试题——这是一个难题的来源,要求深度推理和创造性洞察,同时保证了数据的新颖性。由于这些题目来自最近的公开考试,它们极不可能包含在现有大型模型的预训练数据中,从而能够在没有数据污染风险的情况下,公平地评估几何推理能力。
我们的贡献有三方面:
- 我们提出了一个新颖的框架,首次使大型语言模型(R1)能够在复杂的、未见过的平面几何问题上达到与最先进的大型多模态模型(Gemini 2.5 Pro)相当的性能。
- 我们引入了一个新的、高难度的基准,精选自2025年中国中考考试题目,为未来的几何推理研究提供更具挑战性和可靠性的测试平台。
- 新的几何视觉解析器和符号求解器模块,通过大幅减少模型对非直观的“蛮力”坐标几何的依赖,引导大型语言模型进行类人、可解释的推理,从而增强了解决方案的可读性和用户友好性。
## 相关工作
参见标题 图2:图表解析器流程。我们从该流程中从图表图像提取相关的基元和关系。使用人工智能解决平面几何问题一直是一个长期存在的挑战,需要同时具备对文本和图表的复杂多模态理解,以及严格的逻辑演绎能力。早期的工作依赖于符号系统,这些系统逐渐被数据驱动的神经网络以及融合两种范式优势的强大混合架构所取代。
### 基于符号的方法
自动化几何问题求解的早期方法主要由基于符号和规则的系统主导。这些方法优先考虑逻辑的严谨性和可解释性。它们通常采用精心设计的基于规则的解析器将自然语言文本转化为形式化的符号语言。图表基元也通过人工翻译或训练的图表解析器转化为形式化描述。PGDP-Net将几何元素识别建模为实体分割任务,并使用图神经网络来识别元素类别及其关系,输出形式化语言描述。然后使用在此形式化系统内操作的符号推理器来解决问题。像Inter-GPS和Formal-Geo这样的开创性工作是这种方法的典范。尽管在逻辑一致性方面很强大,但它们对人工规则的依赖可能限制其可扩展性。
### 基于神经网络的方法
随着深度学习的兴起,研究人员开始探索端到端的神经模型,直接从数据中学习解决几何问题。这些方法将问题编码为稠密的向量表示,利用神经网络根据学习到的特征预测解决方案。例如,NGS采用文本编码器学习问题的文本特征,并引入拼图游戏等辅助任务来学习几何图表的鲁棒视觉表示。在此基础上,像PGPSNet这样的模型利用带有双向GRU的双流编码器来融合文本和视觉特征。LANS进一步完善了该架构,引入了布局感知的预训练模块,并采用对比学习来增强视觉点与文本标记之间的对齐,从而在将融合表示输入序列到序列解码器之前,实现更精确的多模态理解。
### 混合方法
为了结合符号系统的逻辑严谨性和神经网络的快速决策优势,大量研究聚焦于混合方法,或称神经符号方法。该领域的一个主要范式是使用神经网络作为定理预测模块来加速推理——解决了传统符号方法常常依赖耗时、计算成本高昂的搜索过程这一问题。例如,GeoDRL将问题表示为几何逻辑图,并通过强化学习训练图神经网络作为策略网络,该网络在推理过程的每一步选择最有前景的定理应用于形式化推理系统。
### 大型模型的最新趋势
最近,大型语言模型被采纳为强大的后端推理器,像GeoX、DFE-GPS和Pi-GPS等方法利用它们进行最终的求解阶段。当前的关注点已转向通过专门策略来增强这些大型基础模型,以提高其几何推理能力。这些策略包括优化形式化问题表示、生成大规模标注数据集、使用先进的搜索算法改进推理时推理,以及利用强化学习来解决辅助线构造等公认困难的子问题。
## 方法
解决几何问题,尤其是那些严重依赖图表的问题,需要精确理解视觉几何关系。与代数或纯文本任务不同,几何问题求解通常依赖于识别隐式约束,如共线性、角度属性等,这些约束在图表中通过视觉编码,而不是在文本中明确陈述。然而,当前的多模态模型在准确解析和推理几何图表方面表现出显著局限性,这对自动化几何问题求解构成了重大挑战。我们提出了一个混合框架,用于自动化几何问题求解,它整合了形式化的问题解析、定理驱动的推理和大型语言模型推理。与传统的符号几何求解器不同,我们的方法同时利用基于规则的定理应用和大型语言模型的生成能力来产生人类可读的解决方案。如图1所示,该框架由三个核心模块组成:(1) 几何问题形式化,(2) 几何定理推理,和(3) 基于大型语言模型的答案生成。
### 几何问题形式化
解决几何问题需要对图表和文本信息进行精确的形式化表示。受Inter-GPS启发,我们首先设计了一个自底向上的图表解析流程,用于从图表中提取和构建几何信息。该流程的视觉表示如图2所示。
该流程从提取几何基元开始,它们是图表表示的基础元素。一个基元被定义为基本的几何元素,如点、线、圆或弧段。我们首先使用经过微调的YOLO姿势模型来识别几何线段。随后是一个“基元查找器”步骤,将重叠或紧密对齐的检测结果合并为一致的线实体。在此阶段,我们还使用霍夫变换来检测圆和角度结构,以发现更多的基元。然后,根据检测到的线和圆的交点来定位点和角度。
除了几何基元,解析器还识别图表符号(如角度标记和直角指示符)和文本注释(如点标签或长度值)。符号和文本区域首先使用微调过的YOLO检测模型进行定位。然后,使用专门的识别模型识别文本区域的内容。在这个阶段,我们获得了一个基元集P={p1,p2,...,pm}和一个符号集S={s1,s2,...,sn}。为了在这些组件之间创建有意义的连接,我们使用贪心分配策略为每个符号分配其对应的基元。该过程的形式化定义为:
g(si)=argmin_{pj∈P} d(si,pj), s.t. (si,pj)∈Feasibility Set F.
这里,d(si,pj)表示检测到的符号位置si与候选基元pj之间的欧几里得距离。一个关键约束是符号si和基元pj必须属于可行集F。相似文章
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
HyperGuide:大型语言模型中高效多步推理的双曲引导方法
本文提出HyperGuide方法,将推理进展提炼为双曲几何信号,以指导LLMs的逐步生成,从而无需显式树搜索即可提高多步推理效率。
从视频中学习几何表征以赋予多模态大语言模型空间智能
GeoVR 通过利用多个几何目标从3D基础模型中蒸馏几何知识,重构多模态大语言模型的语义潜空间,从而增强其3D感知能力。
大型语言模型及其对力学与空间几何的感知
本文介绍了MecEng,这是一个用于评估大型语言模型在机械工程中力学与空间几何任务的基准,揭示了其能力不断提升但仍易出错的现状。
大型语言模型的地理空间概念探测:抽象性、组合性与接地
本文引入了一个以概念为中心的基准,用于探测LLM对方向、距离和拓扑等地理空间概念的理解,测试不同模型架构和规模下的抽象性、组合性与接地性。研究结果揭示了当前LLM在概念理解上的明显局限。