VeriGeo:具有数值与分析验证的可控几何问题生成

arXiv cs.AI 论文

摘要

VeriGeo提出了一种可控几何问题生成框架,利用验证引导的反思确保数值与分析一致性。该方法生成高质量合成数据,在GeoQA上取得最先进结果,并在PGPS9K和MathVista-GPS上表现强劲。

arXiv:2606.14176v1 公告类型: 新 摘要: 几何问题生成对AI辅助教育和多模态数学推理很有用,但可靠的合成仍然困难,因为问题陈述、图表、约束和解必须相互一致。现有方法通常在可控性和可靠性之间权衡:基于种子的重写灵活但可验证性弱,而先构建图表的方法提高了有效性但不太适合任意用户指定的约束。我们提出VeriGeo,一个基于可执行推理轨迹的可控几何生成框架。给定用户约束(如目标概念和难度),作者智能体生成问题和图表,求解器智能体生成与证明一致的解。两个智能体使用共享的动作序列,将自然语言、图表、几何约束和证明步骤连接成可验证的表示。三阶段流水线检查数值一致性、分析可实现性和全局一致性,利用验证引导的反思修复可恢复的失败并拒绝不可恢复的。在五个LLM骨干网络上,原始生成经常无法通过这些检查,而VeriGeo修复了相当一部分无效尝试。在VeriGeo生成的8.7k示例上进行监督微调,在端到端多模态LLM求解器中取得了GeoQA上报告的最佳性能,并在PGPS9K和MathVista-GPS上获得了强劲的结果,证明了经过验证的合成数据在改善多模态几何推理方面的有效性。
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:11

# VeriGeo:基于数值与解析验证的可控几何问题生成  
来源:https://arxiv.org/html/2606.14176  

Xiaoxian Duan¹,², Zequn Liu², Yingce Xia²,∗  
¹ 中国科学院自动化研究所,北京,中国  
² 中关村学院,北京,中国  
duanxiaoxian2026@ia\.ac\.cn, liuzequn@bza\.edu\.cn, xiayingce@bza\.edu\.cn  

###### 摘要  

几何问题生成对AI辅助教育和多模态数学推理十分有用,但可靠的合成仍然困难,因为问题陈述、图形、约束条件和解答应相互一致。现有方法往往在可控性与可靠性之间做出权衡:基于种子的改写灵活但验证性弱,而图形优先的构造方法提高了有效性,但不太适合用户任意指定的约束。我们提出VeriGeo,一个基于可执行推理轨迹的可控几何生成框架。给定用户约束(如目标概念和难度),Author Agent生成问题和图形,Solver Agent生成与证明对齐的解答。两个Agent共享一个动作序列,将自然语言、图形、几何约束和证明步骤连接成可验证表示。三阶段流水线检查数值一致性、解析可实现性和全局一致性,利用验证引导的反思修复可恢复失败并拒绝不可恢复的失败。在五种LLM骨干模型上,原始生成经常失败这些检查,而VeriGeo修复了相当比例的无效尝试。在VeriGeo生成的8.7k样本上进行监督微调,在端到端多模态LLM基求解器中取得了GeoQA上的最佳报告性能,并在PGPS9K和MathVista-GPS上获得强结果,展示了经过验证的合成数据在提升多模态几何推理方面的有效性。  

## 1 引言  

几何学是推理能力的重要基准,在教育和训练大型语言模型方面都提出了独特挑战(Kazemi et al., 2023 (https://arxiv.org/html/2606.14176#bib.bib47);Chen et al., 2021 (https://arxiv.org/html/2606.14176#bib.bib2);Trinh et al., 2024 (https://arxiv.org/html/2606.14176#bib.bib45);Zhang et al., 2024 (https://arxiv.org/html/2606.14176#bib.bib66))。与文本任务不同,几何问题求解本质上是多模态的:它要求求解器将文本条件与对应图形中的视觉约束进行交叉引用(Kazemi et al., 2023 (https://arxiv.org/html/2606.14176#bib.bib47);Chen et al., 2021 (https://arxiv.org/html/2606.14176#bib.bib2);Seo et al., 2015 (https://arxiv.org/html/2606.14176#bib.bib42);Lu et al., 2021 (https://arxiv.org/html/2606.14176#bib.bib43))。因此,高质量的几何数据难以合成,因为问题陈述、图形、符号约束和解答需要相互一致(Chen et al., 2021 (https://arxiv.org/html/2606.14176#bib.bib2);Seo et al., 2015 (https://arxiv.org/html/2606.14176#bib.bib42);Lu et al., 2021 (https://arxiv.org/html/2606.14176#bib.bib43);Fu et al., 2025 (https://arxiv.org/html/2606.14176#bib.bib52))。大规模监督要么手工整理成本高昂,要么合成时会因妥协而降低可靠性(Fu et al., 2025 (https://arxiv.org/html/2606.14176#bib.bib52);Chen et al., 2021 (https://arxiv.org/html/2606.14176#bib.bib2);Lu et al., 2021 (https://arxiv.org/html/2606.14176#bib.bib43);Trinh et al., 2024 (https://arxiv.org/html/2606.14176#bib.bib45))。理想的几何问题生成器应具备可控性、可验证性和多样性(Fu et al., 2025 (https://arxiv.org/html/2606.14176#bib.bib52);Zhang et al., 2025a (https://arxiv.org/html/2606.14176#bib.bib7)),但现有方法通常只强调其中一部分目标。  

**图形优先方法**首先构造几何配置,通常使用符号语言、形式化图形或基于定理的构造规则,然后基于生成的结构提出问题(de Moura et al., 2015 (https://arxiv.org/html/2606.14176#bib.bib61);Fu et al., 2025 (https://arxiv.org/html/2606.14176#bib.bib52);Deng et al., 2025 (https://arxiv.org/html/2606.14176#bib.bib51))。这提高了有效性,但将生成锚定在预先构造的图形上,使得灵活满足用户任意指定的约束(如目标概念、难度级别或图形要求)变得困难(Singhal et al., 2014 (https://arxiv.org/html/2606.14176#bib.bib46);Fu et al., 2025 (https://arxiv.org/html/2606.14176#bib.bib52))。  

**基于种子的生成方法**则使用LLM改写或修改现有问题(Yu et al., 2024 (https://arxiv.org/html/2606.14176#bib.bib48);Zhou et al., 2023 (https://arxiv.org/html/2606.14176#bib.bib64);Cai et al., 2024 (https://arxiv.org/html/2606.14176#bib.bib49))。它们灵活且便于生成变体,但其基于改写的过程可能引入幻觉约束以及问题陈述、图形和解答之间的跨模态不一致,这些难以检测和修复(Zhou et al., 2024 (https://arxiv.org/html/2606.14176#bib.bib56);Cai et al., 2024 (https://arxiv.org/html/2606.14176#bib.bib49))。此外,它们的多样性受限于种子分布(Gao et al., 2025 (https://arxiv.org/html/2606.14176#bib.bib3);Yu et al., 2024 (https://arxiv.org/html/2606.14176#bib.bib48))。  

为了解决上述限制,我们提出VeriGeo,一个具有增强验证能力的可泛化基于Agent的几何问题生成框架。VeriGeo包含一个Author Agent,根据用户定义的约束生成问题(包括文本描述和对应图形),以及一个Solver Agent来解答问题。两个Agent通过共享的可执行动作序列操作,该序列将自然语言、图形、几何约束和证明步骤连接成可验证表示。基于这种可执行表示,VeriGeo执行三个互补的验证阶段。首先,数值验证执行动作序列并检查构造过程中的局部几何一致性,例如所声称的共线或垂直关系是否在容差范围内成立。其次,解析验证将几何约束编译为代数系统,以测试该配置在几何上是否可实现。第三,LLM辅助的逻辑验证审计问题文本、图形、动作序列和解答之间的全局一致性,包括矛盾假设、无支持的推理和遗漏情况。在五种LLM骨干模型上的实验表明,VeriGeo在支持对难度和几何概念的细粒度控制的同时,显著提高了生成有效性。没有验证的原始LLM生成很少可靠,各骨干模型的平均直接通过率仅为29.02%。Gemini-3.1-Pro、Qwen3.5-Plus和Claude-Opus-4.6通过验证引导的修复分别恢复了36.00%、30.67%和20.22%的生成,表明修复是经过验证数据的主要来源,而非次要的后处理步骤。除了提高有效性,VeriGeo还拓宽了生成几何数据的概念覆盖范围,在100个样本中覆盖了354个不同的几何概念,超越了手工整理的数据集以及先前的图形优先或基于种子的生成流水线。  

除了内在有效性,我们还通过监督微调Qwen2.5-VL-7B-Instruct进一步评估了生成数据的实用性。仅使用8.7k个经过验证的VeriGeo样本进行训练,就在标准多模态几何基准上取得了强性能。具体来说,得到的模型在PGPS9K、GeoQA和MathVista-GPS上分别达到59.40%、82.74%和75.96%的准确率。据我们所知,VeriGeo在基于MLLM的几何求解器中实现了GeoQA上的最佳报告性能。在先前的通过监督微调训练MLLM的几何数据生成方法中,VeriGeo也在PGPS9K和MathVista-GPS上取得了最佳报告结果。  

我们的贡献可总结如下:  
(1) **可控几何生成**。我们引入VeriGeo,一个闭环框架,根据用户指定的约束(包括难度、目标概念和图形要求)合成多模态几何问题和与证明对齐的解答。  
(2) **验证引导的可靠性**。VeriGeo将生成建立在可执行动作序列之上,并通过数值、解析和逻辑检查验证每个实例,能够自动修复无效的文本-图形-解答不一致。  
(3) **具有经验效用的验证数据**。在五种LLM骨干模型上的实验表明生成有效性提升和细粒度可控性。在8.7k个验证样本上的微调进一步在标准多模态几何基准上取得了有竞争力的性能。  

参见图注释  
图1:VeriGeo的工作流程包含两个主要组件:用于问题生成的Author Agent和用于答案生成的Solver Agent。每个Agent采用三步验证过程,包括数值、解析和逻辑检查。当验证失败时,会触发反思机制(图中标记为“R”)。本文使用的所有提示词在补充材料中提供。  

## 2 方法  

### 2.1 概述  

我们将几何问题生成形式化为合成问题`Q`和解答`S`,受用户定义的约束`C`约束。问题`Q = (T, D)`由自然语言问题陈述`T`和对应的图形`D`组成。约束`C`指定可控属性,例如难度级别和所需的几何概念。收到`C`后,框架首先通过从预定义的几何概念和难度规则库中采样来合成蓝图`B`。Author Agent以`B`为条件,生成文本陈述`T`并通过一系列动作(记为`A`)构造图形`D`。为了提高生成问题的正确性,我们应用三步验证过程:数值验证、解析验证和逻辑验证。这些阶段中的任何失败都会触发反思机制,促使Author Agent修复内容。随后,Solver Agent基于`Q`生成解答`S`,其过程与Author Agent类似。  

### 2.2 蓝图生成  

蓝图`B`基于用户约束通过LLM生成,包含几何概念、难度级别、图形复杂度等。我们维护一个手工整理的几何概念库,涵盖欧几里得几何(245个几何概念)、向量几何(71个几何概念)和函数增强几何(110个几何概念)。我们考虑三个难度级别:easy、medium和hard。对于每个难度级别,我们提供三个代表示例(附录G (https://arxiv.org/html/2606.14176#A7)),用户可将它们替换为特定领域或课程的示例,以便将VeriGeo适应新的教育场景。  

### 2.3 用于问题生成的Author Agent  

在蓝图`B`的指导下,Author Agent首先合成自然语言问题陈述`T`。随后,它生成一系列可执行动作来构造对应的图形`D`。这些动作序列经过三步验证过程;如果检测到任何错误,Agent会触发自我反思机制来细化输出。  

⊳ 步骤1:动作生成与数值验证。(完整动作列表见附录D (https://arxiv.org/html/2606.14176#A4))。如图1所示,Author Agent将文本`T`转换为可执行动作序列`A = {a_t}_t`。每个动作定义为一个元组`a_t := (op, type, args)`,其中:(1) `op`表示主要操作类别,包含11种类型。例如,`AddPoint`/`AddCircle`在图形中插入一个点/圆;`MovePoint`在反思阶段将一个点移动到特定位置。(2) `type`指定操作的具体方法。例如,`AddPoint`操作可能使用类型`Free`(用于自由点)或`Cartesian`(用于具有显式坐标的点)。(3) `args`包含执行具体操作所需的参数。例如,笛卡尔点可能需要参数如`["P", "0", "0"]`。  

生成完整序列后,系统执行脚本以渲染图形。此执行过程本质上执行数值验证。处理每个操作时,系统检查几何约束是否相对于当前坐标状态在数值上成立。例如,如图1所示,如果脚本断言约束如Collinear(O, P, T),但根据前面步骤得到的T的坐标不在直线OP上(在容差内),则执行会触发数值违反错误。为了进一步提高数值鲁棒性,我们将生成的量表示为人类可读的精确形式,例如有理数(如"-2/3")、根式(如"\\sqrt(2)"),详见附录D.2 (https://arxiv.org/html/2606.14176#A4.SS2)。  

⊳ 步骤2:解析验证。(完整验证列表见附录E.1 (https://arxiv.org/html/2606.14176#A5.SS1))。数值验证高效但不足,因为浮点不精确可能使错误配置在容差内通过。为了提高正确性,我们应用解析验证以确保构造在数学上可实现。  
(1) **解析表示**。我们首先定义一组标量变量`V`,表示图形的自由度。每个非固定点`P`被分配变量坐标`(x_P, y_P)`,而几何基元被分配其必要的内在参数(例如,圆由其中心坐标和半径r定义)。  
(2) **约束映射**。系统通过遍历步骤1中动作引起的图形约束来构建。操作`op`可能施加特定的几何约束,这些约束被编译为一组代数方程`E`。例如,操作Collinear(A, B, C)意味着其坐标矩阵的行列式必须为零,产生方程:`(x_B - x_A)(y_C - y_A) - (y_B - y_A)(x_C - x_A) = 0`。  
(3) **全局求解与冲突解决**。我们使用`sympy` (Meurer et al., 2017 (https://arxiv.org/html/2606.14176#bib.bib65)) Python包推导`E`的解析解。需要注意的是,得到的系统`E`常常是病态的:要么由于冗余构造步骤而过定,要么由于刚体运动不变性而欠定。为了解决这个问题,我们实施了一系列工程技术来增强方程的稳定性,例如规范固定和秩感知过滤(见附录E.1 (https://arxiv.org/html/2606.14176#A5.SS1)–E.3 (https://arxiv.org/html/2606.14176#A5.SS3))。成功收敛会生成有效的坐标实现`V*`,证明该图形在几何上是可实现的。如果求解器未能在指定容差内收敛,则该实例被标记为失败。  

(后续内容因输入截断未提供,但翻译应继续直到输入结束。由于用户只提供了到此处的内容,我们在此停止。若需要继续翻译剩余部分,请提供完整文本。)

相似文章

迈向一致视频几何估计

Hugging Face Daily Papers

ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。