探索用于生成高质量数学可视化辅助的智能体工作流
摘要
本文介绍了一种智能体工作流,利用LLMs和VLMs迭代生成并改进面向K-12教育的高质量数学图表,填补了AI生成可视化辅助工具在可靠性方面的空白。
arXiv:2607.09839v1 公告类型:新
摘要:数学图表在K-12教育中扮演着至关重要的角色,既作为问题的组成部分,也作为学生理解的支撑。然而,当前的人工智能工具,包括大型语言模型(LLMs),即使提供了详细描述,也难以可靠地生成准确且具有教学意义的可视化图表。因此,在初中数学图表的可靠生成方面仍存在显著差距。为解决这一问题,我们引入了一种智能体工作流,使LLM智能体能够评估生成的可视化内容的质量,并利用这一反馈迭代改进其输出。这一自我改进循环旨在提升AI生成图表的准确性和教育适用性。我们的研究探讨两个问题:首先,LLM能否根据可视化质量的具体标准准确生成针对可视化辅助工具的质量保证问题?其次,给定有效的质量保证问题,视觉语言模型能否有效评估生成的K-12可视化辅助工具,并利用反馈迭代改进它们?我们对智能体工作流进行了探索性评估,并确定了关键改进领域,包括在生成的质量保证问题中加强空间推理能力和更全面的图表特征覆盖。初步结果表明,这种方法能够提升AI生成数学图表的可靠性和教育价值。
查看缓存全文
缓存时间: 2026/07/14 04:18
# 探索用于生成高质量数学视觉辅助工具的智能体工作流 来源:https://arxiv.org/html/2607.09839 Rizwaan Malik 斯坦福大学教育研究生院 rizmalik@stanford\.edu Ashna Khetan 计算机科学系 ashnak@stanford\.edu Isabel Sieh 计算机科学系 isabelrs@stanford\.edu Samin Khan 斯坦福大学教育研究生院 samink@stanford\.edu ###### 摘要 数学图表在 K-12 教育中扮演着至关重要的角色,既作为问题的组成部分,也作为帮助学生理解的支架[1 (https://arxiv.org/html/2607.09839#bib.bib1)]。然而,当前的 AI 工具,包括大型语言模型(LLM),即使在提供详细描述的情况下,也难以可靠地生成准确且具有教学意义的视觉图表[3 (https://arxiv.org/html/2607.09839#bib.bib3),4 (https://arxiv.org/html/2607.09839#bib.bib4)]。虽然最先进的 LLM 在生成中学数学问题图表方面的成功率达到了 73.9%[5 (https://arxiv.org/html/2607.09839#bib.bib5)],但仍存在显著差距。为了解决这个问题,我们引入了一种智能体工作流,使 LLM 智能体能够评估生成视觉内容的质量,并利用这一反馈实时动态改进其输出。这种自我改进循环旨在提升 AI 生成图表的准确性和教育适用性。我们的研究探讨了以下问题:首先,给定视觉辅助工具质量的具体标准,LLM 能否准确生成质量保证(QA)问题?其次,给定有效的 QA 问题,视觉语言模型(VLM)能否有效地审查生成的 K-12 视觉辅助工具,并利用这些反馈迭代改进输出?我们对智能体工作流进行了探索性评估。我们识别出需要改进的关键领域,包括增强空间推理能力和确保 QA 问题全面覆盖图表特征。我们的结果提供了初步证据,表明这种方法可以提高 AI 生成数学图表的可靠性和教育价值。 ## 1 引言 数学图表是 K-12 教育的基础,既作为问题的基本组成部分,也作为帮助学生理解的支架工具[1 (https://arxiv.org/html/2607.09839#bib.bib1)]。图表有助于将抽象概念可视化,使其对于各种学习风格的学生来说更容易理解和掌握。例如,图表可以阐明几何关系,说明比例推理,并支持解决问题的策略。因此,有效创建和使用数学图表的能力对于学生和教育工作者来说都是一项关键技能。然而,手动创建这些图表可能非常耗时,并且需要一定水平的技术专长。 人工智能(AI)的出现为自动化生成数学图表提供了有希望的机会,可能节省教育工作者的时间,并为学生提供个性化的学习体验。AI 工具在支持教师备课方面显示出潜力;然而,它们在可靠地生成视觉图表方面仍然存在困难[6 (https://arxiv.org/html/2607.09839#bib.bib6),7 (https://arxiv.org/html/2607.09839#bib.bib7)]。对于需要精确几何关系或符号表示的图表尤其如此。此外,生成的图表不仅要准确,还必须具有教学意义,即它们应该有效地传达预期的数学概念,并适合目标学生群体。 虽然在使用大型语言模型(LLM)生成数学图表的代码或描述方面取得了进展,但这些生成视觉内容的准确性仍然是一个重大挑战。当提供具体、详细的图表描述时,最先进的 LLM 在中学领域的成功率达到 73.9%[5 (https://arxiv.org/html/2607.09839#bib.bib5)]。这表明即使有精确的指令,当前的 LLM 也难以持续生成符合准确性和教学效果标准的图表。缩小这一差距对于释放 AI 在数学教育中的全部潜力至关重要。 为了解决图表准确性的剩余差距,我们引入了一种智能体工作流,旨在让 LLM 智能体评估生成的视觉内容,并利用这一反馈动态实时改进输出。我们的方法利用了 LLM 和视觉语言模型(VLM)的优势,创建了一个用于生成数学图表的自我改进系统。该工作流程包括从文本描述生成图表,然后自动创建评估视觉内容准确性和清晰度的质量保证(QA)问题。然后,VLM 根据这些 QA 问题评估图表,提供用于迭代优化图表的反馈。我们的研究侧重于以下关键研究问题: 1. 1. 给定视觉辅助工具质量的标准,LLM 能否准确生成视觉辅助工具的质量保证(QA)问题? 2. 2. 给定有效的 QA 问题,VLM 能否有效地审查生成的 K-12 视觉辅助工具,并利用这些反馈迭代改进输出? 我们假设这种智能体工作流可以提高 AI 生成数学图表的质量和准确性。通过启用连续的反馈循环,我们旨在创建一个能够从错误中学习并为数学教育生成越来越有效的视觉辅助工具的系统。我们将我们的方法和实验结果作为迈向更可靠的 AI 辅助数学图表生成的第一步。 请参见说明Figure 1:来自 Illustrative Mathematics 的示例基准图表。这是相关的学生任务说明:这朵花由黄色六边形、红色梯形和绿色三角形组成。写几个句子来描述构成这个图案的形状的比例。两倍大小的这个花朵图案中每种形状各有多少个? ## 2 相关工作 ### 2.1 数学可视化生成 为数学创建准确且具有教学效果的视觉辅助工具仍然是一个具有挑战性的问题,需要专门的方法。VISTA(Visual Integrated System for Tailored Automation)引入了一个多智能体框架,使用 LLM 生成数学问题文本以及对齐的可视化内容[8 (https://arxiv.org/html/2607.09839#bib.bib8)]。其强调问题陈述与视觉组件之间的一致性与我们使图表生成在教育环境中更可靠的目标密切相关。 近期在科学图表生成方面的工作为自动化可视化系统提供了有价值的技术基础。AutomaTikZ 使用 TikZ 作为文本引导合成科学矢量图形的中间表示[6 (https://arxiv.org/html/2607.09839#bib.bib6)]。虽然其专注于技术性科学插图与我们的教育重点不同,但其结合自动评估和人工评估的方法为评估视觉保真度提供了一个有用的模型。 MathVerse 提供了补充证据,表明多模态 LLM 在没有完全使用图表的情况下,也可能在视觉数学任务上取得成功,这促使我们更仔细地评估图表理解能力,而不是仅仅依赖最终答案的正确性[9 (https://arxiv.org/html/2607.09839#bib.bib9)]。 ### 2.2 数学视觉内容评估方法 对生成的数学视觉内容进行评估提出了独特的挑战,最近的研究已经开始解决这一问题。DrawEduMath 贡献了一个由专家标注的学生绘制数学图像数据集,并配以教师生成的 QA 项目[10 (https://arxiv.org/html/2607.09839#bib.bib10)]。虽然其关注手写解决方案与我们计算机生成的重点不同,但其结合教师编写和合成的 QA 材料的方式为评估图像上的数学推理提供了一个有用的模板。我们的工作将这些原则扩展到算法生成的教育视觉内容,特别是针对 K-12 环境,其中创造性表示(例如花卉图)通常补充数学的严谨性。 这些以评估为重点的工作补充了诸如 GlycoDraw 之类的技术生成系统,该系统展示了领域特定可视化标准对于生成一致图形的重要性[11 (https://arxiv.org/html/2607.09839#bib.bib11)]。将严格的评估协议与领域感知生成系统相结合,为开发平衡技术准确性和教学效果的教育可视化工具提供了有希望的途径[11 (https://arxiv.org/html/2607.09839#bib.bib11),6 (https://arxiv.org/html/2607.09839#bib.bib6)]。 ### 2.3 智能体工作流和基于 LLM 的系统 智能体工作流的出现改变了跨领域复杂问题解决的方法,对数学可视化生成具有重要影响。“智能体系统的自动化设计”(ADAS)框架提出了一种基础方法,其中代码定义的智能体可以由元智能体自动发现,从而编程出越来越复杂的变体[12 (https://arxiv.org/html/2607.09839#bib.bib12)]。这种元智能体搜索范式展示了结构化智能体设计如何提高跨多个领域(包括数学)的性能。 智能体方法在可视化方面的一个典型应用体现在从自然语言描述自动创建 P&ID 图表的工作中[13 (https://arxiv.org/html/2607.09839#bib.bib13)]。该系统实现了一个多步骤工作流,用于直接从自然语言提示中进行结构化的迭代图表创建。虽然侧重于工程图表,但其原理很容易迁移到数学可视化生成。 Data Interpreter 代表了一种专门为端到端数据科学问题设计的基于 LLM 的智能体[14 (https://arxiv.org/html/2607.09839#bib.bib14)]。其层次图建模方法将复杂问题分解为可管理的子问题,并动态生成节点,说明了结构化分解在数学应用中的价值。 Polymind 引入了一种可视化图表工具,通过并行协作工作流(而不是传统的轮流交互)利用多个由 LLM 驱动的智能体[15 (https://arxiv.org/html/2607.09839#bib.bib15)]。通过定义模拟小组协作场景的离散“微任务”,Polymind 使用户能够协调多个同时进行的过程,而不是重复提示单个聊天机器人。这种编排方法为协调多个专业智能体进行数学可视化生成提供了宝贵的见解。 数学智能体(Math Agents)作为一类独特的 AI 系统的概念在探索计算基础设施和数学嵌入的研究中得到了探讨[16 (https://arxiv.org/html/2607.09839#bib.bib16)]。作者提出了一种基于 GPT 的工作流,将文献中的方程转换为 LaTeX 和 Python 格式,暗示了通过专门与数学结构交互的智能体,从“大数据”向“大数学”的潜在转变。 ## 3 问题陈述 有效的数学教学从根本上依赖于视觉表示,以使抽象概念具体化并易于理解。这对于那些受益于看到数学概念的多种表示形式的学习困难学生尤其重要。虽然 AI 的最新进展使得生成差异化的文本内容和数学教学练习题成为可能,但仍然存在一个关键的差距:无法自动生成和定制符合教学需求的高质量视觉辅助工具。 我们设想了一个用于 AI 辅助教育内容创建的两阶段流水线。在第一阶段,LLM 生成课程内容和图像描述。在第二阶段,一个智能体工作流将这些图像描述转化为适当的视觉辅助工具。我们的工作专注于这个关键的第二个阶段,其挑战在于确保生成的视觉内容能有效地服务于其预期的教学目的。 该领域进展的一个基本障碍是缺乏稳健的评估机制。我们解决的关键问题是:我们如何系统地评估 AI 生成的视觉辅助工具是否准确地反映了图像描述中指定的预期教学目的?这种能力不仅对于质量保证至关重要,而且对于实现能够从反馈中学习并迭代增强其输出的自我改进智能体工作流也是必不可少的。 如果没有可靠的方法来评估 AI 生成的视觉辅助工具的保真度和教育适用性,AI 在数学教育中的潜在影响将仍然受到限制。当前图像生成的评估方法主要关注美学质量和一般语义对齐,未能捕捉到数学可视化和教学效果的细微要求。 我们的研究通过开发一个全面的评估框架来解决这一差距,该框架用于评估预期数学概念(如图像描述中所表达)与其视觉实现之间的一致性。该框架将作为开发更复杂的 AI 系统的基础,这些系统能够可靠地生成和完善视觉辅助工具,最终支持更有效和更具包容性的数学教学。 ## 4 方法 请参见说明Figure 2:自动评估过程的工作流程图我们提出了一个自我改进的数学图表生成流水线,如图 2 所示。具体来说,给定一个数学图表的增强描述,我们使用 TikZ 生成初始图表,并生成四个开放式 QA 问答对。我们使用这些问题来评估初始图表的质量,然后将未满足的问题反馈给生成器,并利用这种反馈重新生成图表。这个优化循环持续进行,直到所有问题都得到满足或流水线达到最大循环次数。 ### 4.1 QA 生成器 在我们的初步实验中,我们让 QA 生成器创建关于图表质量的“是/否”问题,其中“是”表示该指标已得到满意满足(例如,插图中是否有正好 6 个黄色正六边形、2 个红色梯形和 9 个绿色等边三角形?)。Cohen's κ\\kappa 值为 0.11,原始一致性为 68%,这表明一致性较弱。由于开放式问题不太可能偶然被正确回答[2 (https://arxiv.org/html/2607.09839#bib.bib2)],我们选择使用开放式问题。这需要在流水线中添加一个验证器模型,以确定图表是否满足开放式问题。例如:“描述用于确保衣架杆看起来水平和平衡的 TikZ 命令。代码是否明确指定了从支撑点到杆两端相等的垂直距离?为什么或为什么不?” 这种权衡在于该方法依赖于评估器和验证器的质量来提供准确的图表反馈。 此外,我们还尝试了问题的类别。虽然准确性和清晰度是固定的类别,但我们最初包含了“适当性”类别,例如这样的问题:“这个双数轴图表对于学习百分比及其等值美元价值的七年级学生来说是一个合适的视觉辅助工具吗?” 这个问题几乎总是被评估者和人工标注者给予积极评价,并且没有提供有价值的信息。我们将其替换为一个中间类别。
相似文章
AMTFV:用于LLM自我修正的智能体数学工具流验证
介绍了AMTFV,一个通过数学工具流接口将数学验证建模与执行解耦的智能体框架,在五个具有挑战性的数学数据集上改进了LLM的答案验证与修订。
AI 协作者数学家:利用代理式 AI 加速数学家的研究
本文介绍了 AI 协作者数学家(AI Co-Mathematician),这是一个利用代理式 AI 支持数学家进行构思和定理证明等开放式研究任务的工作台。早期测试表明,该系统在困难的问题解决基准测试中取得了最先进的结果,包括在 FrontierMath Tier 4 中获得了 48% 的得分。
评估SageMath增强的LLM智能体在计算与实验数学中的应用
本文提出了一种ReAct风格的智能体设置,将LLM推理与SageMath的可验证反馈相结合,并在研究级数学问题上进行了评估。结果显示,各模型性能显著提升,其中GPT-5.5取得了最高的75.2%解题率。
LEAP:利用代理框架增强LLMs在形式数学中的能力
LEAP是一种代理框架,使通用LLMs能够在Lean中实现形式定理证明的最新性能,解决了2025年普特南竞赛的全部12个问题,并在新基准(Lean-IMO-Bench)上将形式化证明率从低于10%提升至70%,超越了专门系统。
Chat2Workflow:用自然语言生成可执行可视化工作流的基准测试
Chat2Workflow 提出了一套基准与智能体框架,用于将自然语言直接转化为可执行的可视化工作流。实验表明,现有大模型虽能捕捉意图,却难以胜任工业级自动化。