标签
RePro将面向Lean的神经自动化定理证明器集成到基准重写中,以确保问题有效性和答案正确性,从而可靠评估LLMs在数学问题求解中的表现。
本文介绍了AViD Journal,一个使用Lean 4进行数学定理自动新颖性验证的管道,在撤回的arXiv论文上进行评估,并强调形式验证中的挑战。
自动化定理证明正从像 Lean 4 这样的小众工具演变为借助机器学习来帮助解决实际数学问题的系统,例如验证一个对 Erdős 猜想的反例。
本文提出了一种自监督定理发现算法,该算法仅从公理和推理规则出发,无需人类先验知识即可构建定理库。实验表明,发现的定理具有意义,并能提升大语言模型的证明性能。
Google新论文提出LEAP框架,将数学问题拆解为目标树,利用Lean验证器反馈进行学习,使LLM在数学竞赛题上的正确率从10%提升至70%,解决了Putnam 2025全部12题,并在IMO基准上超越专用金牌级系统。
Google DeepMind 发布 AlphaProof Nexus 论文,AI agent 在 353 个开放数学问题中自主解决了 9 个 Erdős 难题(包括两个 56 年未解问题),并证明了 44 个 OEIS 猜想,每道题推理成本仅数百美元。
Google DeepMind's AlphaProof Nexus 结合了LLM驱动的证明生成与使用Lean的机器验证,解决了353个开放Erdős问题中的9个,其中两个已经开放了56年,每个问题仅花费几百美元。
本文在Clever基准的程序验证任务中,采用智能体证明框架评估Claude Code,在规范生成和端到端验证方面取得了超过98%的成功率,揭示出现有基准可能不足以评估现代智能体证明器的能力。
本文提出了NSPI,一种结合LLM与符号计算的神经符号框架,用于证明多项式不等式。它利用LLM生成的平方和猜想,通过符号计算进行精炼,并在Lean中形式化验证证明,在最多10个变量的多项式上展示了可扩展性。
本文介绍了 Discover and Prove (DAP),一个用于 Lean 4 自动定理证明的开源智能体框架,针对"困难模式"问题进行优化——即在构造形式化证明前必须独立发现答案。该工作发布了新的困难模式基准变体,达到最先进的结果,同时揭示了 LLM 答案准确率(>80%)与形式化证明器成功率(<10%)之间的巨大差距。
# 用于自动定理证明的生成语言建模 来源: [https://openai.com/index/generative-language-modeling-for-automated-theorem-proving/](https://openai.com/index/generative-language-modeling-for-automated-theorem-proving/) OpenAI## 摘要 我们探索了基于 Transformer 的语言模型在自动定理证明中的应用。这项工作的动力来自于一种可能性,即自动定理证明器与人类相比的一个主要局限——原始内容的生成