automated-theorem-proving

标签

Cards List
#automated-theorem-proving

RePro:基于证明验证的基准重写,用于可靠评估LLM的数学问题求解能力

arXiv cs.CL · 2026-09-02 缓存

RePro将面向Lean的神经自动化定理证明器集成到基准重写中,以确保问题有效性和答案正确性,从而可靠评估LLMs在数学问题求解中的表现。

0 人收藏 0 人点赞
#automated-theorem-proving

超越正确性:迈向使用Lean 4的自动新颖性验证

arXiv cs.AI · 2026-08-18 缓存

本文介绍了AViD Journal,一个使用Lean 4进行数学定理自动新颖性验证的管道,在撤回的arXiv论文上进行评估,并强调形式验证中的挑战。

0 人收藏 0 人点赞
#automated-theorem-proving

很高兴看到自动化定理证明从一个小众工具发展到解决实际数学问题

Reddit r/artificial · 2026-07-01

自动化定理证明正从像 Lean 4 这样的小众工具演变为借助机器学习来帮助解决实际数学问题的系统,例如验证一个对 Erdős 猜想的反例。

0 人收藏 0 人点赞
#automated-theorem-proving

形式化公理系统中的自监督定理发现

arXiv cs.AI · 2026-06-30 缓存

本文提出了一种自监督定理发现算法,该算法仅从公理和推理规则出发,无需人类先验知识即可构建定理库。实验表明,发现的定理具有意义,并能提升大语言模型的证明性能。

0 人收藏 0 人点赞
#automated-theorem-proving

@FinanceYF5: Google新论文:让LLM解数学竞赛题,正确率从10%跳到70%。 【LEAP框架】不让模型一次写完整证明,而是把问题拆成目标树,边做边从Lean验证器的反馈里学,复用已证过的引理。 结果:Putnam 2025全部12题解出,IMO风…

X AI KOLs Timeline · 2026-06-05 缓存

Google新论文提出LEAP框架,将数学问题拆解为目标树,利用Lean验证器反馈进行学习,使LLM在数学竞赛题上的正确率从10%提升至70%,解决了Putnam 2025全部12题,并在IMO基准上超越专用金牌级系统。

0 人收藏 0 人点赞
#automated-theorem-proving

@FinanceYF5: Google DeepMind发布AlphaProof Nexus论文: AI agent在353个开放数学问题中自主解决了9个Erdős难题,包括两个56年未解问题,并证明了44个OEIS猜想。 每道题推理成本仅数百美元。

X AI KOLs Following · 2026-05-26 缓存

Google DeepMind 发布 AlphaProof Nexus 论文,AI agent 在 353 个开放数学问题中自主解决了 9 个 Erdős 难题(包括两个 56 年未解问题),并证明了 44 个 OEIS 猜想,每道题推理成本仅数百美元。

0 人收藏 0 人点赞
#automated-theorem-proving

Google DeepMind's AlphaProof Nexus 解决了几十年的数学难题,仅花费几百美元(7分钟阅读)

TLDR AI · 2026-05-26 缓存

Google DeepMind's AlphaProof Nexus 结合了LLM驱动的证明生成与使用Lean的机器验证,解决了353个开放Erdős问题中的9个,其中两个已经开放了56年,每个问题仅花费几百美元。

0 人收藏 0 人点赞
#automated-theorem-proving

程序验证的智能体证明

arXiv cs.AI · 2026-05-25 缓存

本文在Clever基准的程序验证任务中,采用智能体证明框架评估Claude Code,在规范生成和端到端验证方面取得了超过98%的成功率,揭示出现有基准可能不足以评估现代智能体证明器的能力。

0 人收藏 0 人点赞
#automated-theorem-proving

从LLM生成的猜想到Lean形式化验证:基于平方和证书的自动多项式不等式证明

arXiv cs.AI · 2026-05-18 缓存

本文提出了NSPI,一种结合LLM与符号计算的神经符号框架,用于证明多项式不等式。它利用LLM生成的平方和猜想,通过符号计算进行精炼,并在Lean中形式化验证证明,在最多10个变量的多项式上展示了可扩展性。

0 人收藏 0 人点赞
#automated-theorem-proving

发现与证明:Lean 4中困难模式自动定理证明的开源智能体框架

arXiv cs.CL · 2026-04-20 缓存

本文介绍了 Discover and Prove (DAP),一个用于 Lean 4 自动定理证明的开源智能体框架,针对"困难模式"问题进行优化——即在构造形式化证明前必须独立发现答案。该工作发布了新的困难模式基准变体,达到最先进的结果,同时揭示了 LLM 答案准确率(>80%)与形式化证明器成功率(<10%)之间的巨大差距。

0 人收藏 0 人点赞
#automated-theorem-proving

用于自动定理证明的生成语言建模

OpenAI Blog · 2020-09-07 缓存

# 用于自动定理证明的生成语言建模 来源: [https://openai.com/index/generative-language-modeling-for-automated-theorem-proving/](https://openai.com/index/generative-language-modeling-for-automated-theorem-proving/) OpenAI## 摘要 我们探索了基于 Transformer 的语言模型在自动定理证明中的应用。这项工作的动力来自于一种可能性,即自动定理证明器与人类相比的一个主要局限——原始内容的生成

0 人收藏 0 人点赞
← 返回首页

提交意见反馈