标签
本文介绍了一个框架,使LLMs能够发现和证明有趣的数学定理,通过优化基于证明难度的指标,从而产生更多新颖且有用的数学知识,并减少与现有库的重叠。
本文通过证明与陈述长度之比定义了数学定理的内在趣味性,并训练了一个27B模型来预测证明难度,从而能够生成更有趣的定理,并构建与现有知识(如 Mathlib)重叠更少的自扩展数学知识库。
Mario Carneiro 发现 CIC 加上 LEM 证明了 ZF 集合论的一致性,从而使得在无公理 Lean 中使用 LEM 的证明成为可能,推动了类型论元数学的发展。
文章讨论了人工智能如何革新数学中深刻定理的产生,挑战了传统的成功衡量标准,并以Nivat猜想为重点。
据报道,OpenAI花了价值1000万美元的令牌解决了Navier-Stokes Millennium Prize Problem,通过使用先进的AI模型赢得了100万美元的数学奖。
StochBench 引入了一个包含 450 个研究生水平随机过程问题的领域特定基准测试,使用 Lean 4 实现,并通过一个 AI 代理评估,证明率达到 34.9%,以推进应用数学中的形式化定理证明。
OpenAI 声称已解决数学中的一个‘Millennium Prize Problems’,这标志着AI和数学研究的潜在重大突破。
OpenAI 在 GitHub 上发布了新的 Lean 定理证明仓库,这是在其即将发布的 Astra 之前。
ProofEvolve是一个神经符号框架,通过使用神经模型进化形式化验证的证明结构来增强自动定理证明,通过保留来自未完成尝试的验证知识,在Lean基准测试中实现高求解率。
FaithSieve是一个Lean辅助的框架,用于数学证明的细粒度评估。它通过语义对齐评分来确保忠实的形式证据,在专家验证的数据集上实现了比基线方法更高的准确率。
MathAdv 是一个用于数学形式定理证明的诊断基准,覆盖13个领域,并提供辅助任务以评估知识、推理和鲁棒性。该研究揭示了形式化瓶颈以及模型间的性能差异。
本文提出了一种用于Lean 4上下文依赖定理证明的编译器引导自适应证明搜索框架,利用跨模型协同来提高证明成功率并降低计算成本。
MathCode是一款AI驱动的编码助手,它能将数学问题转换为Lean 4定理并尝试进行形式化证明,具有持久化的REPL、定理库以及代理模式证明功能。
This paper presents Prove-RT, an LLM-assisted framework for generating Prosa/Rocq mechanized theorem prover scripts for schedulability analysis in real-time systems, achieving a 44.7% success rate on a curated evaluation set.
OpenAI 报告称,其下一代主要模型的内部版本(Astra)以约2000美元的token成本,解决了数学和理论计算机科学领域10个长期悬而未决的开放问题,并附有正式的Lean证书。
OpenAI 宣布在数学和理论计算机科学的长期未解问题上取得十项成果,这些成果由其下一代模型 Astra 的内部版本实现,证明已用 Lean 形式化。
一篇技术博文认为,由于Rocq(Coq)原生支持余归纳类型和cofixpoints,而Lean基于库的方法尚不成熟,因此Rocq在程序验证方面优于Lean。
一篇研究论文,介绍了一种故障触发级联方法,用于将机器学习安全地集成到Lean 4的grind策略中,实现了效率提升并解决了之前无法解决的证明,且没有回归问题。
LeanFlow是一个LLM智能体系统,用于将数学论文转化为形式化的Lean项目,通过案例研究和与Kimi-K2.6及GPT-5.5的基准测试进行评估,在预算限制内实现了高完成率。