theorem-proving

标签

Cards List
#theorem-proving

@rohanpaul_ai:价值2000美元的token比送两个人去参加会议还便宜,而这个差距正是改变开放问题计算方式的关键……

X AI KOLs Following · 2026-08-03 缓存

OpenAI 报告称,其下一代主要模型的内部版本(Astra)以约2000美元的token成本,解决了数学和理论计算机科学领域10个长期悬而未决的开放问题,并附有正式的Lean证书。

0 人收藏 0 人点赞
#theorem-proving

数学和理论计算机科学领域的十项进展

OpenAI Blog · 2026-08-01 缓存

OpenAI 宣布在数学和理论计算机科学的长期未解问题上取得十项成果,这些成果由其下一代模型 Astra 的内部版本实现,证明已用 Lean 形式化。

0 人收藏 0 人点赞
#theorem-proving

为何Rocq在程序验证上优于Lean

Lobsters Hottest · 2026-07-28 缓存

一篇技术博文认为,由于Rocq(Coq)原生支持余归纳类型和cofixpoints,而Lean基于库的方法尚不成熟,因此Rocq在程序验证方面优于Lean。

0 人收藏 0 人点赞
#theorem-proving

Lean 4 grind中的学习型干预

arXiv cs.LG · 2026-07-28 缓存

一篇研究论文,介绍了一种故障触发级联方法,用于将机器学习安全地集成到Lean 4的grind策略中,实现了效率提升并解决了之前无法解决的证明,且没有回归问题。

0 人收藏 0 人点赞
#theorem-proving

LeanFlow:工作流驱动的Lean自动形式化案例研究

arXiv cs.AI · 2026-07-24 缓存

LeanFlow是一个LLM智能体系统,用于将数学论文转化为形式化的Lean项目,通过案例研究和与Kimi-K2.6及GPT-5.5的基准测试进行评估,在预算限制内实现了高完成率。

0 人收藏 0 人点赞
#theorem-proving

PriorProof:一种对形式化证明中技术新颖性的时间点度量方法

arXiv cs.AI · 2026-07-21 缓存

PriorProof 提出了一种方法,通过分析 Lean 证明项相对于更早 Mathlib 快照构建的依赖足迹,来衡量形式化数学中证明技术的新颖性。该方法在 69.7% 的配对上与人类评分者达成一致,并提供可解释的分数差距。

0 人收藏 0 人点赞
#theorem-proving

理论级别的自动形式化:从孤立陈述到统一形式知识库

arXiv cs.AI · 2026-07-16 缓存

这篇立场论文主张理论级别的自动形式化,即将包括公理、定义和引理在内的整个理论形式化为一致的库,而不是孤立的陈述。它讨论了这种转变的重要性、不同观点、开放挑战,并为形式化研究中的这一转变提出了前进方向。

0 人收藏 0 人点赞
#theorem-proving

OpenProver: 基于 Lean 4 的智能体和交互式定理证明

arXiv cs.AI · 2026-07-13 缓存

OpenProver 是一个开源系统,利用 Lean 4 进行 LLM 驱动的自动定理证明,采用规划器-工作器-验证器架构,并支持自主和交互两种模式。它实现了数学证明搜索中的可重复评估和人机协同。

0 人收藏 0 人点赞
#theorem-proving

从求解器到研究者:大型语言模型驱动的前沿形式化数学

arXiv cs.CL · 2026-07-10 缓存

这篇立场论文回顾了LLM驱动的形式化数学的现状,指出了将这些系统应用于开放性研究数学的关键局限性,并提出了一条战略性路线图,用于开发能够推进数学前沿的AI智能体。

0 人收藏 0 人点赞
#theorem-proving

@AnimaAnandkumar: 很高兴分享我们团队在 @icmlconf 数学和物理研讨会上发表的四篇与Lean相关的论文!这些工作共同…

X AI KOLs Timeline · 2026-07-09 缓存

Anima Anandkumar 宣布其团队在 ICML 研讨会上发表了四篇与 Lean 相关的论文,涵盖验证机器学习系统、函数式程序合成、证明助手互操作性以及科学推理,将 Lean 定位为 AI 的基础设施。

0 人收藏 0 人点赞
#theorem-proving

超越编译:评估自然语言到Lean语句的忠实形式化

arXiv cs.AI · 2026-07-01 缓存

本文提出了一个用于自然语言到Lean语句忠实形式化的基准测试和评估协议,揭示了编译通过与共识忠实性之间29个百分点的差距,并分解了专家起草、上下文搜索和细化反馈的效果。

0 人收藏 0 人点赞
#theorem-proving

Leanstral 1.5

Hacker News Top · 2026-06-30 缓存

Mistral AI 发布了 Leanstral 1.5,这是更新的 Lean 4 形式化证明工程模型,针对自动定理证明和自动形式化进行了优化,总参数为 119B,活跃参数为 6.5B。

0 人收藏 0 人点赞
#theorem-proving

在Agda中证明算术基本定理

Lobsters Hottest · 2026-06-30 缓存

一篇详细的博客文章,展示了在Agda中经过全面注释的算术基本定理证明,面向证明助手的中级学习者。

0 人收藏 0 人点赞
#theorem-proving

我们形式化基准测试中的缺陷:Lean定理证明的数据集缺陷和评估失败

arXiv cs.AI · 2026-06-30 缓存

本文对五个广泛使用的Lean定理证明基准进行了审计,发现了398个机械可验证的问题,例如反例、空洞定理和不健全的公理。它提出了一个故障分类法、自动化检查器和发布标准,以提高评估的可靠性和可信度。

0 人收藏 0 人点赞
#theorem-proving

计算机科学逻辑的理论级自动形式化

arXiv cs.LG · 2026-06-26 缓存

引入LCS-Bench,这是一个基于计算机科学逻辑的理论级自动形式化基准,覆盖327个教科书条目、4,076个Lean声明。对14个模型的评估表明该基准具有挑战性,最先进模型在自动形式化任务上仅达到20.1%。

0 人收藏 0 人点赞
#theorem-proving

基于 Lean 的过程验证强化学习用于定理证明

arXiv cs.AI · 2026-06-20 缓存

本文提出了过程验证强化学习,利用 Lean 证明助手作为过程预言机,在训练期间提供细粒度的策略级反馈,从而提升定理证明性能。

0 人收藏 0 人点赞
#theorem-proving

IsabeLLM:自动定理证明在共识形式化验证中的应用

arXiv cs.AI · 2026-06-17 缓存

本文介绍了对基于Isabelle构建的自动定理证明工具IsabeLLM的改进,通过集成检索增强生成框架、错误追踪和反例生成。改进后的工具在比特币工作量证明共识协议的形式化验证上进行了评估。

0 人收藏 0 人点赞
#theorem-proving

数值分析形式化:超越内核接受的智能体流水线与质量审计

arXiv cs.AI · 2026-06-15 缓存

本文提出了一种用于在 Lean 4 中形式化数值分析教材的智能体流水线,并引入了一个超越内核接受的质量审计框架,用于评估语义正确性和库复用情况,揭示了常见的不忠实形式化模式。

0 人收藏 0 人点赞
#theorem-proving

未完成项并非难点:半自动形式化的专家评审案例研究

arXiv cs.AI · 2026-06-15 缓存

本文介绍了一项案例研究,使用大型语言模型(Claude Code)在Lean定理证明器中形式化格罗滕迪克消失定理。研究发现,虽然智能体可以生成经验证的代码,但在定义和API设计方面存在困难,强调了超越单纯编译的专家评审需求。

0 人收藏 0 人点赞
#theorem-proving

MA-ProofBench:一种用于数学分析中定理证明的LLMs两级评估

arXiv cs.AI · 2026-06-15 缓存

MA-ProofBench是一个新的形式化基准,用于评估LLMs在数学分析中的定理证明能力,包含200个问题,分为两个难度级别。最佳模型GPT-5.5在Level I上仅达到16%,在Level II上为5%,突显了非形式化推理与形式化推理之间的显著差距。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈