theorem-proving

标签

Cards List
#theorem-proving

LeanFlow:工作流驱动的Lean自动形式化案例研究

arXiv cs.AI ↗ · 2026-07-24 缓存

LeanFlow是一个LLM智能体系统,用于将数学论文转化为形式化的Lean项目,通过案例研究和与Kimi-K2.6及GPT-5.5的基准测试进行评估,在预算限制内实现了高完成率。

0 人收藏 0 人点赞
#theorem-proving

PriorProof:一种对形式化证明中技术新颖性的时间点度量方法

arXiv cs.AI ↗ · 2026-07-21 缓存

PriorProof 提出了一种方法,通过分析 Lean 证明项相对于更早 Mathlib 快照构建的依赖足迹,来衡量形式化数学中证明技术的新颖性。该方法在 69.7% 的配对上与人类评分者达成一致,并提供可解释的分数差距。

0 人收藏 0 人点赞
#theorem-proving

理论级别的自动形式化:从孤立陈述到统一形式知识库

arXiv cs.AI ↗ · 2026-07-16 缓存

这篇立场论文主张理论级别的自动形式化,即将包括公理、定义和引理在内的整个理论形式化为一致的库,而不是孤立的陈述。它讨论了这种转变的重要性、不同观点、开放挑战,并为形式化研究中的这一转变提出了前进方向。

0 人收藏 0 人点赞
#theorem-proving

OpenProver: 基于 Lean 4 的智能体和交互式定理证明

arXiv cs.AI ↗ · 2026-07-13 缓存

OpenProver 是一个开源系统,利用 Lean 4 进行 LLM 驱动的自动定理证明,采用规划器-工作器-验证器架构,并支持自主和交互两种模式。它实现了数学证明搜索中的可重复评估和人机协同。

0 人收藏 0 人点赞
#theorem-proving

从求解器到研究者:大型语言模型驱动的前沿形式化数学

arXiv cs.CL ↗ · 2026-07-10 缓存

这篇立场论文回顾了LLM驱动的形式化数学的现状,指出了将这些系统应用于开放性研究数学的关键局限性,并提出了一条战略性路线图,用于开发能够推进数学前沿的AI智能体。

0 人收藏 0 人点赞
#theorem-proving

@AnimaAnandkumar: 很高兴分享我们团队在 @icmlconf 数学和物理研讨会上发表的四篇与Lean相关的论文!这些工作共同…

X AI KOLs Timeline ↗ · 2026-07-09 缓存

Anima Anandkumar 宣布其团队在 ICML 研讨会上发表了四篇与 Lean 相关的论文,涵盖验证机器学习系统、函数式程序合成、证明助手互操作性以及科学推理,将 Lean 定位为 AI 的基础设施。

0 人收藏 0 人点赞
#theorem-proving

超越编译:评估自然语言到Lean语句的忠实形式化

arXiv cs.AI ↗ · 2026-07-01 缓存

本文提出了一个用于自然语言到Lean语句忠实形式化的基准测试和评估协议,揭示了编译通过与共识忠实性之间29个百分点的差距,并分解了专家起草、上下文搜索和细化反馈的效果。

0 人收藏 0 人点赞
#theorem-proving

Leanstral 1.5

Hacker News Top ↗ · 2026-06-30 缓存

Mistral AI 发布了 Leanstral 1.5,这是更新的 Lean 4 形式化证明工程模型,针对自动定理证明和自动形式化进行了优化,总参数为 119B,活跃参数为 6.5B。

0 人收藏 0 人点赞
#theorem-proving

在Agda中证明算术基本定理

Lobsters Hottest ↗ · 2026-06-30 缓存

一篇详细的博客文章,展示了在Agda中经过全面注释的算术基本定理证明,面向证明助手的中级学习者。

0 人收藏 0 人点赞
#theorem-proving

我们形式化基准测试中的缺陷:Lean定理证明的数据集缺陷和评估失败

arXiv cs.AI ↗ · 2026-06-30 缓存

本文对五个广泛使用的Lean定理证明基准进行了审计,发现了398个机械可验证的问题,例如反例、空洞定理和不健全的公理。它提出了一个故障分类法、自动化检查器和发布标准,以提高评估的可靠性和可信度。

0 人收藏 0 人点赞
#theorem-proving

计算机科学逻辑的理论级自动形式化

arXiv cs.LG ↗ · 2026-06-26 缓存

引入LCS-Bench,这是一个基于计算机科学逻辑的理论级自动形式化基准,覆盖327个教科书条目、4,076个Lean声明。对14个模型的评估表明该基准具有挑战性,最先进模型在自动形式化任务上仅达到20.1%。

0 人收藏 0 人点赞
#theorem-proving

基于 Lean 的过程验证强化学习用于定理证明

arXiv cs.AI ↗ · 2026-06-20 缓存

本文提出了过程验证强化学习,利用 Lean 证明助手作为过程预言机,在训练期间提供细粒度的策略级反馈,从而提升定理证明性能。

0 人收藏 0 人点赞
#theorem-proving

IsabeLLM:自动定理证明在共识形式化验证中的应用

arXiv cs.AI ↗ · 2026-06-17 缓存

本文介绍了对基于Isabelle构建的自动定理证明工具IsabeLLM的改进,通过集成检索增强生成框架、错误追踪和反例生成。改进后的工具在比特币工作量证明共识协议的形式化验证上进行了评估。

0 人收藏 0 人点赞
#theorem-proving

数值分析形式化:超越内核接受的智能体流水线与质量审计

arXiv cs.AI ↗ · 2026-06-15 缓存

本文提出了一种用于在 Lean 4 中形式化数值分析教材的智能体流水线,并引入了一个超越内核接受的质量审计框架,用于评估语义正确性和库复用情况,揭示了常见的不忠实形式化模式。

0 人收藏 0 人点赞
#theorem-proving

未完成项并非难点:半自动形式化的专家评审案例研究

arXiv cs.AI ↗ · 2026-06-15 缓存

本文介绍了一项案例研究,使用大型语言模型(Claude Code)在Lean定理证明器中形式化格罗滕迪克消失定理。研究发现,虽然智能体可以生成经验证的代码,但在定义和API设计方面存在困难,强调了超越单纯编译的专家评审需求。

0 人收藏 0 人点赞
#theorem-proving

MA-ProofBench:一种用于数学分析中定理证明的LLMs两级评估

arXiv cs.AI ↗ · 2026-06-15 缓存

MA-ProofBench是一个新的形式化基准,用于评估LLMs在数学分析中的定理证明能力,包含200个问题,分为两个难度级别。最佳模型GPT-5.5在Level I上仅达到16%,在Level II上为5%,突显了非形式化推理与形式化推理之间的显著差距。

0 人收藏 0 人点赞
#theorem-proving

ATS 编程语言

Lobsters Hottest ↗ · 2026-06-09 缓存

ATS 是一种静态类型编程语言,它将实现与形式化规范统一起来,支持函数式、命令式、并发和模块化编程,并利用依赖类型和线性类型实现高效和安全。

0 人收藏 0 人点赞
#theorem-proving

@Gilad_Bracha: 未来软件工程师的角色是利用AI将非正式需求转化为高级形式化规范,并……

X AI KOLs Following ↗ · 2026-06-05 缓存

Gilad Bracha 设想了一个未来,软件工程师使用AI将非正式需求转化为形式化规范并加以审查,而AI则实现代码并用定理证明器验证其是否符合规范。人类负责确保形式化规范正确,他们仅需编写自然语言。

0 人收藏 0 人点赞
#theorem-proving

LEAP:利用代理框架增强LLMs在形式数学中的能力

arXiv cs.AI ↗ · 2026-06-03 缓存

LEAP是一种代理框架,使通用LLMs能够在Lean中实现形式定理证明的最新性能,解决了2025年普特南竞赛的全部12个问题,并在新基准(Lean-IMO-Bench)上将形式化证明率从低于10%提升至70%,超越了专门系统。

0 人收藏 0 人点赞
#theorem-proving

面向Lean定理证明的LLM反馈蒸馏

arXiv cs.AI ↗ · 2026-06-01 缓存

提出反馈蒸馏(Feedback Distillation),一种利用来自LLM的token级监督来改进复杂推理的训练方法,在Lean 4定理证明上进行了评估。该方法比GRPO更好地保持了多样性,且两种方法互补。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈