theorem-proving

标签

Cards List
#theorem-proving

学习发现有趣的数学

arXiv cs.LG ↗ · 2天前 缓存

本文介绍了一个框架,使LLMs能够发现和证明有趣的数学定理,通过优化基于证明难度的指标,从而产生更多新颖且有用的数学知识,并减少与现有库的重叠。

0 人收藏 0 人点赞
#theorem-proving

学习发现有趣的数学

Hugging Face Daily Papers ↗ · 4天前 缓存

本文通过证明与陈述长度之比定义了数学定理的内在趣味性,并训练了一个27B模型来预测证明难度,从而能够生成更有趣的定理,并构建与现有知识(如 Mathlib)重叠更少的自扩展数学知识库。

0 人收藏 0 人点赞
#theorem-proving

@ElliotGlazer: 搞什么,CIC + LEM 证明了 Con(ZF)?!? 这就给了 Con(ZF) 在无公理 Lean + LEM 中的证明。由 Mario Carneiro 发现 …

X AI KOLs Following ↗ · 6天前 缓存

Mario Carneiro 发现 CIC 加上 LEM 证明了 ZF 集合论的一致性,从而使得在无公理 Lean 中使用 LEM 的证明成为可能,推动了类型论元数学的发展。

0 人收藏 0 人点赞
#theorem-proving

深刻定理曾很稀缺。人工智能打破了这个局面(15分钟阅读时间)

TLDR AI ↗ · 2026-09-14 缓存

文章讨论了人工智能如何革新数学中深刻定理的产生,挑战了传统的成功衡量标准,并以Nivat猜想为重点。

0 人收藏 0 人点赞
#theorem-proving

@dhuynh95: 所以 @OpenAI 花了1000万美元的令牌就为了在Lean中教AI使出螺旋丸来赢得100万美元的数学奖?真是个了不起的时代…

X AI KOLs Following ↗ · 2026-09-13 缓存

据报道,OpenAI花了价值1000万美元的令牌解决了Navier-Stokes Millennium Prize Problem,通过使用先进的AI模型赢得了100万美元的数学奖。

0 人收藏 0 人点赞
#theorem-proving

StochBench: 专为 Lean 设计的随机过程领域特定基准测试

arXiv cs.CL ↗ · 2026-09-10 缓存

StochBench 引入了一个包含 450 个研究生水平随机过程问题的领域特定基准测试,使用 Lean 4 实现,并通过一个 AI 代理评估,证明率达到 34.9%,以推进应用数学中的形式化定理证明。

0 人收藏 0 人点赞
#theorem-proving

OpenAI 称已破解数学中的一个‘Millennium Problems’

Reddit r/singularity ↗ · 2026-09-08

OpenAI 声称已解决数学中的一个‘Millennium Prize Problems’,这标志着AI和数学研究的潜在重大突破。

0 人收藏 0 人点赞
#theorem-proving

C*: 统一编程与验证的C语言

Hacker News Top ↗ · 2026-09-08 缓存

本文介绍了C*,一种证明集成语言,它将C编程与形式化验证统一,通过嵌入式证明代码块实现实时验证。

0 人收藏 0 人点赞
#theorem-proving

OpenAI 在 Astra 发布前推出新的 Lean 证明仓库

Reddit r/singularity ↗ · 2026-09-03

OpenAI 在 GitHub 上发布了新的 Lean 定理证明仓库,这是在其即将发布的 Astra 之前。

0 人收藏 0 人点赞
#theorem-proving

ProofEvolve:用于形式化自动定理证明的神经符号进化

arXiv cs.AI ↗ · 2026-08-28 缓存

ProofEvolve是一个神经符号框架,通过使用神经模型进化形式化验证的证明结构来增强自动定理证明,通过保留来自未完成尝试的验证知识,在Lean基准测试中实现高求解率。

0 人收藏 0 人点赞
#theorem-proving

FaithSieve:基于忠实形式证据的数学证明细粒度评估

arXiv cs.AI ↗ · 2026-08-28 缓存

FaithSieve是一个Lean辅助的框架,用于数学证明的细粒度评估。它通过语义对齐评分来确保忠实的形式证据,在专家验证的数据集上实现了比基线方法更高的准确率。

0 人收藏 0 人点赞
#theorem-proving

MathAdv:定理证明器的知识、推理、形式化与泛化

arXiv cs.CL ↗ · 2026-08-27 缓存

MathAdv 是一个用于数学形式定理证明的诊断基准,覆盖13个领域,并提供辅助任务以评估知识、推理和鲁棒性。该研究揭示了形式化瓶颈以及模型间的性能差异。

0 人收藏 0 人点赞
#theorem-proving

基于编译器引导的自适应证明搜索与跨模型协同在上下文依赖定理证明中的应用

arXiv cs.CL ↗ · 2026-08-20 缓存

本文提出了一种用于Lean 4上下文依赖定理证明的编译器引导自适应证明搜索框架,利用跨模型协同来提高证明成功率并降低计算成本。

0 人收藏 0 人点赞
#theorem-proving

MathCode, 数学编码代理

Hacker News Top ↗ · 2026-08-16 缓存

MathCode是一款AI驱动的编码助手,它能将数学问题转换为Lean 4定理并尝试进行形式化证明,具有持久化的REPL、定理库以及代理模式证明功能。

0 人收藏 0 人点赞
#theorem-proving

PROVE-RT: Generating Mechanized Theorem Prover Scripts for Real-Time Systems using LLMs

arXiv cs.AI ↗ · 2026-08-14 缓存

This paper presents Prove-RT, an LLM-assisted framework for generating Prosa/Rocq mechanized theorem prover scripts for schedulability analysis in real-time systems, achieving a 44.7% success rate on a curated evaluation set.

0 人收藏 0 人点赞
#theorem-proving

@rohanpaul_ai:价值2000美元的token比送两个人去参加会议还便宜,而这个差距正是改变开放问题计算方式的关键……

X AI KOLs Following ↗ · 2026-08-03 缓存

OpenAI 报告称,其下一代主要模型的内部版本(Astra)以约2000美元的token成本,解决了数学和理论计算机科学领域10个长期悬而未决的开放问题,并附有正式的Lean证书。

0 人收藏 0 人点赞
#theorem-proving

数学和理论计算机科学领域的十项进展

OpenAI Blog ↗ · 2026-08-01 缓存

OpenAI 宣布在数学和理论计算机科学的长期未解问题上取得十项成果,这些成果由其下一代模型 Astra 的内部版本实现,证明已用 Lean 形式化。

0 人收藏 0 人点赞
#theorem-proving

为何Rocq在程序验证上优于Lean

Lobsters Hottest ↗ · 2026-07-28 缓存

一篇技术博文认为,由于Rocq(Coq)原生支持余归纳类型和cofixpoints,而Lean基于库的方法尚不成熟,因此Rocq在程序验证方面优于Lean。

0 人收藏 0 人点赞
#theorem-proving

Lean 4 grind中的学习型干预

arXiv cs.LG ↗ · 2026-07-28 缓存

一篇研究论文,介绍了一种故障触发级联方法,用于将机器学习安全地集成到Lean 4的grind策略中,实现了效率提升并解决了之前无法解决的证明,且没有回归问题。

0 人收藏 0 人点赞
#theorem-proving

LeanFlow:工作流驱动的Lean自动形式化案例研究

arXiv cs.AI ↗ · 2026-07-24 缓存

LeanFlow是一个LLM智能体系统,用于将数学论文转化为形式化的Lean项目,通过案例研究和与Kimi-K2.6及GPT-5.5的基准测试进行评估,在预算限制内实现了高完成率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈