theorem-proving

标签

Cards List
#theorem-proving

ATS 编程语言

Lobsters Hottest · 2026-06-09 缓存

ATS 是一种静态类型编程语言,它将实现与形式化规范统一起来,支持函数式、命令式、并发和模块化编程,并利用依赖类型和线性类型实现高效和安全。

0 人收藏 0 人点赞
#theorem-proving

@Gilad_Bracha: 未来软件工程师的角色是利用AI将非正式需求转化为高级形式化规范,并……

X AI KOLs Following · 2026-06-05 缓存

Gilad Bracha 设想了一个未来,软件工程师使用AI将非正式需求转化为形式化规范并加以审查,而AI则实现代码并用定理证明器验证其是否符合规范。人类负责确保形式化规范正确,他们仅需编写自然语言。

0 人收藏 0 人点赞
#theorem-proving

LEAP:利用代理框架增强LLMs在形式数学中的能力

arXiv cs.AI · 2026-06-03 缓存

LEAP是一种代理框架,使通用LLMs能够在Lean中实现形式定理证明的最新性能,解决了2025年普特南竞赛的全部12个问题,并在新基准(Lean-IMO-Bench)上将形式化证明率从低于10%提升至70%,超越了专门系统。

0 人收藏 0 人点赞
#theorem-proving

面向Lean定理证明的LLM反馈蒸馏

arXiv cs.AI · 2026-06-01 缓存

提出反馈蒸馏(Feedback Distillation),一种利用来自LLM的token级监督来改进复杂推理的训练方法,在Lean 4定理证明上进行了评估。该方法比GRPO更好地保持了多样性,且两种方法互补。

0 人收藏 0 人点赞
#theorem-proving

@rohanpaul_ai: “我确实看到越来越多大规模生产的数学。” ~ 陶哲轩 AI 让这变得可扩展。将证明写作转…

X AI KOLs Following · 2026-05-24 缓存

陶哲轩评论 AI 使得大规模生产数学成为可能,将证明写作转化为可搜索的问题:从目标生成数千个迷你引理,然后用廉价检查器过滤掉大部分,只保留少数有效的。

0 人收藏 0 人点赞
#theorem-proving

宣布SAW对Isabelle的支持

Lobsters Hottest · 2026-05-22 缓存

Galois 宣布,SAW 现在支持从 Cryptol 规范生成 Isabelle 理论,将 Cryptol 和 SAW 的易用性与 Isabelle 等交互式定理证明器的表达能力相结合,从而实现对加密协议的半自动化验证。

0 人收藏 0 人点赞
#theorem-proving

@DayShuai: 明天 volunteer 了在 Yang Zhang lab 组会上分享我自己的 AI loop。同一套 OS pattern 最近半年在 automath 和 newmath 跑出 3,400+ 0-axiom Lean 4 定理、5×…

X AI KOLs Timeline · 2026-05-19 缓存

分享在Yang Zhang实验室组会上的AI loop经验,包括自动化定理证明、多机器协作、蒸馏私人经验库等,并提及Fields奖得主使用AI解决数学难题的例子。

0 人收藏 0 人点赞
#theorem-proving

自我对弈帮助AI在围棋中达到超人类水平,那么为何对LLM未能如此?研究人员找到了解决方案。

Reddit r/singularity · 2026-05-15

研究人员引入了自导自对弈(Self-Guided Self-Play, SGS),这是一种用于LLM的自我对弈算法,通过使用指引角色(Guide)对合成问题进行评分来防止奖励作弊(reward hacking)。应用于Lean4中的定理证明时,SGS超越了强化学习基线,并使7B模型胜过671B模型。

0 人收藏 0 人点赞
#theorem-proving

@logic_int: Aleph,我们全自主的AI智能体系统,用于形式验证,在所有主要定理证明基准测试中表现出色,包括…

X AI KOLs Following · 2026-05-14 缓存

Aleph,一个全自主的AI智能体系统,用于形式验证,在包括PutnamBench、VeriSoftBench和Verina在内的主要定理证明基准测试中取得了顶尖性能。

0 人收藏 0 人点赞
#theorem-proving

在Lean 4中形式化统计学习理论 [R]

Reddit r/MachineLearning · 2026-05-08 缓存

FormalSLT是一个Lean 4库,它形式化证明了有限样本统计学习理论结果(ERM、VC界、Rademacher界、PAC-Bayes等),附带显式假设且零sorry语句,为机器学习理论提供机器可验证的基础。

0 人收藏 0 人点赞
#theorem-proving

AI 协作者数学家:利用代理式 AI 加速数学家的研究

Hugging Face Daily Papers · 2026-05-07 缓存

本文介绍了 AI 协作者数学家(AI Co-Mathematician),这是一个利用代理式 AI 支持数学家进行构思和定理证明等开放式研究任务的工作台。早期测试表明,该系统在困难的问题解决基准测试中取得了最先进的结果,包括在 FrontierMath Tier 4 中获得了 48% 的得分。

0 人收藏 0 人点赞
#theorem-proving

Bolzano:LLM辅助数学研究的案例研究

arXiv cs.CL · 2026-04-21 缓存

# Bolzano:LLM辅助数学研究的案例研究 来源:[https://arxiv.org/html/2604.16989](https://arxiv.org/html/2604.16989) Jan Grebík1、Pavel Hubáček1,2、Martin Koutecký1、Matěj Kripner3、Václav Rozhoň1、Robert Šámal1、Adrián Zámečník1 1 布拉格查理大学计算机科学研究所 2 捷克科学院数学研究所 3 布拉格查理大学形式与应用语言学研究所 ###### 摘要 我们报告了在数学与理论计算机科学领域六个问题上取得的新成果……

0 人收藏 0 人点赞
#theorem-proving

Verus:验证 Rust 代码正确性的工具

Hacker News Top · 2026-04-20 缓存

Verus 是一款针对 Rust 的静态验证工具,利用 SMT 求解在不引入运行时检查的前提下,证明底层系统代码的完整功能正确性。

0 人收藏 0 人点赞
#theorem-proving

学习通过洞察进行非形式化定理证明的推理

arXiv cs.CL · 2026-04-20 缓存

本论文提出了DeepInsightTheorem,一个分层数据集和渐进式多阶段有监督微调训练策略,通过教导大语言模型识别和应用核心技术来改进其非形式化定理证明能力。

0 人收藏 0 人点赞
#theorem-proving

Gemini 高级版本配合 Deep Think 在国际数学奥林匹克竞赛中正式达到金牌标准

Google DeepMind Blog · 2025-10-24 缓存

Google DeepMind 的高级 Gemini 配合 Deep Think 在 2025 年国际数学奥林匹克竞赛中达到金牌标准,在竞赛时间限制内以自然语言端到端操作,解答了 6 道题目中的 5 道,获得 35 分——相比去年的银牌成绩取得了重大进步。

0 人收藏 0 人点赞
#theorem-proving

解决(部分)形式化数学奥林匹克问题

OpenAI Blog · 2022-02-02 缓存

# 解决(部分)形式化数学奥林匹克问题 来源:[https://openai.com/index/formal-math/](https://openai.com/index/formal-math/) 我们在 [miniF2F](https://arxiv.org/abs/2109.00110) 基准测试上实现了新的最先进成果(41.2% vs 29.3%),这是一个具有挑战性的高中奥林匹克问题集合。我们的方法称为*语句课程学习*,包括手动收集一组难度级别不同的陈述(不含证明)

0 人收藏 0 人点赞
#theorem-proving

GamePad:定理证明学习环境

OpenAI Blog · 2018-06-02 缓存

OpenAI 推出 GamePad,一个用于在 Coq 证明助手中应用机器学习进行定理证明的学习环境,可实现证明综合以及为策略预测和位置评估任务训练基准模型。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈