formal-verification

标签

Cards List
#formal-verification

学习发现有趣的数学

arXiv cs.LG ↗ · 昨天 缓存

本文介绍了一个框架,使LLMs能够发现和证明有趣的数学定理,通过优化基于证明难度的指标,从而产生更多新颖且有用的数学知识,并减少与现有库的重叠。

0 人收藏 0 人点赞
#formal-verification

利用LLMs的可证完备泛化规划

arXiv cs.AI ↗ · 2天前 缓存

本文介绍了一种在Lean中利用LLMs自动生成具有完备性形式化证明的泛化规划的方法,并在基准领域上进行了评估,展示了在自动规划验证方面的显著进步。

0 人收藏 0 人点赞
#formal-verification

TLA+ 也是我们 Intent Lab 用于构建如 Agent FS 等关键任务基础架构软件的方法之一。关键…

X AI KOLs Following ↗ · 3天前 缓存

这条推文讨论了使用形式验证方法如 TLA+ 和 Lean 来确保关键任务 AI 基础架构软件的正确性和可扩展性,并提到了 Intent Lab 和 Boris Cherny 在 Claude Agent SDK 方面的工作。

0 人收藏 0 人点赞
#formal-verification

@bcherny: 我使用 Opus 5.5 通过 Lean 对 Claude Agent SDK 进行了形式化验证。几个简短的提示 = 16 个 PR 修复了各种 bug…

X AI KOLs Timeline ↗ · 3天前 缓存

作者使用 Claude 的 Opus 5.5 模型通过 Lean 对 Claude Agent SDK 进行了形式化验证,生成了 16 个 PR 来修复 bug 和竞态条件,并建议结合 Lean 和 TLA+ 以增强 bug 查找能力。

0 人收藏 0 人点赞
#formal-verification

在'足够好'AI时代的安全审计

Hacker News Top ↗ · 4天前 缓存

Trail of Bits使用AI代理为Miden零知识虚拟机开发定制的安全审计工具和形式化模型,揭示了关键漏洞并生成机器验证的正确性证明。

0 人收藏 0 人点赞
#formal-verification

SWE-Proof:语言模型能否通过机器检查证明解决现实世界问题?

arXiv cs.LG ↗ · 5天前 缓存

本文介绍了SWE-Proof,这是一个针对现实世界软件问题的经过形式验证的代码补丁基准,表明形式验证能提高LLM生成代码的错误检测能力,并将规范综合识别为一个关键开放问题。

0 人收藏 0 人点赞
#formal-verification

@poteto: 非常看好 Bend,这正是我在其他语言中一直尝试要做的,但仅靠弱类型系统和 lint 规则,你只能走这么远。

X AI KOLs Timeline ↗ · 6天前 缓存

@poteto 对 Bend 表示热情,Bend 是一种支持形式验证的语言,能够加速软件开发并解决代码审查问题,@VictorTaelin 同意其在构建无错误复杂软件方面的潜力。

0 人收藏 0 人点赞
#formal-verification

一个经Lean验证的证明仍可能证错问题版本

Reddit r/ArtificialInteligence ↗ · 2026-09-19

本文探讨了OpenAI针对Navier-Stokes问题的Lean证明的验证,强调了确保形式证明与预期数学问题一致的重要性,以及数学家进一步审查的必要性。

0 人收藏 0 人点赞
#formal-verification

Bend 2 与氛围编程的陷阱

Hacker News Top ↗ · 2026-09-18 缓存

本文批判了专为AI编码时代设计的编程语言Bend 2,指出其陷入了'氛围编程'的陷阱,并将其与SPARK等形式化验证方法进行了不利的比较。

0 人收藏 0 人点赞
#formal-verification

MAGS:多智能体自动形式化确保智能体输出的安全性

arXiv cs.AI ↗ · 2026-09-18 缓存

MAGS引入了一种多智能体框架,利用Dafny进行形式化验证,从LLM编程智能体生成具有安全保证的可执行程序,在CUDA内核和机器人任务等多个领域实现了100%的验证代码生成成功率。

0 人收藏 0 人点赞
#formal-verification

RFCLLM:评估LLMs在网络协议状态机中的推理能力

arXiv cs.CL ↗ · 2026-09-15 缓存

本文评估LLMs解释网络协议规范并将其映射为形式化有限状态机的能力,通过为各种协议设计的任务和查询来评估其推理能力。

0 人收藏 0 人点赞
#formal-verification

使用 Verus 开发可证明正确的 Rust 代码

Hacker News Top ↗ · 2026-09-14 缓存

Verus 是一个开源的自动化程序验证器,专为 Rust 设计,通过数学证明帮助确保代码正确性,并被亚马逊用于像 Nitro Isolation Engine 这样的项目。

0 人收藏 0 人点赞
#formal-verification

真理能否抵御未来?论机械化证明的可能未来

Lobsters Hottest ↗ · 2026-09-12 缓存

本文探讨了机械化证明的未来可能性,并质疑在自动定理证明的背景下,真理是否能够抵御未来。

0 人收藏 0 人点赞
#formal-verification

StochBench: 专为 Lean 设计的随机过程领域特定基准测试

arXiv cs.CL ↗ · 2026-09-10 缓存

StochBench 引入了一个包含 450 个研究生水平随机过程问题的领域特定基准测试,使用 Lean 4 实现,并通过一个 AI 代理评估,证明率达到 34.9%,以推进应用数学中的形式化定理证明。

0 人收藏 0 人点赞
#formal-verification

近期事件时间线:从协作到Navier-Stokes方程的解决

Reddit r/singularity ↗ · 2026-09-08

从2025年到2026年事件的时间线,详细描述了合作与竞争的努力,以解决Navier-Stokes方程,最终以OpenAI宣布使用AI模型解决该问题而告终。

0 人收藏 0 人点赞
#formal-verification

在Dummit和Foote的Abstract Algebra中发现一个错误

Hacker News Top ↗ · 2026-09-04 缓存

这篇博客文章详细描述了作者在Rocq中形式化《Dummit和Foote的Abstract Algebra》教材时发现的一个错误:关于单射函数和左逆的一个命题对空集不成立。

0 人收藏 0 人点赞
#formal-verification

RePro:基于证明验证的基准重写,用于可靠评估LLM的数学问题求解能力

arXiv cs.CL ↗ · 2026-09-02 缓存

RePro将面向Lean的神经自动化定理证明器集成到基准重写中,以确保问题有效性和答案正确性,从而可靠评估LLMs在数学问题求解中的表现。

0 人收藏 0 人点赞
#formal-verification

SHADOWBENCH: 迈向自动形式化中语义对齐的可靠自动评估

arXiv cs.CL ↗ · 2026-09-01 缓存

本文介绍了SA-Pass,一种用于评估自动形式化中语义对齐的方法,并提出了ShadowBench,一个包含178个问题的Lean 4基准测试,展示了与专家判断的高度一致性。

0 人收藏 0 人点赞
#formal-verification

我正在为AI生成的声明构建一个独立验证层,并寻找研究人员和合作伙伴与我们共同构建。

Reddit r/artificial ↗ · 2026-08-29

作者正在开发一个用于AI生成声明的确定性验证引擎,专注于形式化验证方法,并寻求研究人员和合作伙伴进行合作。

0 人收藏 0 人点赞
#formal-verification

ProofEvolve:用于形式化自动定理证明的神经符号进化

arXiv cs.AI ↗ · 2026-08-28 缓存

ProofEvolve是一个神经符号框架,通过使用神经模型进化形式化验证的证明结构来增强自动定理证明,通过保留来自未完成尝试的验证知识,在Lean基准测试中实现高求解率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈