计算机科学逻辑的理论级自动形式化
摘要
引入LCS-Bench,这是一个基于计算机科学逻辑的理论级自动形式化基准,覆盖327个教科书条目、4,076个Lean声明。对14个模型的评估表明该基准具有挑战性,最先进模型在自动形式化任务上仅达到20.1%。
arXiv:2606.26525v1 公告类型:新
摘要:自动形式化对于可扩展的形式化验证至关重要,但现有进展主要集中于孤立语句,而理论级自动形式化(即连贯地翻译数百个相互依赖的定义、引理和定理)由于在一致性、忠实性、可扩展性和正确性方面存在挑战,仍是一个未解决问题。本文中,我们引入了LCS-Bench,这是一个基于《计算机科学逻辑》的独立理论级基准。LCS-Bench通过一种新颖的半自动化智能体流水线构建,该流水线利用概念图、形式签名规划、问题追踪、通过反例搜索填充待证明项,并辅以人类专家的忠实性审查。生成的成果覆盖327个教科书条目、超过4,076个Lean声明以及超过85,000行Lean代码。该数据集通过一个数据引擎自动衍生出五个评估基准轨道,用于衡量自动形式化和定理证明能力的不同方面,从而支持广泛的评估。我们还引入了一种新颖的评估协议,包含定义等价性检查器,能够进行更细粒度和更忠实的评估。通过对14个模型的广泛评估,我们证明了:(1) LCS-Bench具有高质量、一致性和忠实性;(2) 该基准具有挑战性,最先进模型在自动形式化任务上仅达到20.1%;(3) 我们的分析揭示了关于理论级自动形式化的关键发现,并为未来工作提出了有前景的方向。
查看缓存全文
缓存时间: 2026/06/26 05:20
# 计算机科学逻辑的理论级自动形式化 来源:https://arxiv.org/abs/2606.26525 查看PDF (https://arxiv.org/pdf/2606.26525) > 摘要:自动形式化对于可扩展的形式验证至关重要,但现有进展主要集中于孤立语句,而理论级自动形式化——即连贯地翻译数百个相互依赖的定义、引理和定理——由于在一致性、忠实性、可扩展性和正确性方面的挑战,仍是一个开放问题。本文提出了LCS-Bench,一个基于计算机科学逻辑的独立理论级基准。LCS-Bench通过一种新颖的半自动化智能体流水线构建,该流水线利用概念图、形式化签名规划、问题追踪、带反例搜索的sorry填充,并辅以人类专家的忠实性审查。生成的成果涵盖了327个教科书条目、超过4,076个Lean声明以及8.5万余行Lean代码。该数据集通过一个数据引擎支持广泛的评估,该引擎自动派生五个评估基准轨道,衡量自动形式化和定理证明能力的不同方面。我们还引入了一种新颖的评估协议,包含定义等价性检查器,能够实现更细粒度且更忠实的评估。通过对14个模型的广泛评估,我们证明了:(1) LCS-Bench质量高、一致且忠实;(2) 该基准具有挑战性,最先进的模型在自动形式化任务上仅达到20.1%;(3) 我们的分析揭示了关于理论级自动形式化的关键发现,并为未来工作指明了有前景的方向。 ## 提交历史 来自:Ziyang Li [查看邮件](https://arxiv.org/show-email/44c6f5a4/2606.26525) **\[v1\]** 2026年6月25日星期四 01:59:53 UTC (3,093 KB)
相似文章
理论级别的自动形式化:从孤立陈述到统一形式知识库
这篇立场论文主张理论级别的自动形式化,即将包括公理、定义和引理在内的整个理论形式化为一致的库,而不是孤立的陈述。它讨论了这种转变的重要性、不同观点、开放挑战,并为形式化研究中的这一转变提出了前进方向。
超越图书馆:一种用于自动形式化研究数学的智能体框架
提出了一种智能体框架,利用通用编码大语言模型将研究级数学自动形式化为Lean 4代码,并在Putnam问题和STOC会议论文上进行了评估。
FaithformBench:数学思维链自动形式化的忠实度基准
介绍了FaithformBench,一个用于评估数学思维链自动形式化系统忠实度的基准,通过测量扰动步骤上的有效性与无效性保持来评估。应用于八个AF系统后,揭示了普遍的“谄媚”现象,即无效输入被静默纠正。
ChaosBench-Logic v2:大规模评估LLM在动态系统上的逻辑推理能力
ChaosBench-Logic v2是一个包含165个动态系统共40,886个问题的大规模基准测试,用于评估LLM的逻辑推理能力,结果显示即使在最前沿的模型中,在状态转变推理上也接近随机表现,并存在系统性失败模式。
MathAtlas:野外自动形式化基准测试
MathAtlas 是一个针对研究生级别数学的自动形式化的大规模基准测试,包含从103本教科书中提取的约5.2万个定理和定义,并附带一个包含约17.8万条关系的数学依赖图。实验表明,最先进的模型正确率最高仅为9.8%,凸显了其难度。