FVSpec:真实世界基于属性测试的Lean挑战
摘要
本文介绍了FVSpec,这是一个用于AI辅助形式验证的基准测试,它通过多智能体LLM管道将真实世界的基于属性测试从Python转换为Lean 4规范,旨在推动真实世界软件形式验证的进展。
查看缓存全文
缓存时间: 2026/06/15 16:59
论文页面 - FVSpec:作为Lean挑战的真实世界基于属性的测试
来源:https://huggingface.co/papers/2606.01008
摘要
本文提出了一个用于AI辅助形式化验证的基准,涉及使用多智能体LLM流水线将基于属性的测试从Python转换为Lean规范。
我们提出了一个基准,用于评估AI模型和智能体在真实世界软件形式化验证任务上的表现。我们首先从真实世界的Python仓库中抓取11,039个基于属性的测试(PBT),然后自动将其中2,772个(25%)转换为9,415个Lean 4规范,并包含sorry占位符(每个PBT约3个形式化版本;当没有单一版本在质量指标上占优时,我们保留多次尝试)。将PBT转换为Lean规范具有挑战性:需要在Lean中对Python语义进行建模,推断命令式PBT中编码的逻辑属性,并处理在一种不常用语言中进行依赖类型编程的固有困难。我们描述了一个三智能体LLM流水线,用于将PBT转译成Lean规范,评估了覆盖率和质量指标,并为使用多种自动化和基于模型的方法进行证明生成提供了基线。所有代码(爬取器和智能体)和数据(PBT和Lean规范)均为开源。我们的基准旨在推动AI辅助真实世界软件形式化验证这一尚未充分探索的问题取得进展,随着AI生成越来越多的代码,这一领域正日益受到关注。
查看arXiv页面 (https://arxiv.org/abs/2606.01008)查看PDF (https://arxiv.org/pdf/2606.01008)项目页面 (https://fvspec.galois.com/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.01008)
在您的智能体中获取此论文:
hf papers read 2606.01008
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
请在模型README.md中引用arxiv.org/abs/2606.01008以从此页面链接。
引用此论文的数据集2
GaloisInc/fvspec-pbt 查看器• 更新于约1小时前 • 21.7k • 59 (https://huggingface.co/datasets/GaloisInc/fvspec-pbt)
GaloisInc/fvspec-fv 查看器• 更新于约1小时前 • 9.42k • 55 (https://huggingface.co/datasets/GaloisInc/fvspec-fv)
引用此论文的Space0
没有Space链接此论文
请在Space README.md中引用arxiv.org/abs/2606.01008以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
请将此论文添加到收藏 (https://huggingface.co/new-collection)中以从此页面链接。
相似文章
你的AI代理绿色测试套件实际证明了什么
本文认为,由于输入空间无限且行为非确定性,AI代理使用固定输入和预期输出的标准测试套件并不充分,主张应采用基于属性的测试方法。
Lean4Agent: 代理工作流与轨迹的形式化建模与验证
介绍Lean4Agent,一个使用Lean4对代理工作流和轨迹进行形式化建模与验证的框架,展示了在SWE-Bench和ELAIP-Bench上的性能提升。
Specula:扩展形式化规范以实现系统代码的自主模型检查(13分钟阅读)
Specula是一个代理系统,能够自动从代码推导TLA+规范,运行模型检查以发现并发错误,并通过集成测试复现这些错误。它在48个开源分布式和并发系统中发现了249个错误,展示了形式化验证的显著扩展。
@rohanpaul_ai:GitHub 最近发布了这个仓库 SpecKit,一个开源工具包,用于修复 vibe coding 的一个大弱点:即 AI 经常……
GitHub 发布了 SpecKit,这是一个开源工具包,通过强制采用规范优先的工作流程来解决 AI 编码的一个弱点,将产品规格转化为 AI 代理的可执行开发合同。
大规模安全测试LLM智能体:从风险发现到基于证据的验证
本文介绍了Vera,一个面向LLM智能体的端到端自动化安全测试框架,它结合了文献驱动的风险发现、安全案例的组合式构建以及基于证据的验证。在四个智能体框架上的评估揭示了显著的安全缺陷,在多通道攻击下平均攻击成功率高达93.9%,同时发布了包含1600个可执行安全案例的Vera-Bench。