proof-verification

标签

Cards List
#proof-verification

OpenAI刚刚宣称了一项重大的数学发现。部分学术界人士质疑其正当性。

Wired · 2天前 缓存

OpenAI声称发现了一个由AI生成的纳维-斯托克斯方程解,这是一个有200年历史的数学问题,但学术界人士正在争议其归属,并指责OpenAI在得知他们的工作后仓促行事。

0 人收藏 0 人点赞
#proof-verification

RePro:基于证明验证的基准重写,用于可靠评估LLM的数学问题求解能力

arXiv cs.CL · 2026-09-02 缓存

RePro将面向Lean的神经自动化定理证明器集成到基准重写中,以确保问题有效性和答案正确性,从而可靠评估LLMs在数学问题求解中的表现。

0 人收藏 0 人点赞
#proof-verification

AdvancedMathBench: 面向高级数学证明生成与验证的基准套件

Hugging Face Daily Papers · 2026-07-13 缓存

AdvancedMathBench是一个新的基准套件,用于评估大语言模型在高级数学证明生成与验证方面的性能。它包含用于生成的ProverBench和用于验证的VerifierBench,表明当前模型如GPT-5.5-xhigh仅取得了有限的性能。

0 人收藏 0 人点赞
#proof-verification

描述人类与AI协作进行证明形式化的初期工作流程

arXiv cs.AI · 2026-06-04 缓存

来自牛津、剑桥、MIT、CMU等机构的研究人员开展了一项混合方法研究,考察人们如何将AI工具融入数学证明形式化工作流程。研究发现,借助AI辅助时,参与者的形式化准确率普遍更高,同时他们倾向于在证明发现过程中保持人类对高层决策的主导权。

0 人收藏 0 人点赞
#proof-verification

RMA:面向研究级数学问题的智能体系统

arXiv cs.AI · 2026-05-25 缓存

Research Math Agents (RMA) 是一个用于研究级数学问题自动推理的智能体框架,在 First Proof 基准测试中取得最先进结果,解决了10个问题中的8个,优于 GPT-5.2R 和 Aletheia 等强基线。

0 人收藏 0 人点赞
#proof-verification

极小形式主义下基于证明的LLM推理能力压力测试

Hugging Face Daily Papers · 2026-04-07 缓存

ProofGrid是一个基准测试套件,通过使用极小形式化符号的机器可验证证明来评估LLM推理,包含证明编写、检查与补全任务,揭示了进展与尚存局限,包括认知不稳定性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈