标签
报道称,FrontierMath基准测试中的另一个开放问题已被解决,并附有麻省理工学院数学家Bjorn Poonen的研究论文链接。
OpenAI 未发布的模型 Astra 据称解决了十大开放数学难题,结果已通过 Lean 证书形式化验证,标志着 AI 数学推理能力的重大飞跃。
文章讨论了像Anthropic的Fable和ChatGPT这样的AI模型如何被数学家用来推翻著名的猜想,提出了一种在可验证答案的领域中新的野蛮智能范式。
一名Staff工程师分享了他通过倾听日常工作噪音、吸收问题和连接模式来找到有意义问题的方法,而不是孤立地进行战略思考。
Laguna S 2.1 是一款 120B 类模型,它通过使用长思考令牌解决了 Julia 中的一个复杂编码问题,给我留下了深刻印象。在一个内存受限的重排任务中,它的表现超过了 Qwen 模型。
VibeMathed是一个追踪借助AI解决的数学问题的网站,特别关注Erdős问题,包含验证状态和所用AI模型的引用。
本文展示了 GPT-5.5 解决纯泛函分析中精选问题的能力,超越了典型的组合数学与反例任务。
ChatGPT 5.6 Sol Pro 尝试解决包含全部 1,025 只宝可梦的无提示填字游戏,但在五次尝试中仅获得部分解答,最佳成绩为 33 分钟内答出 145 个。
GPT-5.6 Sol Ultra 已经解决了另一个 Erdős 问题(#793),使用了极其简短而优雅的构造,增强了 Erdős 使用的原始方法。
顶尖理论物理学家 Yuji Tachikawa 报告称,Claude Fable 解决了一个困扰他和合作者六个月的研究问题。
介绍了ProofCouncil,一个基于LLM的智能体,采用作者-评论家架构,能够自主解决开放数学问题。它在FirstProof挑战中取得了最佳表现,正确解决了10个问题中的6个,并在更广泛的30个开放问题集上显示出潜力。
一位数学家使用GPT-5.6和CodeX解决以前棘手的数学问题,显著加快了探索和技术工作的速度。
一位名为Bartosz的数学家使用OpenAI的GPT-5.6解决此前无法解决的数学问题。
面向人工智能时代的职业建议帖,认为有价值的工作涉及模型训练中无法评分的问题,强调时间、人际关系、声誉和发现问题的能力比死记硬背解决问题更重要。
OpenAI的研究表明,LLM能够解决九个开放数学问题,这些来自COLT、FOCS、交换代数和Erdős问题,采用包含GPT-5.5 Pro和Claude Opus 4.8的简单pipeline,并使用了Lean形式化验证。
本文介绍了 SD-GPS,一个求解器驱动的几何问题求解框架,利用求解器反馈引导的自动形式化和经过验证的定理提出,来克服神经符号系统中的瓶颈。