GPT-6.1 sol (max) 在 FrontierMath Tier 4 基准测试中取得 100% 的成绩

Reddit r/singularity 模型

摘要

OpenAI 的 GPT-6.1 sol (max) 在 Epoch AI 的 FrontierMath Tier 4 v2 基准测试中取得 100% 的成绩,登上该基准的榜首。

https://epoch.ai/benchmarks/frontiermath-tier-4-v2?view=graph&tab=leaderboard
查看原文

相似文章

GPT 5.6 Sol 基准测试

Reddit r/singularity

GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。

评估AI执行科研任务的能力

OpenAI Blog

OpenAI推出FrontierScience,这是一个新的基准测试,用于衡量人工智能在物理、化学和生物学领域的专家级科学能力。GPT-5.2在奥林匹克式任务中达到77%,在研究型任务中达到25%。该论文提供了早期证据,表明GPT-5能显著加速真实的科学工作流程,将工作周期从数周缩短至数小时,同时建立了度量标准,以追踪朝着AI加速科学研究的进展。