NanoGPT 速跑前沿
摘要
本文报道了在nanoGPT优化器速度竞赛中,对18个前沿AI模型进行自主测试的比较,详细阐述了它们在缩小与人类记录差距方面的表现。
暂无内容
查看缓存全文
缓存时间: 2026/08/23 01:35
# NanoGPT 速度冲刺前沿探索
来源:https://www.primeintellect.ai/research/nanogpt-speedrun
我们在18个前沿模型上进行了153次自主运行,以推进nanoGPT优化器的速度冲刺。
[阅读博客](https://www.primeintellect.ai/blog/measuring-autonomous-research)
**人类记录差距弥补比例**
人类记录 | 100% | 0% | 20% | 40% | 60% | 80% | 100%
--- | --- | --- | --- | --- | --- | --- | ---
0天 | 1天 | 2天 | 4天 | 7天 | 9天 | Fable 5 | Opus 5 | Kimi K3 · prime-agent | Kimi K3 | Opus 4.8 | GPT-5.6 Sol | GPT-5.6 Sol Pro | Sonnet 5 | GPT-5.6 Luna | Grok 4.5 | Qwen3.8 Max | GLM 5.2 | DeepSeek V4 Pro | GPT-5.6 Terra | Grok 4.6 | Muse Spark 1.2 | Muse Spark 1.1 | GPT-5.5 | Kimi K2.7 | **代理时间(天)**
**人类记录差距弥补比例**
0% | 20% | 40% | 60% | 80% | 100%
--- | --- | --- | --- | --- | ---
0天 | 1天 | 2天 | 4天 | 7天 | 9天 | Fable 5 | Opus 5 | Kimi K3 · prime-agent | Kimi K3 | Opus 4.8 | GPT-5.6 Sol | GPT-5.6 Sol Pro | Sonnet 5 | GPT-5.6 Luna | Grok 4.5 | Qwen3.8 Max | GLM 5.2 | DeepSeek V4 Pro | GPT-5.6 Terra | Grok 4.6 | Muse Spark 1.2 | Muse Spark 1.1 | GPT-5.5 | Kimi K2.7 | **代理时间(天)**
**所有模型**
*各模型已验证的最佳结果*
1 | **Fable 5** | 2,726 | 81.7% 已弥补
| claude-code · high@24H | 3,010 | 8.7天
2 | **Opus 5** | 2,920 | 53.6% 已弥补
| claude-code · max@24H | 3,045 | 2.9天
3 | **Kimi K3** | 2,930 | 52.2% 已弥补
| prime-agent · max@24H | 3,125 | 3.6天
4 | **Kimi K3** | 2,974 | 45.8% 已弥补
| kimi-code · max@24H | 3,135 | 5.1天
5 | **Opus 4.8** | 3,018 | 39.4% 已弥补
| claude-code · max@24H | 3,180 | 3.0天
6 | **GPT-5.6 Sol** | 3,042 | 35.9% 已弥补
| codex · xhigh@24H | 3,160 | 6.1天
7 | **GPT-5.6 Sol Pro** | 3,058 | 33.6% 已弥补
| codex · xhigh@24H | 3,100 | 3.4天
8 | **Sonnet 5** | 3,105 | 26.8% 已弥补
| claude-code · max@24H | 3,120 | 2.0天
9 | **GPT-5.6 Luna** | 3,110 | 26.1% 已弥补
| codex · xhigh@24H | 3,170 | 1.9天
10 | **Grok 4.5** | 3,120 | 24.6% 已弥补
| grok-cli · xhigh@24H | 3,160 | 2.7天
11 | **Qwen3.8 Max** | 3,120 | 24.6% 已弥补
| qwen-code · max@24H | 3,225 | 1.9天
12 | **GLM 5.2** | 3,150 | 20.3% 已弥补
| pi · high@24H | 3,200 | 1.8天
13 | **DeepSeek V4 Pro** | 3,205 | 12.3% 已弥补
| claude-code · max@24H | 3,205 | 1.1天
14 | **GPT-5.6 Terra** | 3,214 | 11.0% 已弥补
| codex · xhigh@24H | 3,214 | 1.1天
15 | **Grok 4.6** | 3,220 | 10.1% 已弥补
| grok-cli · xhigh | — | 0.6天
16 | **Muse Spark 1.2** | 3,230 | 8.7% 已弥补
| muse-code · xhigh | — | 0.6天
17 | **Muse Spark 1.1** | 3,232 | 8.4% 已弥补
| pi · max@24H | 3,240 | 3.7天
18 | **GPT-5.5** | 3,234 | 8.1% 已弥补
| codex · xhigh@24H | 3,234 | 1.1天
19 | **Kimi K2.7** | 3,240 | 7.2% 已弥补
| kimi-code · max@24H | 3,240 | 1.6天
20 | **GLM 5.3** | — | 无记录
| claude-code · xhigh | — | —
| 模型 | 运行工具 | 轨迹数 | | | | | | |
|---|---|---|---|---|---|---|---|---|
| Fable 5 | claude-code·high | 2,726 | 81.7% | 3,010 | 800M | 1.1M | 81 | 13k | 8.7 |
| Opus 5 | claude-code·max | 2,920 | 53.6% | 3,045 | 183M | 690k | 292 | 40 | 12.9 |
| Kimi K3 | prime-agent·max | 2,930 | 52.2% | 3,125 | 112M | 2.2M | — | 488 | 3.6 |
| Kimi K3 | kimi-code·max | 2,974 | 45.8% | 3,135 | 682M | 1.4M | 71 | 34k | 5.1 |
| Opus 4.8 | claude-code·max | 3,018 | 39.4% | 3,180 | 318M | 2.3M | 42 | 72k | 3.0 |
| GPT-5.6 Sol | codex·xhigh | 3,042 | 35.9% | 3,160 | 2.9B | 2.2M | 96 | 328k | 6.1 |
| GPT-5.6 Sol Pro | codex·xhigh | 3,058 | 33.6% | 3,100 | 1.2B | 4.6M | 50 | 97k | 3.4 |
| Sonnet 5 | claude-code·max | 3,105 | 26.8% | 3,120 | 998M | 2.1M | 21 | 32k | 2.0 |
| GPT-5.6 Luna | codex·xhigh | 3,110 | 26.1% | 3,170 | 894M | 888k | 36 | 212k | 1.9 |
| Grok 4.5 | grok-cli·xhigh | 3,120 | 24.6% | 3,160 | 46M | 385k | 399 | 4k | 2.7 |
| Qwen3.8 Max | qwen-code·max | 3,120 | 24.6% | 3,225 | 216M | 629k | 31 | 2866 | 1.9 |
| GLM 5.2 | pi·high | 3,150 | 20.3% | 3,200 | 57M | 1.7M | 19 | 41k | 1.8 |
| DeepSeek V4 Pro | claude-code·max | 3,205 | 12.3% | 3,205 | 26M | 319k | 18 | 9309 | 1.1 |
| GPT-5.6 Terra | codex·xhigh | 3,214 | 11.0% | 3,214 | 417M | 298k | 15 | 43k | 1.1 |
| Grok 4.6 | grok-cli·xhigh | 3,220 | 10.1% | — | 27M | 346k | 97 | 691 | 0.6 |
| Muse Spark 1.2 | muse-code·xhigh | 3,230 | 8.7% | — | 41M | 910k | 56 | 7240 | 0.6 |
| Muse Spark 1.1 | pi·max | 3,232 | 8.4% | 3,240 | 122M | 1.6M | 48 | 92k | 3.7 |
| GPT-5.5 | codex·xhigh | 3,234 | 8.1% | 3,234 | 70M | 77k | 18 | 5614 | 1.1 |
| Kimi K2.7 | kimi-code·max | 3,240 | 7.2% | 3,240 | 160M | 763k | 18 | 73k | 1.6 |
| GLM 5.3 | claude-code·xhigh | — | — | — | — | — | — | — | — |
## 等预算对比
为每个模型的最佳最终运行分配相同的资源预算,并比较其在该预算内达到的最佳已验证记录。
6小时 | 24小时预算 | 9天
--- | --- | ---
模型 | 记录 | 人类
2,600 | 基准 | 3,290
*灰色运行在所选预算之前结束*
打开轨迹库,探索41个精选的完整代理运行轨迹,包含工具调用、子代理和思维草稿。
相似文章
@eliebakouch: 我们让 Opus 4.7 和 GPT 5.5 在 nanoGPT 优化器快速运行上运行:约1万次运行,14k H200小时,239亿个token。Opus 达到2…
AI智能体(Opus 4.7 和 GPT 5.5/Codex)自主优化了 nanoGPT 快速运行任务,以2930步的新记录超越了人类基线。博客详细介绍了它们的搜索方法、失败案例,并发布了所有运行数据和代码。
@eliebakouch: 将在 @aiDotEngineer 上谈论自动化AI研究,我们认为前沿模型需要合适的环境来...
作者将在 aiDotEngineer 上演讲,探讨如何利用像 nanogpt 这样的速通方式来评估 AI 研究能力。
@auroter: Frontier AI 简直脑死亡。GPT5.5 xHigh 在 Codex 中认为我应该使用张量并行来部署 Qwen 3.6 27B 在我的系统上…
作者批评 Frontier AI(GPT5.5 xHigh)错误地建议对一个能单 GPU 容纳的模型使用张量并行,并宣布计划进行一场对决,比较多个 AI 模型(GPT5.5、Opus 4.8、Qwen 系列、Nemotron)在真实问题上的表现。
发布 GPT-5.4 mini 和 nano
OpenAI 发布了 GPT-5.4 mini 和 nano,它们是 GPT-5.4 的更小、更快的变体,专为高吞吐量工作负载设计,在编码、推理和多模态理解方面有显著改进,同时保持 2 倍以上的速度提升。
@IntologyAI:编码智能体能做研究吗?我们发布 NanoGPT-Bench,这是我们用来测试编码智能体在 AI 研发问题上的一项内部评估…
IntologyAI 发布了 NanoGPT-Bench,这是一个用于评估编码智能体在 AI 研发任务上表现的内部基准。当前的智能体仅恢复了人类进展的 9.3%,主要通过超参数调优,凸显了算法研究能力方面的差距。