NanoGPT 速跑前沿

Hacker News Top 论文

摘要

本文报道了在nanoGPT优化器速度竞赛中,对18个前沿AI模型进行自主测试的比较,详细阐述了它们在缩小与人类记录差距方面的表现。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/23 01:35

# NanoGPT 速度冲刺前沿探索 来源:https://www.primeintellect.ai/research/nanogpt-speedrun 我们在18个前沿模型上进行了153次自主运行,以推进nanoGPT优化器的速度冲刺。 [阅读博客](https://www.primeintellect.ai/blog/measuring-autonomous-research) **人类记录差距弥补比例** 人类记录 | 100% | 0% | 20% | 40% | 60% | 80% | 100% --- | --- | --- | --- | --- | --- | --- | --- 0天 | 1天 | 2天 | 4天 | 7天 | 9天 | Fable 5 | Opus 5 | Kimi K3 · prime-agent | Kimi K3 | Opus 4.8 | GPT-5.6 Sol | GPT-5.6 Sol Pro | Sonnet 5 | GPT-5.6 Luna | Grok 4.5 | Qwen3.8 Max | GLM 5.2 | DeepSeek V4 Pro | GPT-5.6 Terra | Grok 4.6 | Muse Spark 1.2 | Muse Spark 1.1 | GPT-5.5 | Kimi K2.7 | **代理时间(天)** **人类记录差距弥补比例** 0% | 20% | 40% | 60% | 80% | 100% --- | --- | --- | --- | --- | --- 0天 | 1天 | 2天 | 4天 | 7天 | 9天 | Fable 5 | Opus 5 | Kimi K3 · prime-agent | Kimi K3 | Opus 4.8 | GPT-5.6 Sol | GPT-5.6 Sol Pro | Sonnet 5 | GPT-5.6 Luna | Grok 4.5 | Qwen3.8 Max | GLM 5.2 | DeepSeek V4 Pro | GPT-5.6 Terra | Grok 4.6 | Muse Spark 1.2 | Muse Spark 1.1 | GPT-5.5 | Kimi K2.7 | **代理时间(天)** **所有模型** *各模型已验证的最佳结果* 1 | **Fable 5** | 2,726 | 81.7% 已弥补 | claude-code · high@24H | 3,010 | 8.7天 2 | **Opus 5** | 2,920 | 53.6% 已弥补 | claude-code · max@24H | 3,045 | 2.9天 3 | **Kimi K3** | 2,930 | 52.2% 已弥补 | prime-agent · max@24H | 3,125 | 3.6天 4 | **Kimi K3** | 2,974 | 45.8% 已弥补 | kimi-code · max@24H | 3,135 | 5.1天 5 | **Opus 4.8** | 3,018 | 39.4% 已弥补 | claude-code · max@24H | 3,180 | 3.0天 6 | **GPT-5.6 Sol** | 3,042 | 35.9% 已弥补 | codex · xhigh@24H | 3,160 | 6.1天 7 | **GPT-5.6 Sol Pro** | 3,058 | 33.6% 已弥补 | codex · xhigh@24H | 3,100 | 3.4天 8 | **Sonnet 5** | 3,105 | 26.8% 已弥补 | claude-code · max@24H | 3,120 | 2.0天 9 | **GPT-5.6 Luna** | 3,110 | 26.1% 已弥补 | codex · xhigh@24H | 3,170 | 1.9天 10 | **Grok 4.5** | 3,120 | 24.6% 已弥补 | grok-cli · xhigh@24H | 3,160 | 2.7天 11 | **Qwen3.8 Max** | 3,120 | 24.6% 已弥补 | qwen-code · max@24H | 3,225 | 1.9天 12 | **GLM 5.2** | 3,150 | 20.3% 已弥补 | pi · high@24H | 3,200 | 1.8天 13 | **DeepSeek V4 Pro** | 3,205 | 12.3% 已弥补 | claude-code · max@24H | 3,205 | 1.1天 14 | **GPT-5.6 Terra** | 3,214 | 11.0% 已弥补 | codex · xhigh@24H | 3,214 | 1.1天 15 | **Grok 4.6** | 3,220 | 10.1% 已弥补 | grok-cli · xhigh | — | 0.6天 16 | **Muse Spark 1.2** | 3,230 | 8.7% 已弥补 | muse-code · xhigh | — | 0.6天 17 | **Muse Spark 1.1** | 3,232 | 8.4% 已弥补 | pi · max@24H | 3,240 | 3.7天 18 | **GPT-5.5** | 3,234 | 8.1% 已弥补 | codex · xhigh@24H | 3,234 | 1.1天 19 | **Kimi K2.7** | 3,240 | 7.2% 已弥补 | kimi-code · max@24H | 3,240 | 1.6天 20 | **GLM 5.3** | — | 无记录 | claude-code · xhigh | — | — | 模型 | 运行工具 | 轨迹数 | | | | | | | |---|---|---|---|---|---|---|---|---| | Fable 5 | claude-code·high | 2,726 | 81.7% | 3,010 | 800M | 1.1M | 81 | 13k | 8.7 | | Opus 5 | claude-code·max | 2,920 | 53.6% | 3,045 | 183M | 690k | 292 | 40 | 12.9 | | Kimi K3 | prime-agent·max | 2,930 | 52.2% | 3,125 | 112M | 2.2M | — | 488 | 3.6 | | Kimi K3 | kimi-code·max | 2,974 | 45.8% | 3,135 | 682M | 1.4M | 71 | 34k | 5.1 | | Opus 4.8 | claude-code·max | 3,018 | 39.4% | 3,180 | 318M | 2.3M | 42 | 72k | 3.0 | | GPT-5.6 Sol | codex·xhigh | 3,042 | 35.9% | 3,160 | 2.9B | 2.2M | 96 | 328k | 6.1 | | GPT-5.6 Sol Pro | codex·xhigh | 3,058 | 33.6% | 3,100 | 1.2B | 4.6M | 50 | 97k | 3.4 | | Sonnet 5 | claude-code·max | 3,105 | 26.8% | 3,120 | 998M | 2.1M | 21 | 32k | 2.0 | | GPT-5.6 Luna | codex·xhigh | 3,110 | 26.1% | 3,170 | 894M | 888k | 36 | 212k | 1.9 | | Grok 4.5 | grok-cli·xhigh | 3,120 | 24.6% | 3,160 | 46M | 385k | 399 | 4k | 2.7 | | Qwen3.8 Max | qwen-code·max | 3,120 | 24.6% | 3,225 | 216M | 629k | 31 | 2866 | 1.9 | | GLM 5.2 | pi·high | 3,150 | 20.3% | 3,200 | 57M | 1.7M | 19 | 41k | 1.8 | | DeepSeek V4 Pro | claude-code·max | 3,205 | 12.3% | 3,205 | 26M | 319k | 18 | 9309 | 1.1 | | GPT-5.6 Terra | codex·xhigh | 3,214 | 11.0% | 3,214 | 417M | 298k | 15 | 43k | 1.1 | | Grok 4.6 | grok-cli·xhigh | 3,220 | 10.1% | — | 27M | 346k | 97 | 691 | 0.6 | | Muse Spark 1.2 | muse-code·xhigh | 3,230 | 8.7% | — | 41M | 910k | 56 | 7240 | 0.6 | | Muse Spark 1.1 | pi·max | 3,232 | 8.4% | 3,240 | 122M | 1.6M | 48 | 92k | 3.7 | | GPT-5.5 | codex·xhigh | 3,234 | 8.1% | 3,234 | 70M | 77k | 18 | 5614 | 1.1 | | Kimi K2.7 | kimi-code·max | 3,240 | 7.2% | 3,240 | 160M | 763k | 18 | 73k | 1.6 | | GLM 5.3 | claude-code·xhigh | — | — | — | — | — | — | — | — | ## 等预算对比 为每个模型的最佳最终运行分配相同的资源预算,并比较其在该预算内达到的最佳已验证记录。 6小时 | 24小时预算 | 9天 --- | --- | --- 模型 | 记录 | 人类 2,600 | 基准 | 3,290 *灰色运行在所选预算之前结束* 打开轨迹库,探索41个精选的完整代理运行轨迹,包含工具调用、子代理和思维草稿。

相似文章

发布 GPT-5.4 mini 和 nano

OpenAI Blog

OpenAI 发布了 GPT-5.4 mini 和 nano,它们是 GPT-5.4 的更小、更快的变体,专为高吞吐量工作负载设计,在编码、推理和多模态理解方面有显著改进,同时保持 2 倍以上的速度提升。