GPT-6 Astra 在 ChessBench 上达到2,340 Elo,排名第11
摘要
ChessBench AI国际象棋排行榜已更新,包含了新模型的表现,例如 GPT-6 Astra 达到2,340 Elo并排名第11,以及Claude Fable 5.1和Gemini 3.8 Flash等其他模型。
暂无内容
查看缓存全文
缓存时间: 2026/09/11 08:59
# ChessBench —— AI 国际象棋排行榜
来源:https://chessbench-ai.github.io/
完整对局。比较各模型的竞技水平。
32个模型 · 7家厂商 · 更新于 2026年9月7日
## 排行榜
ChessBench 模型结果。点击模型查看详情。基准 Elo 衡量的是相对场上实力。单任务成本以美元计;破折号表示未报告。排名/模型/厂商
## 数字含义说明
衡量模型表现的相对场上指标,并非人类国际象棋等级分。
完整对局 模型进行完整棋局对弈。规划、战术计算、失误恢复能力和一致性均会影响结果。
基准 Elo 在 ChessBench 框架内计算的相对等级分。用于比较各测试模型之间的表现,并非人类国际象棋等级分的直接等价物。
单任务成本 报告的单任务成本(美元)。破折号(—)表示未报告成本,而非任务免费。点击列标题可按成本排序;缺失值将保留在末尾。
## ChessBench TV
完整对局,逐招回放。
存档 · 第001局
**Gemini 3\.1 Pro** Google 黑方
**GPT\-5\.6 Sol Pro** OpenAI 白方走棋
对局进程 0 / 59
使用←→键单步前进/后退,空格键自动播放以聚焦回放。
### GPT\-5\.6 Sol Pro 对阵 Gemini 3\.1 Pro
已结束 2026年7月12日 · 黑方认输
**1–0**
起始局面 · 白方走棋
## 基准更新
新结果、修正及产品说明。
2026年9月7日
### Gemini 3\.8 Flash (medium) 加入 ChessBench
Gemini 3\.8 Flash (medium) 已加入,基准 Elo 2300,ACPL 30\.74,单任务成本 $0\.08。现排名第13位,位于同样拥有2300基准 Elo 的 Gemini 3\.6 Flash 之后,GPT\-4\.5 之前。
查看排行榜 (https://chessbench-ai.github.io/#leaderboard)
2026年9月7日
### Claude Fable 5\.1 (Max) 加入 ChessBench;新增单任务成本
Claude Fable 5\.1 (Max) 作为独立模型加入,基准 Elo 2370,ACPL 18\.54,单任务成本 $44\.46。现排名第10位,位于 Gemma 4 和 GPT\-6 Pro (Max) 之间。
排行榜现已包含单任务成本。未报告的成本显示为破折号(—)。ACPL 和成本信息也可在模型详情中查看。
查看排行榜 (https://chessbench-ai.github.io/#leaderboard)
2026年9月5日
### GPT\-6 Pro (Max) 加入 ChessBench
GPT\-6 Pro (Max) 已加入 ChessBench,基准 Elo 2340。现排名第10位,位于 Gemma 4 和 Gemini 3\.6 Flash 之间。
排行榜现已涵盖七家厂商的30个模型。
查看排行榜 (https://chessbench-ai.github.io/#leaderboard)
2026年8月13日
### Gemini 3\.7 Flash (High) 加入 ChessBench
Gemini 3\.7 Flash (High) 已加入 ChessBench,基准 Elo 2230。现排名第17位,位于 MiniMax M3 和 ChatGPT 5\.4 Pro 之间。
排行榜将 GPT\-5\.6 Sol Pro (Max) 及其 Stealth Testing 检查点合并为单一条目排名第一,检查点的2650 Elo 作为次要信息显示。Claude Fable 5 (Max) 因此升至第二位。
查看排行榜 (https://chessbench-ai.github.io/#leaderboard)
2026年8月13日
### Grok 4\.6 (xhigh) 加入 ChessBench
Grok 4\.6 (xhigh) 已加入 ChessBench,基准 Elo 2480。该结果使其位列第7名,位于 Qwen 3\.8 Max 和 Claude Opus 5 (high) 之间,并成为当前赛场中实力最强的 xAI 模型。
查看排行榜 (https://chessbench-ai.github.io/#leaderboard)
2026年8月5日
### Qwen 3\.8 Max 加入 ChessBench
Qwen 3\.8 Max 加入,基准 Elo 2500。排名第6位,位于 Gemini 3\.1 Pro (High) 和 Grok 4\.6 (xhigh) 之间,并为厂商阵营引入阿里巴巴。
查看排行榜 (https://chessbench-ai.github.io/#leaderboard)
2026年7月26日
### Claude Opus 5 (high) 加入 ChessBench
Claude Opus 5 (high) 以2400基准 Elo 加入。与最初的 Opus 5 配置相比,这代表了棋力水平的显著提升,使该条目更接近当前前沿水平。
查看排行榜 (https://chessbench-ai.github.io/#leaderboard)
2026年7月24日
### Gemini Flash 新增及 Grok 4\.5 修正
Gemini 3\.6 Flash 以2300基准 Elo 加入,同时加入的还有基准 Elo 为2200的 Gemini 3\.5 Flash\-Lite。Flash\-Lite 的基准 Elo 较低,是因为出现非法着法及数次快速终局影响了对局结果。
Grok 4\.5 在发现原始评估存在错误后重新进行了基准测试。其基准 Elo 从1457更改为1680。
查看排行榜 (https://chessbench-ai.github.io/#leaderboard)
2026年7月19日
### Claude Fable 5 (Max) 及 Kimi K3 (Max) 加入 ChessBench
来自 Anthropic 的 Claude Fable 5 (Max) 和来自 Moonshot AI 的 Kimi K3 (Max) 加入领先集团。Claude Fable 5 (Max) 以2640基准 Elo 位列第二,Kimi K3 (Max) 以2590基准 Elo 位列第四。
新增模型拓宽了榜单顶端的厂商多样性,并为排行榜增加了两个高强度参考点。
查看排行榜 (https://chessbench-ai.github.io/#leaderboard)
2026年7月12日
### 推出 ChessBench TV
ChessBench TV 在交互式棋盘上回放完整的模型对局,包含完整棋谱和播放控制。首场回放展示 GPT\-5\.6 Sol Pro 对阵 Gemini 3\.1 Pro 的对局。
观看第001局 (https://chessbench-ai.github.io/#tv)
相似文章
GPT-6 Astra
OpenAI 推出了 GPT-6 Astra,这是一个最先进的 AI 模型,在多个基准测试中获得高分,并在计算机使用、对齐和专业任务方面表现出色,即将向用户推出。
GPT-6 Astra 基准测试
本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。
@cline: GPT-6 Astra 已发布,在 Terminal-Bench 上位列第一,领先 Claude Fable 5.1 1.9%,后者仅两天前推出…
GPT-6 Astra 已发布,并在 Terminal-Bench 上名列前茅,以 1.9% 的优势超越 Claude Fable 5.1。它即将向 API 推出,并将与 Cline 集成。
GPT‑6 Astra
OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。
GPT-6 Astra
OpenAI发布GPT-6 Astra,这是其最强大的AI模型,适用于高级推理、软件工程和智能体工作流,具备异步工具调用和中途引导功能,并制定了分阶段推出计划。