@BenjaminDEKR: Grok 在 LMArena 上仅保持了一个月的榜首位置——从2025年11月17日到12月22日。此后没有任何 Grok 模型再次登顶……
摘要
Grok 的最新模型 grok-4.6-high 在 LMArena 文本排名中位列第43,在网络开发排名中位列第7,未能重新夺回 Grok 在2025年12月曾占据的榜首位置。
Grok 在 LMArena 上仅保持了一个月的榜首位置——从2025年11月17日到12月22日。
自那以后,近八个月来,没有任何 Grok 模型重新回到榜首。
今天发布的模型 grok-4.6-high 目前在 LMArena 文本排名中位列第43。
它在 LMArena webdev 排名中位列第7,低于 Kimi K3 和 Qwen 3.8。
查看缓存全文
缓存时间: 2026/08/14 01:26
Grok 在 LMArena 上保持榜首仅一个月——从2025年11月17日到12月22日。
自那以后,已经过去近八个月,没有任何 Grok 模型重返榜首。
今天发布的模型 grok-4.6-high 目前在 LMArena 文本排名中位列第43名。
在 LMArena webdev 中它排名第7,低于 Kimi K3 和 Qwen 3.8。
相似文章
@BenjaminDEKR: 很多人表现得好像 Grok 4.6 刚刚击败了 Anthropic 和 OpenAI,但实际上并没有。Grok 4.6 的数字显示…
对 Grok 4.6 基准测试结果的评论,认为 xAI 并未击败 Anthropic 或 OpenAI,但仍在中上游区间保持竞争力。
@elonmusk: Grok 4.5 在 Long-Horizon Terminal-Bench 上排名第一
埃隆·马斯克宣布,Grok 4.5 在 Long-Horizon Terminal-Bench 基准测试中排名第一,超越了之前的模型。
@elonmusk:Grok 4.6 在 CursorBench 真实编码测试中排名第一
Elon Musk 宣布,Grok 4.6 在 CursorBench 真实编码测试中排名第一,超越其他 AI 模型,展现出高效率。
@elonmusk: Grok Build
Grok 4.5 配合 Grok Build 在 SWE-Atlas-QnA 基准测试中以 84 分获得第一名,与 GPT-5.6 Codex 持平,并超越其他编码设置。
Grok 4.6
讨论了Grok 4.6在图表上的位置,并询问对Grok进展的看法。