@elonmusk: Grok 4.7 排名上升
摘要
在识别并修复了弱点后,Grok 4.7 在 SWE-Together 排行榜上的排名上升,从而引发了所有模型试验的审计和更新。
Grok 4.7 排名上升
查看缓存全文
缓存时间: 2026/09/24 00:12
Grok 4.7 在排名中有所提升
朱凯·赵(@zhuokaiz): 在修复了 Grok 4.7 暴露的薄弱环节后(感谢 Grok),我们对在 SWE-Together 排行榜上运行过的所有模型进行了相同行为的审计,重新运行了所有通过初审的试验,并更新了相关数据行。
以下是具体的变化。
我们扫描了所有模型的工具调用…
相似文章
@elonmusk: Grok 4.5 在 Long-Horizon Terminal-Bench 上排名第一
埃隆·马斯克宣布,Grok 4.5 在 Long-Horizon Terminal-Bench 基准测试中排名第一,超越了之前的模型。
@elonmusk:Grok 4.6 在 CursorBench 真实编码测试中排名第一
Elon Musk 宣布,Grok 4.6 在 CursorBench 真实编码测试中排名第一,超越其他 AI 模型,展现出高效率。
@elonmusk: Grok 模型改进
更新后的 Grok 模型 (0.5T) 更不懒惰、更自主、更准确;改进正在进行中。
@elonmusk: Grok Build
Grok 4.5 配合 Grok Build 在 SWE-Atlas-QnA 基准测试中以 84 分获得第一名,与 GPT-5.6 Codex 持平,并超越其他编码设置。
@elonmusk: Grok 4.6 是一个重大改进
Elon Musk 宣布 Grok 4.6 相比之前的版本有了重大改进。