@ericzakariasson: 这是Grok 4.7的模型卡。与4.6相比,有几个显著的提升:- Terminal-Bench: 20.3% → 38.0% - SWE-Marathon: …

X AI KOLs Following 模型

摘要

这条推文分享了Grok 4.7的模型卡,重点介绍了在Terminal-Bench、SWE-Marathon和HealthBench Pro等基准测试中相比4.6版本的显著性能提升,同时价格保持不变。

这是Grok 4.7的模型卡。与4.6相比,有几个显著的提升:- Terminal-Bench: 20.3% → 38.0% - SWE-Marathon: 31.9% → 46.0% - HealthBench Pro: 48.5% → 56.7% - Legal Agent: 15.8% → 19.6% - EEBench: 60.0% → 66.0%,与4.6价格相同! https://media.x.ai/v1/website/4p7card-5eccc980.pdf…
查看原文
查看缓存全文

缓存时间: 2026/09/22 09:47

以下是 Grok 4.7 模型的介绍卡。与 4.6 版本相比,一些显著提升的性能数据如下:

  • Terminal-Bench:20.3% → 38.0%
  • SWE-Marathon:31.9% → 46.0%
  • HealthBench Pro:48.5% → 56.7%
  • Legal Agent:15.8% → 19.6%
  • EEBench:60.0% → 66.0% 价格与 4.6 版本相同! https://media.x.ai/v1/website/4p7card-5eccc980.pdf

来源:https://media.x.ai/v1/website/4p7card-5eccc980.pdf

相似文章

Grok 4.7 基准测试

Reddit r/singularity

本文可能讨论了 Grok 4.7 AI 模型的基准测试结果,比较了其在不同任务上的性能。

@elonmusk: Grok 4.7 排名上升

X AI KOLs Following

在识别并修复了弱点后,Grok 4.7 在 SWE-Together 排行榜上的排名上升,从而引发了所有模型试验的审计和更新。