@ericzakariasson: 这是Grok 4.7的模型卡。与4.6相比,有几个显著的提升:- Terminal-Bench: 20.3% → 38.0% - SWE-Marathon: …
摘要
这条推文分享了Grok 4.7的模型卡,重点介绍了在Terminal-Bench、SWE-Marathon和HealthBench Pro等基准测试中相比4.6版本的显著性能提升,同时价格保持不变。
这是Grok 4.7的模型卡。与4.6相比,有几个显著的提升:- Terminal-Bench: 20.3% → 38.0% - SWE-Marathon: 31.9% → 46.0% - HealthBench Pro: 48.5% → 56.7% - Legal Agent: 15.8% → 19.6% - EEBench: 60.0% → 66.0%,与4.6价格相同! https://media.x.ai/v1/website/4p7card-5eccc980.pdf…
查看缓存全文
缓存时间: 2026/09/22 09:47
以下是 Grok 4.7 模型的介绍卡。与 4.6 版本相比,一些显著提升的性能数据如下:
- Terminal-Bench:20.3% → 38.0%
- SWE-Marathon:31.9% → 46.0%
- HealthBench Pro:48.5% → 56.7%
- Legal Agent:15.8% → 19.6%
- EEBench:60.0% → 66.0% 价格与 4.6 版本相同! https://media.x.ai/v1/website/4p7card-5eccc980.pdf
来源:https://media.x.ai/v1/website/4p7card-5eccc980.pdf
相似文章
@ericzakariasson: Grok 4.7 已发布,这是我们目前最好的模型!在 Cursor、Grok Build、API 或任何你获取令牌的地方试试看!…
Grok 4.7 作为 Grok 4.6 的改进版本发布,在相同价格和速度下提供更好的性能,并且可以通过各种平台访问。
@elonmusk: 有趣。对于一个小模型来说,Grok 4.7 的表现相当不错。
Elon Musk 评论了 Grok 4.7 在 Next.js 评估中的竞争性表现,指出与其他顶级模型相比,它具有成本效益。
Grok 4.7 基准测试
本文可能讨论了 Grok 4.7 AI 模型的基准测试结果,比较了其在不同任务上的性能。
@elonmusk: Grok 4.7 排名上升
在识别并修复了弱点后,Grok 4.7 在 SWE-Together 排行榜上的排名上升,从而引发了所有模型试验的审计和更新。
@stanine: 嗯。今天我们用Grok 4.6跑了2100次评分测试。和4.5相比,通过率从87.3%退步到85.9%,并且nea…
本文报告了Grok 4.6相对于4.5的性能退化,通过率降低且延迟增加,对实际业务任务产生了影响。