@stanine: 嗯。今天我们用Grok 4.6跑了2100次评分测试。和4.5相比,通过率从87.3%退步到85.9%,并且nea…

X AI KOLs Following 新闻

摘要

本文报告了Grok 4.6相对于4.5的性能退化,通过率降低且延迟增加,对实际业务任务产生了影响。

嗯。今天我们用Grok 4.6跑了2100次评分测试。和4.5相比,通过率从87.3%下降到了85.9%,中位延迟几乎翻倍(从71秒到131秒)。Grok 4.6还出现了更多错误(显示“出了点问题”),拒绝回答良性问题(例如,“销售部门中谁有权限访问Google Workspace”),并且产生了不完整的输出但声称成功(只返回了54%的所需字段,却声称100%)。 这可能与提示调优有关,但感觉我们在日常业务任务上,对于某些模型来说,已经达到了帕累托前沿(至少目前是这样)。阅读原始帖子以了解RipplingBench所代表的数据和任务的形式;它非常实用。
查看原文
查看缓存全文

缓存时间: 2026/08/15 01:49

嗯,今天我们使用Grok 4.6完成了2100次评分测试。与4.5版本相比,通过率从87.3%回退至85.9%,中位延迟时间几乎翻倍(71秒→131秒)。Grok 4.6还出现了更多报错(提示“发生错误“),拒绝回答一些常规问题(例如“销售部门中谁有权访问Google Workspace“),甚至返回不完整的结果却声称成功(实际仅返回了54%的要求字段,却宣称达到100%)。

这可能与提示词调优有关,但感觉我们在处理日常商业任务的模型应用上已接近帕累托前沿(至少目前如此)。

详情请阅读原文了解RipplingBench所代表的数据形态与任务特征——内容非常实用。

Matt MacInnis (@stanine): 新进展:我们对开源模型和实验室模型进行了约2100次评分测试,发现一些重大发现。Grok(@spacexai)在性价比方面表现领先,GLM(@Zai_org)则与前沿模型极为接近。我猜这就是为什么各家“实验室“都感到紧张的原因…

相似文章

@browser_use: Grok 4.7 会成为 SOTA 吗?

X AI KOLs Timeline

文章讨论了 Grok 4.6 的性能,在基准测试中接近 Opus 5 且成本更低,并推测通过在浏览器任务上进行更多强化学习,Grok 4.7 可能成为最先进的。