@stanine: 嗯。今天我们用Grok 4.6跑了2100次评分测试。和4.5相比,通过率从87.3%退步到85.9%,并且nea…
摘要
本文报告了Grok 4.6相对于4.5的性能退化,通过率降低且延迟增加,对实际业务任务产生了影响。
查看缓存全文
缓存时间: 2026/08/15 01:49
嗯,今天我们使用Grok 4.6完成了2100次评分测试。与4.5版本相比,通过率从87.3%回退至85.9%,中位延迟时间几乎翻倍(71秒→131秒)。Grok 4.6还出现了更多报错(提示“发生错误“),拒绝回答一些常规问题(例如“销售部门中谁有权访问Google Workspace“),甚至返回不完整的结果却声称成功(实际仅返回了54%的要求字段,却宣称达到100%)。
这可能与提示词调优有关,但感觉我们在处理日常商业任务的模型应用上已接近帕累托前沿(至少目前如此)。
详情请阅读原文了解RipplingBench所代表的数据形态与任务特征——内容非常实用。
Matt MacInnis (@stanine): 新进展:我们对开源模型和实验室模型进行了约2100次评分测试,发现一些重大发现。Grok(@spacexai)在性价比方面表现领先,GLM(@Zai_org)则与前沿模型极为接近。我猜这就是为什么各家“实验室“都感到紧张的原因…
相似文章
@gregpr07: Grok 4.6 性能与 Opus 5 差距在1分以内,成本降低约40%。在7次运行中,解决了106个高难度浏览器任务中的105个。还有一点 …
Grok 4.6 在成本降低40%的条件下,性能接近Opus 5,成功解决106个高难度浏览器任务中的105个,预示着通过强化学习可能实现进一步突破。
@browser_use: Grok 4.7 会成为 SOTA 吗?
文章讨论了 Grok 4.6 的性能,在基准测试中接近 Opus 5 且成本更低,并推测通过在浏览器任务上进行更多强化学习,Grok 4.7 可能成为最先进的。
@elonmusk: Grok 4.6 是一个重大改进
Elon Musk 宣布 Grok 4.6 相比之前的版本有了重大改进。
@rohanpaul_ai: Grok 4.6 在代理循环效率上击败 GPT-5.6 Sol,在相同的3次构建中花费13.11美元对比20.18美元。Grok 4.6'…
文章报道了一项比较 Grok 4.6 和 GPT-5.6 Sol 在编码任务代理循环效率的实验,显示 Grok 4.6 更具成本效益,模型调用更少且提示缓存有效。
@ericzakariasson: 你目前对 Grok 4.6 怎么看?Grok 4.7 有哪些可以改进的地方?
用户正在征求对 Grok 4.6 的反馈,并询问对 Grok 4.7 的改进建议,这表明讨论是关于一个AI模型版本的。