@gregpr07: Grok 4.6 性能与 Opus 5 差距在1分以内,成本降低约40%。在7次运行中,解决了106个高难度浏览器任务中的105个。还有一点 …
摘要
Grok 4.6 在成本降低40%的条件下,性能接近Opus 5,成功解决106个高难度浏览器任务中的105个,预示着通过强化学习可能实现进一步突破。
Grok 4.6 性能与 Opus 5 差距在1分以内,成本降低约40%。
在7次运行中,解决了106个高难度浏览器任务中的105个。
稍加强化学习在高难度网络任务上的应用,Grok 4.7 就能成为第一 ... 👀 https://t.co/BOq2ry8vEN
查看缓存全文
缓存时间: 2026/08/17 08:24
Grok 4.6 与 Opus 5 的性能差距在1分以内,但成本降低了约40%。
经过7次运行测试,它在106项高难度浏览器任务中成功解决了105项。 只要在复杂网页任务上再进行一些强化训练,Grok 4.7 就能跃居第一… 👀 https://t.co/BOq2ry8vEN
相似文章
@browser_use: Grok 4.7 会成为 SOTA 吗?
文章讨论了 Grok 4.6 的性能,在基准测试中接近 Opus 5 且成本更低,并推测通过在浏览器任务上进行更多强化学习,Grok 4.7 可能成为最先进的。
@rohanpaul_ai: Grok 4.6 在代理循环效率上击败 GPT-5.6 Sol,在相同的3次构建中花费13.11美元对比20.18美元。Grok 4.6'…
文章报道了一项比较 Grok 4.6 和 GPT-5.6 Sol 在编码任务代理循环效率的实验,显示 Grok 4.6 更具成本效益,模型调用更少且提示缓存有效。
@stanine: 嗯。今天我们用Grok 4.6跑了2100次评分测试。和4.5相比,通过率从87.3%退步到85.9%,并且nea…
本文报告了Grok 4.6相对于4.5的性能退化,通过率降低且延迟增加,对实际业务任务产生了影响。
Grok-4.5 在编码方面与 GPT-5.5-xhigh 相当,成本减半
Grok-4.5 实现了与 GPT-5.5-xhigh 相当的编码性能,而成本仅为后者的一半。
@elonmusk: Grok 4.5 在现实工作中表现卓越
Elon Musk 推荐 Grok 4.5 用于实际任务,引用 Ramp 测试:Grok 在 15 万张商业发票上实现了最高的完美抽取率。