Grok-4.5 在编码方面与 GPT-5.5-xhigh 相当,成本减半
摘要
Grok-4.5 实现了与 GPT-5.5-xhigh 相当的编码性能,而成本仅为后者的一半。
暂无内容
相似文章
@rohanpaul_ai: Grok 4.6 在代理循环效率上击败 GPT-5.6 Sol,在相同的3次构建中花费13.11美元对比20.18美元。Grok 4.6'…
文章报道了一项比较 Grok 4.6 和 GPT-5.6 Sol 在编码任务代理循环效率的实验,显示 Grok 4.6 更具成本效益,模型调用更少且提示缓存有效。
Grok 4.6 在 SimpleBench 上略胜 GPT 5.6 Sol Pro
据报道,Grok 4.6 在 SimpleBench 基准测试上表现优于 GPT 5.6 Sol Pro,标志着 AI 模型能力的一次显著转变。
@elonmusk: Grok Build
Grok 4.5 配合 Grok Build 在 SWE-Atlas-QnA 基准测试中以 84 分获得第一名,与 GPT-5.6 Codex 持平,并超越其他编码设置。
@gregpr07: Grok 4.6 性能与 Opus 5 差距在1分以内,成本降低约40%。在7次运行中,解决了106个高难度浏览器任务中的105个。还有一点 …
Grok 4.6 在成本降低40%的条件下,性能接近Opus 5,成功解决106个高难度浏览器任务中的105个,预示着通过强化学习可能实现进一步突破。
我们让 Grok 4.5、GPT-5.5 和 Claude 构建了相同的应用
本文对 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Claude Fable 5 进行了基准测试,让每个模型根据单一提示构建三个交互式应用(3D 魔方、粒子重力沙箱、打砖块游戏),比较它们的一次性编码能力。