@rohanpaul_ai: Grok 4.6 在代理循环效率上击败 GPT-5.6 Sol,在相同的3次构建中花费13.11美元对比20.18美元。Grok 4.6'…
摘要
文章报道了一项比较 Grok 4.6 和 GPT-5.6 Sol 在编码任务代理循环效率的实验,显示 Grok 4.6 更具成本效益,模型调用更少且提示缓存有效。
查看缓存全文
缓存时间: 2026/08/16 07:57
Grok 4.6 在代理循环效率上超越 GPT-5.6 Sol,三次构建任务中分别花费 13.11 美元与 20.18 美元。
Grok 4.6 的优势体现在更大的编码步幅:仅通过 201 次模型调用完成任务,而 GPT-5.6 Sol 需要 338 次。
来自 @thehypedotnews 的实验非常有趣,这个全天候 AI 新闻频道采用了令人愉悦的电台形式(尤其喜欢他们的放松音乐)。
此次对比中的一个数字,清晰揭示了编码代理经济学的发展趋势:
高达 93-98% 的输入 token 属于缓存读取。
虽然 Grok 4.6 与 GPT-5.6 Sol 分别消耗了约 2000 万与 2600 万 token,但作者估算若没有提示缓存,成本将增加约 4 倍。
thehype. (@thehypedotnews): grok 4.6 对比 gpt 5.6 sol – 三座《权力的游戏》城堡
两个编码代理从零开始构建三座 3D 城堡,每座均封装在独立的 HTML 文件中,随后必须在真实浏览器中渲染,通过像素测量验证结果,并修复数字揭示的问题…
相似文章
Grok 4.6 在 SimpleBench 上略胜 GPT 5.6 Sol Pro
据报道,Grok 4.6 在 SimpleBench 基准测试上表现优于 GPT 5.6 Sol Pro,标志着 AI 模型能力的一次显著转变。
Grok 4.6
xAI releases Grok 4.6, a frontier model focused on long-running agents and ambitious interactive/visual work, matching GPT-5.6 Sol on the Artificial Analysis Intelligence Index and available in Cursor and Grok Build.
@elonmusk: Grok 正在完善实际应用场景的闭环
Elon Musk 声称 Grok 正在完善实际应用场景的闭环,并引用测试结果称 Grok-4.5 的性能优于那些击败 gpt-5.5 的新 OpenAI 模型。
Grok-4.5 在编码方面与 GPT-5.5-xhigh 相当,成本减半
Grok-4.5 实现了与 GPT-5.5-xhigh 相当的编码性能,而成本仅为后者的一半。
@elonmusk: Grok Build
Grok 4.5 配合 Grok Build 在 SWE-Atlas-QnA 基准测试中以 84 分获得第一名,与 GPT-5.6 Codex 持平,并超越其他编码设置。