SpaceXAI的Grok 4.6在Artificial Analysis Intelligence Index中得分61

Hacker News Top 模型

摘要

SpaceXAI的Grok 4.6在Artificial Analysis Intelligence Index中得分61,与GPT-5.6 Sol和Claude模型一起跻身前沿,以较低成本展现出强大的智能体性能。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/12 17:20

# Grok 4.6 让 SpaceXAI 重返智能前沿,并在成本效率上领先 来源:https://artificialanalysis.ai/articles/grok-4-6-benchmarks-and-analysis ## SpaceXAI 的 Grok 4.6 在 Artificial Analysis Intelligence Index 上获得 61 分,与 GPT-5.6 Sol 并肩进入前沿,以更低成本展现卓越的智能体性能 Grok 4.6 在发布仅一个多月后,其 Intelligence Index 得分比 Grok 4.5 高出 5 分,相比 Grok 4.3 则高出 23 分。这让 SpaceXAI 重返智能前沿,与 OpenAI 并列,仅次于 Anthropic。 **关键要点:**➤ Grok 4.6 跻身 Artificial Analysis Intelligence Index 的前沿:得分 61,与 GPT-5.6 Sol(max)持平,落后于 Claude Opus 5(max,63)和 Claude Fable 5(max with fallback,62),略高于 Kimi K3 ➤ 强劲的智能体性能:Grok 4.6 在 GDPval-AA v2 上取得 1753 的 Elo,仅次于 Claude Opus 5,并与 Claude Fable 5 和 Qwen3.8 Max 的置信区间重叠。它在 τ3-Banking 上获得 50.7%,与 Qwen3.8 Max(51.3%)共同位列前两名;在 Terminal-Bench v2.1 上获得 88.4%,与领先模型持平 ➤ 前沿级智能,更低成本:标价与 Grok 4.5 相同,每 100 万输入/输出 token 为 $2/$6,比 Claude Opus 5($5/$25)和 GPT-5.6 Sol($5/$30)低 60% 以上。每个任务成本为 $0.84,与 Kimi K3 相同,但智能略高,使其处于智能 vs. 每任务成本的帕累托前沿 ➤ Grok 4.6 在 AA-Briefcase(我们针对长周期智能体知识工作的私有基准)上处于 Fable 5 级别,Elo 为 1577,落后于 Claude Opus 5 系列。它尤其擅长节省轮次,平均约 53 轮和约 0.5B 输入 token 即可完成任务,而 Claude Opus 5(max)则需要约 103 轮和约 2.0B 输入 token **其他模型详情:**➤ 上下文窗口为 500k token(与 Grok 4.5 相同)➤ 输入/输出每 1M token 定价为 $2/$6;缓存命中折扣为每 1M token $0.5,较 Grok 4.5 的每 1M token $0.3 有所上调 #### 智能体性能 Grok 4.6 最亮眼的成绩体现在智能体工作而非静态推理上。在我们衡量真实世界智能体知识工作的首要指标 GDPval-AA v2 上,它取得了 1753 的 Elo——仅次于 Claude Opus 5,且由于置信区间重叠,在统计上与 Claude Fable 5 和 Qwen3.8 Max 无法区分。 这一模式在不同任务类型中均成立。τ3-Banking(50.7%)测试使用工具的多轮客户服务,Grok 4.6 位列前两名;Terminal-Bench v2.1(88.4%)则使其在基于终端的软件任务中与领先者持平。很少有模型能同时在知识工作、客户服务和终端使用方面具有竞争力;结合其定价,这使得 Grok 4.6 在 Intelligence Index 的每一项智能体评估中都处于成本与性能的帕累托前沿。 #### 成本 在智能前沿,保持一代产品的标价不变并不常见,因为智能提升通常伴随着价格上涨。Grok 4.6 在 $2/$6 定价不变的情况下实现了 Intelligence Index 5 分的提升,而我们测得的每任务成本 $0.84 既反映了该定价,也反映了合理的 token 效率。 对买家而言,真正重要的对比对象是得分与其相差两分之内的模型:定价 $5/$25 的 Claude Opus 5 和定价 $5/$30 的 GPT-5.6 Sol。Grok 4.6 以远低于后者的输出 token 价格,提供了与 GPT-5.6 Sol 几乎相同的 Intelligence Index 得分,而输出 token 价格正是推理密集型工作负载中主导成本的因素。 #### 长周期知识工作 Grok 4.6 首次亮相 AA-Briefcase(我们针对长周期智能体知识工作任务的私有基准),Elo 为 1577。这使其处于 Fable 5 级别,落后于 Claude Opus 5 系列,在评分标准、展示质量和分析质量等方面表现持续强劲,而非某一维度的优势掩盖另一维度的短板。 其效率表现与得分同样引人注目。Grok 4.6 平均约 53 轮和约 0.5B 输入 token 即可完成任务,而 Claude Opus 5(max)则需要约 103 轮和约 2.0B 输入 token。长周期智能体工作会快速累积上下文,因此,一个能以一半轮次和四分之一输入 token 达到相近答案的模型,其成本优势远超其单 token 定价所体现的差异。 #### 完整结果 Artificial Analysis Intelligence Index 中各项评估的完整明细: 有关 Grok 4.6 的更多详情和基准测试,请参阅 Artificial Analysis:https://artificialanalysis.ai/models/grok-4-6

相似文章

Grok 4.6

Hacker News Top

xAI releases Grok 4.6, a frontier model focused on long-running agents and ambitious interactive/visual work, matching GPT-5.6 Sol on the Artificial Analysis Intelligence Index and available in Cursor and Grok Build.

@elonmusk: Grok

X AI KOLs Following

Aravind Srinivas 祝贺 SpaceXAI 推出 Grok 4.6,指出它在使用 Perplexity Computer 工具链的 Wide-And-Deep-Research 基准测试中表现出色,现已向 Pro 和 Max 用户开放。

Grok 4.7

Product Hunt

Grok 4.7 是 SpaceXAI 最强大的编码和知识工作AI模型,提供改进的任务处理和安全措施,同时保持与 Grok 4.6 相同的价格和速度。