@elonmusk: Grok 4.6 登顶 @databricks
摘要
Elon Musk 宣布 Grok 4.6 登顶 Databricks,Ivan Zhou 报告称,使用 Databricks 的 Genie 测试框架,在 OfficeQA Pro V2 上实现了 SOTA 性能。
Grok 4.6 登顶 @databricks
查看缓存全文
缓存时间: 2026/08/13 17:22
Grok 4.6 在 @databricks 上达到 #1
Ivan Zhou (@ivanzhouyq): 我们与 @SpaceXAI 合作,使用来自 @DbrxMosaicAI 的最新 OfficeQA Pro V2 对 Grok 4.6 进行了评估。它借助 @databricks 的 Genie harness 达到了 SOTA 性能! 该模型在文档理解和数据推理任务上表现最强,而且是一个非常高效的驱动者!
相似文章
@elonmusk: Grok 4.5 在 Long-Horizon Terminal-Bench 上排名第一
埃隆·马斯克宣布,Grok 4.5 在 Long-Horizon Terminal-Bench 基准测试中排名第一,超越了之前的模型。
@elonmusk:Grok 4.6 在 CursorBench 真实编码测试中排名第一
Elon Musk 宣布,Grok 4.6 在 CursorBench 真实编码测试中排名第一,超越其他 AI 模型,展现出高效率。
@elonmusk: Grok 4.5 在现实工作中表现卓越
Elon Musk 推荐 Grok 4.5 用于实际任务,引用 Ramp 测试:Grok 在 15 万张商业发票上实现了最高的完美抽取率。
@elonmusk: Grok 现已登陆 Databricks
xAI 的 Grok 模型现已可在 Databricks Agent Bricks 上使用,使企业能够利用其数据构建 AI 智能体。
@elonmusk: Grok Build
Grok 4.5 配合 Grok Build 在 SWE-Atlas-QnA 基准测试中以 84 分获得第一名,与 GPT-5.6 Codex 持平,并超越其他编码设置。