@elonmusk:Grok 4.6 在医疗问题中排名第一

X AI KOLs Timeline 新闻

摘要

Grok 4.6 在 MedAgentBench 上登顶,在现实世界的医疗 AI 任务中超越了 GPT-5.6 Sol 和 Grok 4.5。

Grok 4.6 在医疗问题中排名第一
查看原文
查看缓存全文

缓存时间: 2026/08/19 18:45

Grok 4.6 在医疗健康问题评估中位居榜首

X Freeze (@XFreeze):
Grok 4.6 刚在 MedAgentBench 榜单上夺得第一名……这是衡量真实世界医疗智能体任务能力最有趣的基准测试之一

而 Grok 现在已有两代产品跻身前三:

• 第一名 Grok 4.6 — 约 95.9%
• 第二名 GPT-5.6 Sol — 约 94.7%
• 第三名 Grok 4.5 — 约 93.4%

MedAgentBench 基准测试

相似文章

@elonmusk: Grok

X AI KOLs Timeline

Elon Musk 强调,xAI 的 Grok 4.6 在罕见病诊断的 RareBench 中登顶,以约三分之一的成本击败了 Claude Opus 5,而 DeepSeek 的新模型则表现不佳。

@elonmusk: Grok Build

X AI KOLs Timeline

Grok 4.5 配合 Grok Build 在 SWE-Atlas-QnA 基准测试中以 84 分获得第一名,与 GPT-5.6 Codex 持平,并超越其他编码设置。