@elonmusk:Grok 4.6 在医疗问题中排名第一
摘要
Grok 4.6 在 MedAgentBench 上登顶,在现实世界的医疗 AI 任务中超越了 GPT-5.6 Sol 和 Grok 4.5。
查看缓存全文
缓存时间: 2026/08/19 18:45
Grok 4.6 在医疗健康问题评估中位居榜首
X Freeze (@XFreeze):
Grok 4.6 刚在 MedAgentBench 榜单上夺得第一名……这是衡量真实世界医疗智能体任务能力最有趣的基准测试之一而 Grok 现在已有两代产品跻身前三:
• 第一名 Grok 4.6 — 约 95.9%
• 第二名 GPT-5.6 Sol — 约 94.7%
• 第三名 Grok 4.5 — 约 93.4%MedAgentBench 基准测试
相似文章
@elonmusk:Grok 4.6 在 CursorBench 真实编码测试中排名第一
Elon Musk 宣布,Grok 4.6 在 CursorBench 真实编码测试中排名第一,超越其他 AI 模型,展现出高效率。
@elonmusk: Grok
Elon Musk 强调,xAI 的 Grok 4.6 在罕见病诊断的 RareBench 中登顶,以约三分之一的成本击败了 Claude Opus 5,而 DeepSeek 的新模型则表现不佳。
@elonmusk: Grok Build
Grok 4.5 配合 Grok Build 在 SWE-Atlas-QnA 基准测试中以 84 分获得第一名,与 GPT-5.6 Codex 持平,并超越其他编码设置。
SpaceXAI的Grok 4.6在Artificial Analysis Intelligence Index中得分61
SpaceXAI的Grok 4.6在Artificial Analysis Intelligence Index中得分61,与GPT-5.6 Sol和Claude模型一起跻身前沿,以较低成本展现出强大的智能体性能。
@elonmusk: Grok 4.5 在 Long-Horizon Terminal-Bench 上排名第一
埃隆·马斯克宣布,Grok 4.5 在 Long-Horizon Terminal-Bench 基准测试中排名第一,超越了之前的模型。