@_jasonwei: Muse Spark 1.1 在放射学最后考试中表现优于 GPT-5.6 Sol 和 Gemini 3.1。我们尚未超越 Fable(目前)。而人类...

X AI KOLs Following 模型

摘要

Muse Spark 1.1 在放射学最后考试 2.0(一项面向医疗自主 AI 诊断的新型视觉推理基准)上表现优于 GPT-5.6 Sol 和 Gemini 3.1,但落后于 Fable 和人类放射科医生。

Muse Spark 1.1 在放射学最后考试中表现优于 GPT-5.6 Sol 和 Gemini 3.1。我们尚未击败 Fable(暂时)。人类仍然好得多,但我们正在努力缩小差距!
查看原文
查看缓存全文

缓存时间: 2026/07/13 20:05

Muse Spark 1.1 在 Radiology’s Last Exam 上的表现优于 GPT-5.6 Sol 和 Gemini 3.1。我们目前还没有超越 Fable(但快了)。人类仍然强很多,但我们正在努力缩小差距!

Dr. Datta M.D.(放射科)✈️ 瑞士 @AI4Good (@DrDatta_AIIMS): 🔥今天,我们发布了医疗领域自主 AI 诊断的首批视觉推理基准之一!

🚀推出来自 @CRASHLabAI 的 Radiology’s Last Exam 2.0 (RadLE 2.0),这是一个用于放射学自主诊断的考虑不确定性的基准!

✅在过去的几天里,

相似文章