@_jasonwei: Muse Spark 1.1 在放射学最后考试中表现优于 GPT-5.6 Sol 和 Gemini 3.1。我们尚未超越 Fable(目前)。而人类...
摘要
Muse Spark 1.1 在放射学最后考试 2.0(一项面向医疗自主 AI 诊断的新型视觉推理基准)上表现优于 GPT-5.6 Sol 和 Gemini 3.1,但落后于 Fable 和人类放射科医生。
查看缓存全文
缓存时间: 2026/07/13 20:05
Muse Spark 1.1 在 Radiology’s Last Exam 上的表现优于 GPT-5.6 Sol 和 Gemini 3.1。我们目前还没有超越 Fable(但快了)。人类仍然强很多,但我们正在努力缩小差距!
Dr. Datta M.D.(放射科)✈️ 瑞士 @AI4Good (@DrDatta_AIIMS): 🔥今天,我们发布了医疗领域自主 AI 诊断的首批视觉推理基准之一!
🚀推出来自 @CRASHLabAI 的 Radiology’s Last Exam 2.0 (RadLE 2.0),这是一个用于放射学自主诊断的考虑不确定性的基准!
✅在过去的几天里,
相似文章
Meta Muse Spark 1.3 超越 Fable 5 及 GPT 5.6 sol
据报道,Meta的Muse Spark 1.3 AI模型在性能指标上超越了Fable 5和GPT 5.6。
@FinanceYF5: Alexandr Wang 表示,Muse Spark 1.1 是一款具备行业竞争力的 Agentic 和编程模型。 在多个 Agentic 评测中,它可以与 GPT-5.5 和 Opus 4.8 相抗衡。 目前已经可以通过新的 Meta…
Alexandr Wang 表示,Muse Spark 1.1 是一款具备行业竞争力的 Agentic 和编程模型,在多个评测中可与 GPT-5.5 和 Opus 4.8 抗衡,现可通过 Meta Model API 和 Meta AI 使用。
@_jasonwei: 除了代理和编码能力外,Muse Spark 1.1 在回答健康问题方面也非常强大,这是一个持续增长的…
Muse Spark 1.1 是 Meta 新推出的代理与编码模型,在 HealthBench-Pro 上提升了 5% 的性能,超越了除 Fable 和 Mythos 外的所有竞争对手。
@rohanpaul_ai: @thehypedotnews 的非常有趣的实验 gpt-6 sol vs grok 4.7 vs gpt-6 astra vs muse spark 1.3 令人惊讶的是如此少的…
这些实验比较了GPT-6 Sol、Grok 4.7、GPT-6 Astra和Muse Spark 1.3等AI模型如何从提示生成浏览器产物,重点展示了GPT-6 Sol以极少的推理即可生成可工作的HTML文件的效率。
SemiAnalysis:Gemini 3.8 Flash 和 Muse Spark 1.3 是我们迄今见过的两个跑分最明确的模型。
SemiAnalysis 报告称,Gemini 3.8 Flash 和 Muse Spark 1.3 是基准测试最清晰的 AI 模型之一,展现出强大性能。