@narens:基准测试巅峰

X AI KOLs Following 新闻

摘要

在Artificial Analysis的分析师代理基准测试中,Gemini 3.7 flash超越了Fable 5、Opus 5和GPT-5.6。

基准测试巅峰
查看原文
查看缓存全文

缓存时间: 2026/08/23 23:45

Benchmaxxed (跑分狂魔)

Shubham Saboo (@Saboo_Shubham_): 没什么大不了的。就是 Gemini 3.7 Flash 在 @ArtificialAnlys 的 Analyst Agent 基准测试中轻松击败了 Fable 5、Opus 5 和 GPT-5.6。

相似文章

Fable 5 在 Livebench 上甚至低于 Gemini 3.1

Reddit r/singularity

讨论 LiveBench 结果显示 Fable 5 表现低于 Gemini 3.1,质疑是该基准测试有缺陷,还是 Anthropic 在针对基准测试进行优化(benchmaxing)。

Gemini 3.5 Flash 基准测试

Reddit r/singularity

讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。