Gemini 3.5 Flash在Artificial Analysis上的表现比其表面数据更糟

Reddit r/singularity 模型

摘要

比较显示,Gemini 3.5 Flash在Artificial Analysis基准测试中得分略低于Gemini 3.1 Pro,且尽管每token API定价更低,但其总基准测试成本却更高。

查看Artificial Analysis的数据,Gemini 3.5 Flash与Gemini 3.1 Pro的比较显得有些不寻常。来自Artificial Analysis的数字: **Gemini 3.1 Pro** - 智能得分:**57** - 成本:**$892** - 定价:每100万输入/输出token **$2 / $12** **Gemini 3.5 Flash** - 智能得分:**55** - 成本:**$1,552** - 定价:每100万输入/输出token **$1.50 / $9** 因此Gemini 3.5 Flash得分略低于Gemini 3.1 Pro,**55 vs 57**,但在其基准测试中成本更高,**$1,552 vs $892**。每token的API价格低于Pro,但总基准测试成本反而更高。
查看原文

相似文章

Gemini 3.5 Flash (Low)(1分钟阅读)

TLDR AI

Google 推出了 Gemini 3.5 Flash (Low),这是一种新模型变体,在 SWE 任务上比旧版 Gemini 3 Flash (High) 表现更优,同时相比 Medium 版本使用的 token 减少了约 45%。他们还重置了所有付费计划的配额。

Gemini 3.5 Flash 基准测试

Reddit r/singularity

讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。