Gemini 3.5 Flash在Artificial Analysis上的表现比其表面数据更糟
摘要
比较显示,Gemini 3.5 Flash在Artificial Analysis基准测试中得分略低于Gemini 3.1 Pro,且尽管每token API定价更低,但其总基准测试成本却更高。
查看Artificial Analysis的数据,Gemini 3.5 Flash与Gemini 3.1 Pro的比较显得有些不寻常。来自Artificial Analysis的数字:
**Gemini 3.1 Pro**
- 智能得分:**57**
- 成本:**$892**
- 定价:每100万输入/输出token **$2 / $12**
**Gemini 3.5 Flash**
- 智能得分:**55**
- 成本:**$1,552**
- 定价:每100万输入/输出token **$1.50 / $9**
因此Gemini 3.5 Flash得分略低于Gemini 3.1 Pro,**55 vs 57**,但在其基准测试中成本更高,**$1,552 vs $892**。每token的API价格低于Pro,但总基准测试成本反而更高。
相似文章
Gemini 3.5 Flash (Low)(1分钟阅读)
Google 推出了 Gemini 3.5 Flash (Low),这是一种新模型变体,在 SWE 任务上比旧版 Gemini 3 Flash (High) 表现更优,同时相比 Medium 版本使用的 token 减少了约 45%。他们还重置了所有付费计划的配额。
Gemini 3.5 flash 的价格是上一版本的 3 倍,是 Gemini 1.5 flash 的 30 倍。
谷歌的 Gemini 3.5 Flash 定价是上一版本的 3 倍,是 Gemini 1.5 Flash 的 30 倍,引发了对未来模型成本攀升的担忧。
Gemini 3.5 Flash 基准测试
讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。
Gemini 3.5 Flash 在短篇创意写作基准测试中相比 Gemini 3.1 Pro 有提升:-2.3 → -1.8。
在短篇创意写作基准测试中,Gemini 3.5 Flash 表现优于 Gemini 3.1 Pro,在直接对比中从 -2.3 提升到 -1.8。
谷歌表示其新Gemini 3.8 Flash模型'更努力工作'但可能成本更高
谷歌推出了Gemini 3.8 Flash,这是一款AI模型,执行更多推理步骤和工具迭代,提高了基准性能,但可能因更高的token使用量而增加成本。