新的LLM模型并不意味着它比前代更好。
摘要
一位用户测试了Gemini-3.5-flash-lite在批改作业上的表现,发现其不如前代Gemini-2.5-flash-lite,说明新模型并不总是更好。
我测试了Gemini发布的新模型,它们可能基于新数据训练,推理能力更强。但当我用它批改作业时,表现却不如前代。测试结果显示,Gemini-3.5-flash-lite的表现不如Gemini-2.5-flash-lite。详情分析:https://www.classlens.com/blog/gemini-3-5-flash-lite-grading-test
相似文章
Gemini 3.6 Flash 在纸面上表现更佳。什么会让你阻止升级?
本文评估了从 Gemini 3.5 Flash 升级至 3.6 Flash 的情况,指出整体基准测试有提升,但某些任务可能存在回归,并建议在升级前进行严格评估并预设失败门槛。
@jerryjliu0: 我们在文档理解方面对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 进行了基准测试。我们与之前的版本进行了比较…
这条推文对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 在文档理解方面进行了基准测试,发现虽然 Flash 系列最初在视觉理解方面表现出色,但最新版本由于针对编码和推理进行了后期训练,性能已趋于平稳甚至有所退步。
Gemini 3.5 Flash 在编码方面并不出色
文章讨论了来自 Cursor 的评估结果,表明 Gemini 3.5 Flash 在编码任务上的表现低于预期。
根据Arena排行榜,开放权重模型GLM和Mimo优于Gemini 3.5 Flash
根据Arena排行榜,开放权重模型GLM和Mimo在编程基准测试中优于Gemini 3.5 Flash。
Gemini 3.5 Flash-Lite 在长上下文检索方面优于 3.1 Flash-Lite(MRCRv2)
Gemini 3.5 Flash-Lite 相对于其前身 Gemini 3.1 Flash-Lite,在 MRCRv2 基准测试中实现了更好的长上下文检索性能。