新的LLM模型并不意味着它比前代更好。

Reddit r/ArtificialInteligence 模型

摘要

一位用户测试了Gemini-3.5-flash-lite在批改作业上的表现,发现其不如前代Gemini-2.5-flash-lite,说明新模型并不总是更好。

我测试了Gemini发布的新模型,它们可能基于新数据训练,推理能力更强。但当我用它批改作业时,表现却不如前代。测试结果显示,Gemini-3.5-flash-lite的表现不如Gemini-2.5-flash-lite。详情分析:https://www.classlens.com/blog/gemini-3-5-flash-lite-grading-test
查看原文

相似文章