@jerryjliu0: 我们在文档理解方面对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 进行了基准测试。我们与之前的版本进行了比较…
摘要
这条推文对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 在文档理解方面进行了基准测试,发现虽然 Flash 系列最初在视觉理解方面表现出色,但最新版本由于针对编码和推理进行了后期训练,性能已趋于平稳甚至有所退步。
查看缓存全文
缓存时间: 2026/07/22 14:24
我们在文档理解任务上对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 进行了基准测试。
我们将它们与之前的版本——Gemini 3.5 Flash 和 Gemini 3.1 Flash Lite——进行了比较。
- Gemini 3.6 Flash 的表现大致相近,不过在图表理解上下降了 14%
- Gemini 3.5 Flash Lite 在版面检测上提升了 11%,但在表格理解上退步了约 12%
总体来看,虽然 Gemini 3 Flash 在文档理解方面调校得不错,但后续版本更多地针对编码和推理进行了后训练,导致视觉识别能力进入平台期。
未来谷歌是否会重新重视 Flash 系列的视觉理解能力,还是也全面转向推理模型,这将是一个值得关注的问题。
查看这些结果及更多内容,请访问 ParseBench:https://parsebench.ai
相似文章
Gemini 3.5 Flash 基准测试
讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。
Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber
Google 推出 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 模型,提升了 token 效率、降低了延迟,并为智能体工作流带来更优性能。其中,3.6 Flash 减少了 17% 的输出 token 用量,并在编程和知识任务中表现出色。
Gemini 3.5 Flash 在编码方面并不出色
文章讨论了来自 Cursor 的评估结果,表明 Gemini 3.5 Flash 在编码任务上的表现低于预期。
Gemini 3.5 Flash-Lite 在长上下文检索方面优于 3.1 Flash-Lite(MRCRv2)
Gemini 3.5 Flash-Lite 相对于其前身 Gemini 3.1 Flash-Lite,在 MRCRv2 基准测试中实现了更好的长上下文检索性能。
Gemini 3.5 Flash 凭速度看很不错(8分钟阅读)
谷歌发布了 Gemini 3.5 Flash,这是一款混合速度模型,在速度和成本上与 Opus 4.7 和 GPT-5.5 相抗衡,同时在智能体和编程基准测试中表现良好。