@jerryjliu0: 我们在文档理解方面对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 进行了基准测试。我们与之前的版本进行了比较…

X AI KOLs Following 新闻

摘要

这条推文对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 在文档理解方面进行了基准测试,发现虽然 Flash 系列最初在视觉理解方面表现出色,但最新版本由于针对编码和推理进行了后期训练,性能已趋于平稳甚至有所退步。

我们在文档理解方面对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 进行了基准测试。 我们将其与之前的版本——Gemini 3.5 Flash 和 Gemini 3.1 Flash Lite 进行了比较。 Gemini 3.6 Flash 性能大致相似,但在图表理解方面下降了14% Gemini 3.5 Flash Lite 在布局检测上提升了11%,但在表格方面退步了约12% 总体而言,虽然 Gemini 3 Flash 在文档理解方面进行了很好的调优,但后续版本针对编码和推理进行了后期训练,导致视觉识别能力陷入停滞。 有趣的是,谷歌是否会重新优先考虑 Flash 系列的视觉理解能力,还是也会全力投入推理模型。 请查看 ParseBench 上的这些结果及更多内容:https://parsebench.ai
查看原文
查看缓存全文

缓存时间: 2026/07/22 14:24

我们在文档理解任务上对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 进行了基准测试。

我们将它们与之前的版本——Gemini 3.5 Flash 和 Gemini 3.1 Flash Lite——进行了比较。

  • Gemini 3.6 Flash 的表现大致相近,不过在图表理解上下降了 14%
  • Gemini 3.5 Flash Lite 在版面检测上提升了 11%,但在表格理解上退步了约 12%

总体来看,虽然 Gemini 3 Flash 在文档理解方面调校得不错,但后续版本更多地针对编码和推理进行了后训练,导致视觉识别能力进入平台期。

未来谷歌是否会重新重视 Flash 系列的视觉理解能力,还是也全面转向推理模型,这将是一个值得关注的问题。

查看这些结果及更多内容,请访问 ParseBench:https://parsebench.ai

相似文章

Gemini 3.5 Flash 基准测试

Reddit r/singularity

讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。

Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Hacker News Top

Google 推出 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 模型,提升了 token 效率、降低了延迟,并为智能体工作流带来更优性能。其中,3.6 Flash 减少了 17% 的输出 token 用量,并在编程和知识任务中表现出色。