Gemini 3.5 Flash 凭速度看很不错(8分钟阅读)

TLDR AI 模型

摘要

谷歌发布了 Gemini 3.5 Flash,这是一款混合速度模型,在速度和成本上与 Opus 4.7 和 GPT-5.5 相抗衡,同时在智能体和编程基准测试中表现良好。

Zvi 认为 Gemini 3.5 Flash 在其速度级别上是最好的模型,但在延迟敏感型工作负载之外,与 Opus 4.7 或 GPT-5.5 相比缺乏说服力。谷歌将其定位为智能体工作流的日常驱动模型,它在 Terminal-Bench 和 MCP Atlas 上的得分超过 3.1 Pro,同时运行速度快 4 倍。
查看原文
查看缓存全文

缓存时间: 2026/05/26 18:25

# Gemini 3.5 Flash 就其速度而言表现不错 来源:https://thezvi.wordpress.com/2026/05/22/gemini-3-5-flash-looks-good-for-how-fast-it-is/ 谷歌再次推出了一款至少值得考虑的模型。Gemini 3.5 Flash 可能是在其特定速度点上最好的模型,只要你不介意它是 Gemini 模型。因此,在速度至关重要的场景下,这是一个合理的选择。否则,我看不出有什么理由要使用它而不是 Opus 4.7 或 GPT-5.5。 谷歌在 I/O 大会上还推出了其他产品,本文将一并介绍。 #### 谷歌 Gemini 3.5 'Flash' 登场 谷歌推出了 Gemini 3.5 Flash (https://blog.google/innovation-and-ai/models-and-research/gemini-models/#gemini-3-5-flash),似乎暂时将其作为通用模型,直到 3.5 Pro 问世。该模型已在常用平台上线。这是一款混合模型,兼具 Flash 的速度,但成本至少是 Opus 和 GPT-5.5 等模型的一半。 Gemini 3.5 Pro 确认将于下月发布。 谷歌专注于将 3.5 Flash 作为日常驱动的智能体任务模型。它的优势在于比 Claude Opus 4.7 或 GPT-5.5 更快、更便宜——只要它能胜任工作。不过,它并不像之前的 Flash 模型那样廉价,这基本上是一款混合模型: 一如既往,谷歌宣称这是其迄今为止最强大的模型 (https://x.com/JeffDean/status/2056793419033588091),适用于所有场景。 > Jeff Dean (https://x.com/JeffDean/status/2056793419033588091): 1/ 今天在 #GoogleIO 上,我们发布了 Gemini 3.5,这是我们最新一代的模型系列,将前沿智能与行动能力相结合。我们首先发布的是 3.5 Flash,它专为执行复杂的、长周期的智能体工作流而构建。它在 Terminal-Bench 和 MCP Atlas 等智能体和编码基准测试中得分超过 3.1 Pro,同时运行速度比其他前沿模型快 4 倍。在 Google Antigravity 中使用时,3.5 Flash 进一步优化,速度最高可提升 12 倍。它是一个强大的引擎,可用于部署可协作的子智能体、运行高频迭代循环,并大规模解决现实世界问题。 以下是他们的基准测试演示: > Koray Kavukcuoglu (https://blog.google/innovation-and-ai/models-and-research/gemini-models/#agentic-tasks): 与更新的 Antigravity 框架结合后,3.5 Flash 成为一个强大的引擎,可用于部署协作子智能体,以应对最苛刻用例中的大规模问题。在监督下,它可以可靠地执行多步骤工作流和编码任务,同时保持前沿性能。 这里有一些重大改进,包括 Gemini 之前表现不佳的 GDPval (https://x.com/OfficialLoganK/status/2057682092583227881)。如果这些分数代表了这款模型的真实能力,并且它是一款 Flash 模型,那将是一项了不起的成就。 知识截止日期为 2025 年 1 月 (https://x.com/_arohan_/status/2056980385746280741),延续了 Gemini 不认当前年份的模式 (https://x.com/seconds_0/status/2057162822690480338),这奇怪地过时,对许多用例来说是一个严重问题。 它并不是真正的“flash”模型,因为其成本远高于 3 Flash (https://x.com/Rob3rtWozny/status/2056804515970502908)。 Pliny 进行了标准越狱测试 (https://x.com/elder_plinius/status/2056853157162999903)。 最大的希望是,这款模型能填补“在智能体工作中足够好,同时更快更便宜”这一细分市场。 > Conrad Barski (https://x.com/lisperati/status/2057165788721955005): 对于我们这些围绕 AI 工作流构建生活的人来说(无论是出于喜欢,还是觉得在不久的将来为了生存必须这样做),3.5flash 是一个巨大的进步:我有几十个个人工具不需要 SOTA 智能,但现在突然变得快多了,同时智能水平相同。而且由于我的大多数工具只需要调用少量 LLM 就能发挥作用,3.5flash 增加的成本不是问题。该模型可以与 codex5.5 “低努力”模式竞争,但它非常非常快,远远超出其他模型的分布。我假设 OpenAI 很快就会发布一个竞争对手,因为 Cerebras 对于这种“中等智商、高速”的用例来说是最优的。 #### 其他人的基准测试 很多基准测试还没有结果,但在我常用的测试中,情况如下: 在调整成本和价格后,总体得分仅显示中等水平的表现,而 Gemini 模型在基准测试中往往相对表现更好。人们注意到,Flash 3.5 在其他人的基准测试中表现远不如谷歌列出的那么好。 它在“你说得绝对正确” (https://typebulb.com/u/lab/you-re-absolutely-right/full) 基准测试中表现灾难性地差——这是一个奉承一致性基准测试。 它在 CursorBench 上表现相当差 (https://x.com/theo/status/2056949041850913054)。 在 WeirdML 上 (https://x.com/htihle/status/2057019567512154267) 表现并不出色,仅比 3 Flash 有少量提升,远落后于 3 Pro 和 3.1 Pro。 它在 KnowsAboutBenBench 上 (https://x.com/BenEnterprises/status/2057203990362718451) 占据了榜首位置(由 Ben 本人测试)。 在 Vals.ai 的现实世界任务中 (https://www.vals.ai/home),它排名第三。 在 Arena 排行榜上 (https://huggingface.co/spaces/lmarena-ai/arena-leaderboard) 排名第 9,略低于 Gemini 3.1 Pro 和 3 Pro。 在 AA 智能指数上 (https://artificialanalysis.ai/#intelligence) 得分为 55.3,低于 3.1 Pro 的 57.2、Opus 的 57.3 和 GPT-5.5 的 60.2,而在他们的测试套件中,运行成本并不比 3.1 Pro 便宜。 #### 各方反应 有些人确实喜欢它。 > davidad (https://x.com/davidad/status/2057497398742495708): 这绝对是我在其价格点上最喜欢的模型,也是我在其速度点上最喜欢的模型。如果说“重回赛道”是指拥有最佳整体模型的比赛,那么显然还没有。但这并不是唯一的比赛。 > Srivatsan Sampath (https://x.com/SrivatsanS28660/status/2057231609384862114): 它有 Flash 的优点,但幻觉更少?空间感知能力真的很好(在这方面不会过度消耗 token),并且帮助我完成了家庭管道项目(5.5 和 4.7 绝对做不到这一点)。 > @lezadumtchique (https://x.com/lezadumtchique/status/2057165088813953393): 看起来相当不错,正在考虑在工作中从 3.1 Pro 切换过来。智能体编码能力相当(如果不是更好的话),而且速度快得多。 或者找到了特定的用途: > Medo42 (https://x.com/Medo42/status/2057194536934220149): 没怎么试编码(还行,但在我常用的测试上不是 100%),但在视觉方面甚至比 Gemini 3.0/3.1 更好。阅读文本(包括手写)仍然很棒,行/列识别准确,细节捕捉好,仪表盘读取要好得多。 > EM (https://x.com/edwin_mccallum/status/2057184350995964384): 对于语音交互这样的场景来说,token/秒的速度非常棒。 可惜的是,这是一款 Gemini 模型,人们正在报告 Gemini 特有的问题。 > Dominik Lukes (https://x.com/techczech/status/2057237092304896312): 唉,考虑到价格上涨。否则确实是一个强大的模型。在智能体和单次开发任务上表现不错,但在 Antigravity 赶上 Codex 之前,我没有太多动力去更彻底地测试它。 > Yoav Tzfati (https://x.com/yoavtzfati/status/2057191420189171790): 不是第一手经验,但从我看到的测试来看,它似乎会超出自己的能力范围,并在过程中搞砸。但因为它太快了,我在考虑用它来替代 Explore 智能体。 > alice (https://x.com/aliceisplaying/status/2057182383078527221): 我真的享受了那 90 分钟 Cursor 泄露的原始 CoT,非常可爱。不幸的是,通常它被可怕地束缚着。对于编码来说,它太贵了,不过可能对前端有用。 > paperclippriors (https://x.com/paperclippriors/status/2057177399997989068): 我想我只是不知道我为什么要用它。如果不考虑它使用的推理 token 数量,它只是更快更便宜,而且它似乎比 Claude 和 GPT 更笨、更不自信。 > ClaudiaShitposting (https://x.com/FemalesDNI/status/2057199120788398484): 在某些事情上出奇地好,但大部分是垃圾。缺少 Gemini 3/3.1 所具有的常识,如果你能理解的话。 > KC+AI 4 Gov of WI 2026 (https://x.com/thePartyPartyUS/status/2057157247180943382): 一个巨型公司的绝对笑话。我希望整个百万富翁 AI 开发团队必须通过扬声器听烦人的音乐,直到他们发布一个配得上他们基础设施的模型。 > uIts (https://x.com/buttlover38/status/2057177997539512335): 相当糟糕。 > Naveesh /wtf (https://x.com/krapstarr/status/2057183653269225475): 不。 > jerry (https://x.com/jerrrrrrryyyyy/status/2057176611787825161): 垃圾。 > budrscotch (https://x.com/paulhshort/status/2057255021222240652): 这是一个巨大的失望,但在意料之中。 > Tenobrus (https://x.com/tenobrus/status/2057173763284930656): 如果 flash 3.5 保持在 0.5 美元,那将是一个非常非常令人兴奋的发布。整体智能 + 速度 + 成本碾压,摧毁开源、Sonnet 和 5.4 mini。我会立即在多个用例中采用它。但它是 1.50 美元 [输出 9 美元,也是 3 倍涨价]。所以现在就是这样了。 > Tenobrus (https://x.com/tenobrus/status/2056907685719908630): 到目前为止,对 3.5 flash 的印象相当负面。它在 token 输出方面非常快,但这基本上无关紧要,因为它在几乎所有任务中都会爆炸出大量不必要的工具调用。当它卡在某件事上时,似乎几乎从不暂停或寻求帮助,只是继续碾压式地盲目行动。经常幻觉虚假的首字母缩写扩展。写作质量中等至差,大量 emoji 垃圾,同样的 Gemini 典型特征:“The Flaw:” / 夸大的命名倾向。实际代码质量是 Sonnet 级别。非常早期的初步印象,我可能漏掉了一些东西。但即使是“超快代码库探索子智能体”这个初始用例,对我来说也很快瓦解了,因为它实际上不够智能,无法快速完成。总而言之,这绝对不是谷歌需要发布的东西。 它还有谷歌常见的问题:无法与谷歌整合 (https://x.com/davidmanheim/status/2057166577854812172),例如用个人邮箱使用你的订阅,这使所有个性化功能变得无用。你需要使用 Claude 或 ChatGPT 来访问 Gmail,先生。 这是一个相当大的问题: > Caleb Withers (https://x.com/CalebWithersDC/status/2057180739716935925): 从 Antigravity 中的一些初步测试来看,它喜欢过度自信地做出假设,然后基于这些假设采取未经请求的破坏性行动(例如,随意解决文件冲突、删除待办事项列表项、取消暂存提交)。 另一个特别在 Antigravity 中的大问题是,限制似乎非常低。这是许多人遇到此问题的诸多例子之一。 > Ryan Johnson (https://x.com/_high_on_ai_/status/2057307611607785499): 我讨厌它的限制如此之低,每周 45-60 分钟的反重力?或者用 Opus 4.7 或 GPT 5.5 完成 10 个完整会话。我曾希望它会成为我工作流程中的主力,但我很确定 Claude/GPT 会成为我的选择,而 Gemini 只是噪音。 如果谷歌想与 Claude Code 和 Codex 竞争,他们需要提供一种方式,让人们在确信订阅之前能够大量使用。 他们确实将限制提高了三倍,这是一个很好的开始 (https://x.com/_mohansolo/status/2057656550286885284),但这还不够。 OpenAI 的 Vie 报告称 Flash 3.5 经常对他撒谎 (https://x.com/viemccoy/status/2056963417962127522),怀疑是框架的问题。 Theo 对 Flash 3.5 和谷歌的其他一些决定非常不满 (https://x.com/theo/status/2056946993407369300)。我见过他发很多帖子,这不是他通常的方式,所以这里肯定有问题。 #### 谷歌 AI 搜索 谷歌正在彻底改造其搜索体验 (https://techcrunch.com/2026/05/19/google-search-as-you-know-it-is-over/),围绕一个“智能搜索框”展开,其外观和感觉很像 Gemini Flash 3.5 聊天机器人提示框。 如果实现得好,这是一个有用的功能——事实上,我使用这个功能(来自 OpenAI 和 Anthropic)的频率比使用谷歌搜索更高。但那个东西不是谷歌搜索。 > Sarah Perez (https://techcrunch.com/2026/05/19/google-search-as-you-know-it-is-over/): 随着即将到来的搜索体验变化,链接将成为事后考虑。这建立在谷歌之前推出的 AI 搜索功能基础上,比如它的简短摘要(称为 AI Overviews)和对话式搜索(AI Mode)。 我使用谷歌搜索的主要原因是为了链接到某些内容,或者有时作为拼写检查器。如果我想要 AI,我会直接问 AI。 谷歌还在推出“信息智能体”,作为 AI 版的谷歌快讯。 #### 谷歌每日简报 Daily Brief 是他们对 OpenAI 的 Pulse 的回应,但他们的版本将整合来自你所有已连接应用的信息,更像是一个待办事项列表,可以包括 Gmail 和日历。 第一部分“首要关注”似乎是一个合理有用的功能,以确保你不会从邮件或日历中遗漏重要事项。 然后它会“展望未来”并“建议立即的后续步骤”,我预计这会很烦人且无用——在我的快速实验中确实如此。我喜欢它直接链接到邮件,但不会干扰你通常的流程。 他们说你可以“通过快速点赞或点踩来逐步调整 Daily Brief”。 哦不。如果这东西要好用,你需要能够给它指令并解释为什么你觉得某件事有用或没用,就像你可以对 Pulse 做的那样(我仍然懒得用)。假设任何使用点赞/点踩的东西都是 AI 垃圾。 如果谷歌让这款产品有更好的定制化,并允许你将其与各种形式的谷歌快讯以及其他监控外界的方式同步,那他们会得到更有趣的东西。 #### 谷歌 I/O 日 谷歌还为我们提供了什么?(https://blog.google/innovation-and-ai/products/gemini-app/next-evolution-gemini-app/) Gemini Spark 将是一个“全天候的个人 AI 智能体,帮助你处理日常生活”,使用 Antigravity 框架,并与谷歌其他服务集成。他们展示的例子是向 Instacart 添加商品。 看起来他们将通过 MCP 连接器逐个应用地推进,并且在未来几周内计划推出一系列不错的初始选择? Spark 将于下周面向 Ultra 订阅用户推出。 终于有了适用于 macOS 的 Gemini 应用。 Neural Expressive 是“AI 时代的新设计语言”。 我认为这意味着 Gemini 现在可以在语音和文本模式之间轻松切换,并且可以使用动画、“鲜艳的色彩”、新字体以及——出于某种原因——触觉反馈。他们以为我们不想要文本,而是想要某种多媒体演示。 Gemini Omni 使在聊天中生成和编辑视频变得更加容易。 你可以更方便地就 YouTube 视频提出长形式问题。 Dean Ball 对其提供的日常实用性印象深刻 (https://x.com/deanwball/status/2056819712529768878),甚至考虑购买一部安卓手机。如果你因为这个原因要买安卓手机,我推荐 Pixel,因为它们能更快获得更多更好的谷歌 AI 功能,而且我自己就有一部,是一款很棒的手机。

相似文章

Gemini 3 Flash: 为速度而生的前沿智能

Google DeepMind Blog

Google 发布了 Gemini 3 Flash,这是一款快速、高性价比的 AI 模型,将 Pro 级别的推理能力与 Flash 级别的速度相结合,适用于编程、复杂分析和智能体工作流等任务。

Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Hacker News Top

Google 推出 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 模型,提升了 token 效率、降低了延迟,并为智能体工作流带来更优性能。其中,3.6 Flash 减少了 17% 的输出 token 用量,并在编程和知识任务中表现出色。

Gemini 3.5:前沿智能与行动力

Google DeepMind Blog

Google 发布 Gemini 3.5,一个全新 AI 模型系列,聚焦智能体工作流与编程,首发 3.5 Flash 以高速提供前沿性能。

Gemini 3.5 Flash 基准测试

Reddit r/singularity

讨论了Gemini 3.5 Flash模型的基准测试结果,可能展示了它在各种AI任务上的表现。