推出 Gemini 3.5 Flash Cyber

Google DeepMind Blog 模型

摘要

Google 推出 Gemini 3.5 Flash Cyber,这是一个轻量级网络安全模型,针对自动化漏洞发现与修复进行了微调,以成本效益高的性能与大型模型竞争。

Google 推出 Gemini 3.5 Flash Cyber,一个用于发现和修复漏洞的轻量级网络安全模型。
查看原文
查看缓存全文

缓存时间: 2026/07/21 15:40

# 推出 Gemini 3.5 Flash Cyber 来源:https://deepmind.google/blog/introducing-gemini-3-5-flash-cyber/ 多年来,谷歌一直在网络安全领域进行投入,率先开展自动化漏洞发现工作,以保护全球的代码库。像我们的代码安全智能体 CodeMender (https://deepmind.google/blog/introducing-codemender-an-ai-agent-for-code-security/) 这样的工具,可以自动发现并修复关键的软件漏洞。但是,随着 AI 智能体发现漏洞的速度越来越快,防御者修复漏洞的速度却难以跟上,应对这一全球性威胁就需要一种能力强大、成本低廉且可扩展的方法。 今天,我们将扩展长期以来的努力,为防御者提供更好的准备,推出了 Gemini 3.5 Flash Cyber。这是一款基于 3.5 Flash 构建的轻量级网络安全模型,经过微调,能够快速高效地发现、验证和修补漏洞,在这些任务上比 Gemini 主线 Flash 模型更加有效。 Flash 的性能和效率使其成为我们网络安全模型工作的理想基础。通过在 Flash 之上构建,3.5 Flash Cyber 为大型且昂贵的网络安全模型提供了一种兼具成本效益和高性能的替代方案。 鉴于这项技术的双重用途,我们在部署 3.5 Flash Cyber 时采取了审慎的方法。作为有限访问试点计划的一部分,3.5 Flash Cyber 将不久后通过 CodeMender 独家提供给政府和受信任的合作伙伴,并随时间逐步扩大范围。这将使一线防御者能够在关键漏洞被利用之前,抢先发现并修复它们,同时降低更广泛的滥用风险。 此外,我们还通过 Gemini 企业智能体平台 (https://cloud.google.com/blog/products/identity-security/find-and-fix-software-vulnerabilities-with-codemender) ,将 CodeMender 的基础能力直接提供给使用通用 Gemini 模型的客户。 ## 搜索空间问题:轻量级模型在代码安全中的优势 发现深层缺陷需要探索庞大的执行搜索空间。依赖单次、昂贵的大型语言模型调用可能会造成瓶颈。3.5 Flash Cyber 特别适合在智能体需要扫描大量代码库并分析大量代码路径时发现漏洞。 CodeMender 会多次调用 3.5 Flash Cyber,这样智能体就能分析更多的代码路径,以发现并验证漏洞。然后,子智能体生成一份高质量的综合报告。 凭借其速度和低成本,3.5 Flash Cyber 可以轻松集成到频繁扫描、时间敏感的发布流程或大规模的提交扫描流水线中。 ## 3.5 Flash Cyber 基准测试结果:大型网络安全模型的高效替代方案 我们在多种基准测试上测试了 3.5 Flash Cyber。特别是在 CyberGym 基准测试上进行了测试,该测试评估 AI 智能体面对数百个真实世界的软件漏洞。通过配置 CodeMender 对 3.5 Flash Cyber 最多调用五次,生成一份最终报告,从而利用 3.5 Flash Cyber 的低成本,整体智能体在 CyberGym* 上的性能与显著更大的模型相比具有竞争力。 *\*竞争对手结果来自提供方自我报告的分数* 我们还对模型的能力进行了压力测试,超出 CyberGym 范围,且未设置安全护栏。Google 的 Big Sleep (https://cloud.google.com/blog/products/identity-security/cloud-ciso-perspectives-our-big-sleep-agent-makes-big-leap) 团队独立构建了一项评估,专注于在世界上一些最复杂的代码库(如 Chrome 和 Safari)中发现关键且难以发现的漏洞。在此项评估中,3.5 Flash Cyber 显著超越了主线 3.5 Flash 和 3.6 Flash。 #### 在 Big Sleep 评估中的成功率 (pass@1) 3.5 Flash Cyber 还接受了 Google Chrome 生产提交扫描流水线的评估。这些漏洞并未公开披露,从而确保此项基准测试对 Gemini 和竞争对手模型均无污染。 结果显示,与 3.5 Flash 相比,3.5 Flash Cyber 有显著提升。注意:较新的竞争对手模型版本(Opus 4.6 之后)由于内置安全护栏而拒绝执行任务,因此未显示在图中。 #### 在 Chrome 生产提交扫描流水线中的成功率 (pass@1) 此外,与主线 3.5 Flash 和 Claude Opus 4.6 相比,3.5 Flash Cyber 始终能发现更多独特的漏洞。在固定调用次数下对高度复杂的 V8 JavaScript 引擎进行测试时,3.5 Flash Cyber 发现了 55 个独特的已确认问题,而主线 3.5 Flash 发现了 47 个,Opus 4.6 发现了 36 个,其中包括其他两个测试模型未能捕获的 10 个问题。 基本的网络安全模型可能会陷入循环,反复发现同一个问题,同时漏掉关键的漏洞。一个强大的模型能够撒下更大的网,发现更多独特的问题。 随着我们增加调用次数,我们发现 3.5 Flash Cyber 会持续发现新的代码路径和漏洞。 ## 在谷歌的实际应用与规模化防御 基准测试只是故事的一部分。CodeMender 中的 3.5 Flash Cyber 已经在谷歌内部代码库(包括 Chrome、Android、Cloud、Ads 和 YouTube)中发现并修复漏洞。 轻量级模型带来的发现速度已经产生了可衡量的影响。 例如,谷歌云漏洞研究团队使用 3.5 Flash Cyber 以前所未有的速度主动保护我们的系统。在短短 2 小时内,该模型就在公共 API 中发现了远程代码执行漏洞,并在一个敏感的生产服务中发现了内存损坏漏洞。然后它生成了一个 100% 可靠的远程代码执行漏洞利用,该利用绕过了地址空间布局随机化(ASLR)和写异或执行(W^X)等标准缓解技术。 来自 Wiz 和 Cloud CISO 安全工程测试人员的早期反馈证实,3.5 Flash Cyber 相比主线 3.5 Flash 模型有显著的能力提升。 ## 大规模赋能防御者 谷歌在软件安全领域的领先地位赋予我们独特的优势。例如,OSV.dev (https://osv.dev/),一个由谷歌运营的漏洞数据库,涵盖超过 70 万个开源漏洞,以及超过 10 年的 OSS-Fuzz (https://github.com/google/oss-fuzz) 结果,帮助我们识别最高质量的漏洞。 这使我们能够超越合成网络安全示例,并教会我们的模型真正的安全专业人员是如何工作的。我们的模型学会了操作行业标准工具,阅读 Chromium 等大规模项目中的数百万行代码,并独立处理需要数小时连续、深度分析的复杂安全任务。 通过用 3.5 Flash Cyber 驱动 CodeMender,我们提供了一种高性能、可扩展且经济实惠的架构,旨在帮助更多的防御者保护软件安全。

相似文章

Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Hacker News Top

Google 推出 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 模型,提升了 token 效率、降低了延迟,并为智能体工作流带来更优性能。其中,3.6 Flash 减少了 17% 的输出 token 用量,并在编程和知识任务中表现出色。

Gemini 3.6 Flash Family

Product Hunt

谷歌的 Gemini 3.6 Flash 系列推出了三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。