Gemini 4 Argon:我们前沿智能的新纪元

Google DeepMind Blog 模型

摘要

Google DeepMind 宣布推出 Gemini 4 Argon,这是一款面向深度推理的前沿模型,专为软件工程、企业知识工作和防御性网络安全中的长周期工作流而打造。初期将通过 Fairwind Program 向受信任的网络防御者逐步开放,之后再进行更广泛的推广。

查看原文
查看缓存全文

缓存时间: 2026/09/30 20:10

# Gemini 4 Argon:前沿智能的下一个时代 来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content= Gemini 4 Argon 在复杂工作流中实现了前沿性能,覆盖现实世界的软件工程、法律与金融等企业知识工作,以及网络安全防御。 --- --- 风格化的推广博客主视觉图,带有现代编辑设计风格的品牌标识以及文字"Gemini 4 Argon" 您的浏览器不支持音频元素。 收听文章 约 \[\[时长\]\] 分钟 本内容由 Google AI 生成。生成式 AI 属实验性技术 本文内容 - 介绍 Gemini 4 Argon (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=#gemini4argon) - 改变我们在 Google 的工作与构建方式 (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=#changing) - 为最复杂的问题付出更多努力 (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=#workingharder) - 赋能跨领域的编程与企业工作流 (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=#enablingcoding) - 领跑防御性网络安全 (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=#defensivecybersecurity) - 在广泛开放前强化前沿安全保障 (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=#strengtheningsafeguards) - 即将推出 (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=#rollingout) 今天,我们宣布推出全新前沿模型 Gemini 4 Argon,它将通过我们的 Fairwind Program (https://deepmind.google/fairwind-program/) 向一批值得信赖的网络安全防御者开放。Argon 专为在复杂、长周期工作流中保持深度推理能力而构建,正在从根本上改变我们在 Google 的工作与构建方式。它在复杂工作流中实现了前沿性能,覆盖现实世界的软件工程、法律与金融等企业知识工作,以及网络安全防御。 安全地发布这一级别的前沿能力需要分阶段推进。我们正在积极参与美国政府关于模型预发布访问的自愿流程,同时逐步扩大访问范围。我们将继续收集早期测试者的反馈,在 Argon 面向开发者、企业和消费者开放之前不断迭代防护措施,争取尽快上线。 Argon 将以介绍性价格1 (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=#footnote-1)发布:每百万输入 token 定价 2 美元,每百万输出 token 定价 10 美元,缓存输入 token 在输入 token 价格基础上享 95% 折扣。 ## 改变我们在 Google 的工作与构建方式 Gemini 4 Argon 已经在为我们的内部工作流提供动力,数千名 Googler 强调了该模型在专业化编程任务、更深入的研究以及写作质量方面的优势。它正在帮助团队更快地构建产品,突破工程生产力的边界,并加速创新突破: - **量子算法优化:**Argon 正在帮助我们的量子计算研究人员优化那些制约重要应用的子程序的时空资源(量子比特 × 门)。在其中一个案例中,它在几分钟内就将结果超越已发表的基线 40%。 - **内存效率提升:**一个由 Argon 智能体组成的团队分析了全机群的性能剖析遥测数据,自主识别并应用了跨 Google 数据中心的内存优化,上线后可释放超过 300 TiB 的内存,预计总节省量可达 500 TiB 至 1 PiB。 - **大规模代码库迁移与优化:**Argon 智能体正在推动 Google 各处 C/C++ 代码库向 Rust 迁移——规模从 re2、libgav1 等核心库的数万行代码,扩展到 Fuchsia OS Zircon 内核的 80 万行以上。鉴于这些系统中许多的关键性,此类大规模重写在上线生产环境之前正经历严格的自动化与人工审计、模拟测试和审查。对于 Google 用于视频解码的开源软件 libgav1,Argon 智能体基于已有的 Rust 移植版本,通过运行多轮剖析引导实验、研究编译器的输出、编写安全的 Rust 代码以便编译器自动进行向量化,替换了 3.2 万行 SIMD 代码。最终结果是一个内存安全的视频解码器,速度比 Rust 移植版本快 2.7 倍,视频输出完全一致,使其性能更加接近优化后的 C++ 版本。 ## 为最复杂的问题付出更多努力 为支撑 Gemini 4 Argon 在更长、更复杂用例中的能力,我们大幅提升了模型的输出 token 上限至行业领先的 100 万 token(此前为 6.4 万 token)。当模型拥有足够的空间去深度思考并生成数十万 token 的单次推理轨迹时,它为一次性解决棘手问题增添了一个全新的推理深度。 一张展示 Gemini 4 Argon 能力的基准测试图表 ## 赋能跨领域的编程与企业工作流 Gemini 4 Argon 在编程、推理和多模态方面的能力,以及其执行长周期、多步骤任务的能力,使其能够在各类企业工作流中表现出色。 Google 工程师们一直在使用 Argon 完成日常工作,从日常调试到大规模代码库迁移和算法设计。它在 DeepSWE v1.1 上创下新的最先进水平(77.9%),该基准用于衡量模型在现实世界长周期软件工程任务中的表现。 在编程之外,Argon 是 Vals Index (https://www.vals.ai/benchmarks/vals_index) 上表现最佳的模型,该指数衡量模型在金融、编程、法律和税务工作中的经济影响,每个领域按其对美国 GDP 的贡献进行加权。我们在其他领域特定评估中也看到了同样领先的性能,例如 Vals Finance Agent v2(多步骤金融研究)和 Harvey 的 Legal Agent Benchmark(法律研究与文书起草)。在 AutomationBench——Zapier 用于衡量核心业务功能端到端执行能力的基准测试中——Argon 以 51.3% 的得分排名第一。 Argon 在需要视觉理解的知识工作中也表现出独特的强大能力。它能够进行专业的图表分析、从长视频中识别细节,并根据一系列文档采取行动。例如,在衡量长视频理解能力的 LVBench 上,Argon 以 91.7% 的得分位居最先进水平。 DeepSWE 评估图表 Vals Index 图表 Vals 金融基准图表 Harvey 基准图表 Automation Bench 图表 ## 领跑防御性网络安全 为更好地武装网络防御者以应对新时代的网络攻击,我们训练了 Gemini 4 Argon,使其具备出色的网络安全防御能力。Argon 能够自主发现、验证并修复关键软件漏洞。对于受信任的防御者以及 Google 内部团队,我们将发布不带网络安全限制的 Argon,以便他们能够充分利用其前沿级别的网络安全防御能力。 Wiz (https://www.wiz.io/) 已经通过其 Scan for Good (https://www.wiz.io/scan-for-good) 计划将 Argon 用于网络安全防御——该计划致力于免费发现并修复高风险暴露点,保护关键公共基础设施。在早期影响演示中,该模型发现了一个严重漏洞:全球医院使用的医疗软件中大量敏感个人信息遭到暴露,这一严重风险是此前的前沿模型所遗漏的。 在 CWE-bench v1 (https://cwe-bench.com/)——用于评估模型修复安全漏洞能力的基准测试中——Argon 以 68% 的最高分并列第一,这延续了 3.8 Flash Cyber 在 CWE-bench v0 (https://cwe-bench.com/?v=v0) 上的前沿表现。 CWE 基准图表 Gemini 4 Argon 相比 3.8 Flash Cyber 在漏洞发现方面实现了令人印象深刻的飞跃。例如: - 在 Google 内部的综合漏洞基准测试中,Argon 在横跨 20 种编程语言的复杂代码库中发现了大量漏洞暴露。 - 在 Wiz 内部的黑盒渗透测试基准中——该测试衡量模型在没有源代码的情况下分析在线 Web 系统的能力——Argon 在发现攻击面、识别漏洞以及生成验证用的概念证明方面均超越了 3.8 Flash Cyber。 安全漏洞图表 ## 在广泛开放前强化前沿安全保障 在广泛推出 Gemini 4 Argon 之前,我们正在继续围绕四个主要方向强化关键的前沿安全保障: **防范滥用:**为防止恶意行为者将 Argon 用于网络攻击或化学、生物、放射性和核(CBRN)攻击,该模型的设计遵循我们的 Frontier Safety Framework (https://deepmind.google/blog/strengthening-our-frontier-safety-framework/),在拒绝有害请求的同时保留正当的、具有双重用途的科学研究。我们正在为此次发布强化防护措施的稳健性,包括改进监测模型内部激活 (https://arxiv.org/abs/2601.11516) 以发现滥用行为的技术。这些防护措施已经过内部和外部红队使用手工与自动化攻击方法组合的稳健性测试。 **防范提示词注入攻击:**Argon 也是我们迄今抗间接提示词注入能力最强的模型。间接提示词注入指恶意指令或上下文被用来劫持模型行为。这是一类复杂的攻击,需要持续警惕和多层防御。通过自动化红队测试和对抗训练,Gemini 4 Argon 在 Gray Swan 的 Indirect Prompt Injection(IPI)基准测试中的提示词注入稳健性方面处于领先地位。 Gray Swan 评估图表 **监测对齐偏差:**为防止 Argon 越界并以超出用户意图的方式尝试完成任务,我们正在部署对齐偏差缓解措施,监测 Argon 的思维链与行动,并在必要时中止执行。 我们使用类似的系统来监测训练运行过程,并向专门的事件响应团队发送警报,同时谨慎采取措施避免将发现结果回流到训练中,以免影响 Argon 的推理方式使其学会规避我们的监测。我们强烈鼓励整个行业 (https://institute.deepmind.com/essays/the-case-for-reasoning-transparency/) 在能力提升的关键时刻,在应对对齐风险的同时保持推理透明度,使模型的思考过程在识别和诊断对齐偏差方面继续发挥帮助作用。 **加固系统:**随着前沿模型能力不断增强,安全地测试它们需要能够跟上模型系统本身的高安全环境。与我们的智能体控制路线图 (https://deepmind.google/blog/securing-the-future-of-ai-agents/) 保持一致,我们正在加固沙箱环境,在高风险训练或评估开始前对其进行隔离和封闭。我们承诺与合作伙伴共享这些智能体安全最佳实践,以提升整个生态系统的安全性。 ## 即将推出 我们构建 Gemini 4 Argon,赋予其在编程、知识工作、网络安全防御和创意写作方面的前沿级能力,旨在成为开发者、专业人士和企业在应对最艰难问题时的伙伴。我们感谢最初一批网络防御者和受信任的测试者,他们的现实评估和反馈将帮助我们在向开发者、企业(从付费 API 客户和 Google AI Ultra 订阅者开始)和消费者开放之前,进一步强化我们的系统。

相似文章

Google 发布 Gemini 4 Argon,称其为迄今最强大的模型

TechCrunch AI

Google 推出了 Gemini 4 Argon,被描述为其迄今最强大的模型,专精于防御性网络安全、编码和长周期推理——目前正通过其 Fairwind 计划向部分网络安全合作伙伴推出,同时声称在基准测试中取得了超过 OpenAI 的 Astra 和 Anthropic 的 Fable 及 Opus 的最高分数。

Google 宣布 Gemini 4 Argon AI 模型,但目前还无法使用

Ars Technica

Google 宣布了 Gemini 4 Argon,一款新的前沿 AI 模型,声称在编码、知识工作和网络安全方面拥有行业领先性能,但目前仍处于有限的内部测试阶段,仅公布了 API 定价和 100 万 token 的输出上限。

# Google 发布 Gemini 4,并称其能力过于强大,目前仅向“可信的网络防御者”开放 Google 已正式宣布推出 Gemini 4。公司表示,鉴于该模型展现出的强大能力,现阶段仅对被认定为“可信网络防御者”的用户提供访问权限。

The Verge

Google 发布了 Gemini 4 Argon,这是其下一代前沿 AI 模型,在软件工程、企业办公和网络安全领域表现出色。不过,由于该模型正处于美国政府自愿性预发布审查流程之中,目前 Google 仅向受信任的网络安全防护人员开放初期访问权限。