Gemini 4 Argon (High):智能、性能与价格分析
摘要
Artificial Analysis 发布了对 Gemini 4 Argon (High) 的评测分析,涵盖其在 Intelligence Index v4.3.2 以及各项能力基准测试(如 AA-Briefcase、AA-Omniscience 等)上的智能与性能表现。
另见:<i>Gemini 4 Argon</i> - <a href="https://news.ycombinator.com/item?id=49913571">https://news.ycombinator.com/item?id=49913571</a>
查看缓存全文
缓存时间:
2026/09/30 23:05
# Gemini 4 Argon (high) - 智能、性能与价格分析 | Artificial Analysis
来源:https://artificialanalysis.ai/models/gemini-4-argon
## 智能能力(已更新)
### Artificial Analysis 智能指数(https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index)
Artificial Analysis 智能指数 v4.3.2 包含 10 项评测:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1
Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。有关更多详细信息,包括各项评测的拆解说明以及我们的测试运行方式,请参阅智能指数方法论(https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
### 按开源权重 / 专有模型划分的 Artificial Analysis 智能指数
Artificial Analysis 智能指数 v4.3.2 包含 10 项评测:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1
Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。有关更多详细信息,包括各项评测的拆解说明以及我们的测试运行方式,请参阅智能指数方法论(https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
该指标表示模型权重是否可用。若商业使用受到条件限制,模型将被标记为"商业使用受限";若许可证禁止商业使用,则被标记为"非商业用途"。
## 能力指数(https://artificialanalysis.ai/models/capabilities)
衡量模型在特定能力和行业场景下的表现
### 智能评测
由 Artificial Analysis 独立评测 · 数值越高越好
智能体知识型工作,(Elo-500)/2000
智能体真实世界工作任务,(Elo-500)/2000
智能体编程与终端使用
专业文档推理,全部通过率
终端环境下的智能体科学研究工作流
MLCR-AA(https://artificialanalysis.ai/evaluations/mlcr-aa)
医疗领域长上下文推理
尽管模型的智能能力通常可以跨用例迁移,但特定评测对某些用例可能更具相关性。
Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。有关更多详细信息,包括各项评测的拆解说明以及我们的测试运行方式,请参阅智能指数方法论(https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
### AA-Briefcase v1.1(已更新)
### AA-Briefcase Elo
AA-Briefcase v1.1 是由 Artificial Analysis 开发的智能体知识型工作基准测试。AA-Briefcase Elo 是一个综合指标,汇总了评分表通过率、分析质量 Elo 和呈现质量 Elo · 数值越高越好
AA-Briefcase Elo 是一个综合指标,聚合了分析质量 Elo、呈现质量 Elo 和评分表通过率,其中评分表表现通过合成头对头对战转化为 Elo 分数。Elo 分数及 95% 置信区间上下限均被限制在 0 以上。
### AA-Omniscience
### AA-Omniscience 指数
AA-Omniscience 指数(数值越高越好)衡量知识可靠性与幻觉表现。它奖励正确答案、惩罚幻觉,并且对拒答不施加扣分。分数范围为 -100 到 100,其中 0 表示正确答案与错误答案数量相等,负分表示错误答案多于正确答案。
AA-Omniscience 指数(数值越高越好)衡量知识可靠性与幻觉表现。它奖励正确答案、惩罚幻觉,并且对拒答不施加扣分。分数范围为 -100 到 100,其中 0 表示正确答案与错误答案数量相等,负分表示错误答案多于正确答案。
## 智能指数对比
### 智能指数 vs. 每次智能指数任务成本
Artificial Analysis 智能指数 · Artificial Analysis 智能指数任务的加权平均成本(美元)
每次智能指数任务的加权平均成本。每项评测的成本根据输入、缓存命中、缓存写入、推理和回答的 token 价格计算,除以任务数量后,再按其在智能指数中的权重加权。
Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。有关更多详细信息,包括各项评测的拆解说明以及我们的测试运行方式,请参阅智能指数方法论(https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
## Token 消耗
### 每次智能指数任务的输出 Token 数
运行 Artificial Analysis 智能指数中一项任务所使用的平均输出 token 数量(加权)
每次智能指数任务所需的 token 数量。该数值通过将每项评测的输出 token 数乘以各基准测试在智能指数中的相对权重,然后除以任务数量(不计重复执行)计算得出。
## 成本
### 每次智能指数任务成本
Artificial Analysis 智能指数任务的加权平均成本(美元),按 token 类型细分 · 数值越低越好
每次智能指数任务的加权平均成本。每项评测的成本根据输入、缓存命中、缓存写入、推理和回答的 token 价格计算,除以任务数量后,再按其在智能指数中的权重加权。
### 运行 Artificial Analysis 智能指数的总成本
运行 Artificial Analysis 智能指数中所有评测的总成本(美元)
运行 Artificial Analysis 智能指数中各项评测的成本,根据模型的输入、缓存命中、缓存写入、推理和回答的 token 价格以及各评测所使用的 token 数量计算得出(不计重复执行)。
### 定价:缓存命中、输入与输出
价格(美元 / 百万 token)
针对已处理过的缓存提示词(previously processed)的每 token 价格,通常相比常规输入价格有显著折扣,以每百万 token 的美元价格表示。此处显示的是缓存命中价格;缓存写入和缓存存储单独计费,且各提供商之间存在差异——详情请参阅"各提供商的缓存定价"。
## 上下文窗口
### 上下文窗口
上下文窗口:token 上限 · 数值越高越好
更大的上下文窗口与 RAG(检索增强生成)LLM 工作流密切相关,此类工作流通常涉及对大量数据的推理与信息检索。
输入与输出 token 的合并最大数量。输出 token 通常有明显更低的上限(因模型而异)。
相似文章
Reddit r/singularity
Google 的 Gemini 4 Argon 模型的基准测试结果已经曝光,显示出强劲的性能表现,表明 Google 在前沿 AI 竞争中极具竞争力。
Reddit r/singularity
AA 基准测试结果显示,Gemini 4 拥有较高的智能指数(53),而成本约为 Opus 5.5 的三分之一,体现出出色的质量成本比。
Reddit r/MachineLearning
讨论 Gemini 4 Argon 的 100 万 token 输出窗口相比 Opus 5.5 与 Astra 的 128-300K 的优势,探讨这究竟是智能体任务的范式跃迁,还是营销炒作及潜在的逻辑崩塌风险。
Google DeepMind Blog
Google DeepMind 宣布推出 Gemini 4 Argon,这是一款面向深度推理的前沿模型,专为软件工程、企业知识工作和防御性网络安全中的长周期工作流而打造。初期将通过 Fairwind Program 向受信任的网络防御者逐步开放,之后再进行更广泛的推广。
TechCrunch AI
Google 推出了 Gemini 4 Argon,被描述为其迄今最强大的模型,专精于防御性网络安全、编码和长周期推理——目前正通过其 Fairwind 计划向部分网络安全合作伙伴推出,同时声称在基准测试中取得了超过 OpenAI 的 Astra 和 Anthropic 的 Fable 及 Opus 的最高分数。