Gemini 4 Argon (High):智能、性能与价格分析

Hacker News Top 模型

摘要

Artificial Analysis 发布了对 Gemini 4 Argon (High) 的评测分析,涵盖其在 Intelligence Index v4.3.2 以及各项能力基准测试(如 AA-Briefcase、AA-Omniscience 等)上的智能与性能表现。

另见:<i>Gemini 4 Argon</i> - <a href="https:&#x2F;&#x2F;news.ycombinator.com&#x2F;item?id=49913571">https:&#x2F;&#x2F;news.ycombinator.com&#x2F;item?id=49913571</a>
查看原文
查看缓存全文

缓存时间: 2026/09/30 23:05

# Gemini 4 Argon (high) - 智能、性能与价格分析 | Artificial Analysis 来源:https://artificialanalysis.ai/models/gemini-4-argon ## 智能能力(已更新) ### Artificial Analysis 智能指数(https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index) Artificial Analysis 智能指数 v4.3.2 包含 10 项评测:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。有关更多详细信息,包括各项评测的拆解说明以及我们的测试运行方式,请参阅智能指数方法论(https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 ### 按开源权重 / 专有模型划分的 Artificial Analysis 智能指数 Artificial Analysis 智能指数 v4.3.2 包含 10 项评测:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。有关更多详细信息,包括各项评测的拆解说明以及我们的测试运行方式,请参阅智能指数方法论(https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 该指标表示模型权重是否可用。若商业使用受到条件限制,模型将被标记为"商业使用受限";若许可证禁止商业使用,则被标记为"非商业用途"。 ## 能力指数(https://artificialanalysis.ai/models/capabilities) 衡量模型在特定能力和行业场景下的表现 ### 智能评测 由 Artificial Analysis 独立评测 · 数值越高越好 智能体知识型工作,(Elo-500)/2000 智能体真实世界工作任务,(Elo-500)/2000 智能体编程与终端使用 专业文档推理,全部通过率 终端环境下的智能体科学研究工作流 MLCR-AA(https://artificialanalysis.ai/evaluations/mlcr-aa) 医疗领域长上下文推理 尽管模型的智能能力通常可以跨用例迁移,但特定评测对某些用例可能更具相关性。 Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。有关更多详细信息,包括各项评测的拆解说明以及我们的测试运行方式,请参阅智能指数方法论(https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 ### AA-Briefcase v1.1(已更新) ### AA-Briefcase Elo AA-Briefcase v1.1 是由 Artificial Analysis 开发的智能体知识型工作基准测试。AA-Briefcase Elo 是一个综合指标,汇总了评分表通过率、分析质量 Elo 和呈现质量 Elo · 数值越高越好 AA-Briefcase Elo 是一个综合指标,聚合了分析质量 Elo、呈现质量 Elo 和评分表通过率,其中评分表表现通过合成头对头对战转化为 Elo 分数。Elo 分数及 95% 置信区间上下限均被限制在 0 以上。 ### AA-Omniscience ### AA-Omniscience 指数 AA-Omniscience 指数(数值越高越好)衡量知识可靠性与幻觉表现。它奖励正确答案、惩罚幻觉,并且对拒答不施加扣分。分数范围为 -100 到 100,其中 0 表示正确答案与错误答案数量相等,负分表示错误答案多于正确答案。 AA-Omniscience 指数(数值越高越好)衡量知识可靠性与幻觉表现。它奖励正确答案、惩罚幻觉,并且对拒答不施加扣分。分数范围为 -100 到 100,其中 0 表示正确答案与错误答案数量相等,负分表示错误答案多于正确答案。 ## 智能指数对比 ### 智能指数 vs. 每次智能指数任务成本 Artificial Analysis 智能指数 · Artificial Analysis 智能指数任务的加权平均成本(美元) 每次智能指数任务的加权平均成本。每项评测的成本根据输入、缓存命中、缓存写入、推理和回答的 token 价格计算,除以任务数量后,再按其在智能指数中的权重加权。 Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。有关更多详细信息,包括各项评测的拆解说明以及我们的测试运行方式,请参阅智能指数方法论(https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 ## Token 消耗 ### 每次智能指数任务的输出 Token 数 运行 Artificial Analysis 智能指数中一项任务所使用的平均输出 token 数量(加权) 每次智能指数任务所需的 token 数量。该数值通过将每项评测的输出 token 数乘以各基准测试在智能指数中的相对权重,然后除以任务数量(不计重复执行)计算得出。 ## 成本 ### 每次智能指数任务成本 Artificial Analysis 智能指数任务的加权平均成本(美元),按 token 类型细分 · 数值越低越好 每次智能指数任务的加权平均成本。每项评测的成本根据输入、缓存命中、缓存写入、推理和回答的 token 价格计算,除以任务数量后,再按其在智能指数中的权重加权。 ### 运行 Artificial Analysis 智能指数的总成本 运行 Artificial Analysis 智能指数中所有评测的总成本(美元) 运行 Artificial Analysis 智能指数中各项评测的成本,根据模型的输入、缓存命中、缓存写入、推理和回答的 token 价格以及各评测所使用的 token 数量计算得出(不计重复执行)。 ### 定价:缓存命中、输入与输出 价格(美元 / 百万 token) 针对已处理过的缓存提示词(previously processed)的每 token 价格,通常相比常规输入价格有显著折扣,以每百万 token 的美元价格表示。此处显示的是缓存命中价格;缓存写入和缓存存储单独计费,且各提供商之间存在差异——详情请参阅"各提供商的缓存定价"。 ## 上下文窗口 ### 上下文窗口 上下文窗口:token 上限 · 数值越高越好 更大的上下文窗口与 RAG(检索增强生成)LLM 工作流密切相关,此类工作流通常涉及对大量数据的推理与信息检索。 输入与输出 token 的合并最大数量。输出 token 通常有明显更低的上限(因模型而异)。

相似文章

Gemini 4 Argon 基准测试

Reddit r/singularity

Google 的 Gemini 4 Argon 模型的基准测试结果已经曝光,显示出强劲的性能表现,表明 Google 在前沿 AI 竞争中极具竞争力。

Gemini 4 Argon:我们前沿智能的新纪元

Google DeepMind Blog

Google DeepMind 宣布推出 Gemini 4 Argon,这是一款面向深度推理的前沿模型,专为软件工程、企业知识工作和防御性网络安全中的长周期工作流而打造。初期将通过 Fairwind Program 向受信任的网络防御者逐步开放,之后再进行更广泛的推广。

Google 发布 Gemini 4 Argon,称其为迄今最强大的模型

TechCrunch AI

Google 推出了 Gemini 4 Argon,被描述为其迄今最强大的模型,专精于防御性网络安全、编码和长周期推理——目前正通过其 Fairwind 计划向部分网络安全合作伙伴推出,同时声称在基准测试中取得了超过 OpenAI 的 Astra 和 Anthropic 的 Fable 及 Opus 的最高分数。