NVIDIA 刚刚宣布发布 Nemotron 3 Ultra(2分钟阅读)
摘要
Anthropic 发布了其最智能的模型 Claude Opus 4.5,在 Artificial Analysis Intelligence Index 上获得 70 分,仅次于 Gemini 3 Pro。该模型在编码和智能体任务方面取得了显著进步,同时降低了每个token的价格,并保持了强劲的安全性能。
Nemotron 3 Ultra 拥有 550B 参数(55B 活跃),是来自美国的最智能开放权重模型。该模型将以 NVFP4 量化形式提供,以获得更高的推理性能。它在 Artificial Analysis Intelligence Index 上得分 48,远超得分 39 的下一个最强模型 Gemma 4 31B。Nemotron 3 Ultra 在预发布的 Deep Infra 端点上每秒可处理超过 300 个token。
查看缓存全文
缓存时间: 2026/06/02 15:41
# @ArtificialAnlys 在 Thread Reader App 上的推文
来源:https://threadreaderapp.com/thread/2061304911565144230.html
Anthropic 新发布的 Claude Opus 4.5 在 Artificial Analysis 智能指数中排名第二,仅次于 Google 的 Gemini 3 Pro,并与 OpenAI 的 GPT-5.1 (high) 持平。
Claude Opus 4.5 相比 Claude Sonnet 4.5(在 Artificial Analysis 智能指数上提升 +7 分)和 Claude Opus 4.1(提升 +11 分)实现了显著的智能跃升,成为 @AnthropicAI 的新旗舰模型。Anthropic 大幅降低了 Claude Opus 4.5 的每 token 价格,输入/输出每百万 token 仅需 $5/$25。然而,与之前的 Claude Opus 4.1 模型相比,它在完成我们的智能指数评估时多用了 60% 的 token(4800 万 vs. 3000 万)。这意味着运行智能指数评估的成本从 $3.1k 大幅降至 $1.5k,但实际降幅并不像表面价格削减那样显著。尽管 Claude Opus 4.5 在完成智能指数时使用了更多 token,但其成本仍显著高于其他模型,包括 Gemini 3 Pro (high)、GPT-5.1 (high) 和 Claude Sonnet 4.5 (Thinking),在所有模型中仅低于 Grok 4 (Reasoning)。
关键基准测试要点:
➤ 🧠 Anthropic 最智能的模型:在推理模式下,Claude Opus 4.5 在 Artificial Analysis 智能指数上得分为 70。这比 2025 年 9 月发布的 Claude Sonnet 4.5 (Thinking) 提升了 +7 分,比 Claude Opus 4.1 (Thinking) 提升了 +11 分。Claude Opus 4.5 现在是第二智能的模型,领先于 Grok 4 (65) 和 Kimi K2 Thinking (67),与 GPT-5.1 (high, 70) 持平,仅落后于 Gemini 3 Pro (73)。Claude Opus 4.5 (Thinking) 在 CritPt(一项前沿物理评估,反映研究助手能力)上得分为 5%,仅次于 Gemini 3 Pro (9%),并与 GPT-5.1 (high, 5%) 持平。
➤ 📈 编码和代理任务提升最大:与 Claude Sonnet 4.5 (Thinking) 相比,最大的提升出现在编码、代理任务和长上下文推理方面,包括 LiveCodeBench(+16 个百分点)、Terminal-Bench Hard(+11 个百分点)、τ2-Bench Telecom(+12 个百分点)、AA-LCR(+8 个百分点)和 Humanity's Last Exam(+11 个百分点)。Claude Opus 在 Artificial Analysis 智能指数涵盖的全部 10 个基准测试中均创下 Anthropic 最佳成绩。它在 Terminal-Bench Hard 上获得所有模型的最高分(44%),并在 MMLU-Pro 上与 Gemini 3 Pro 持平(90%)。
➤ 📚 知识与幻觉:在我们最新推出的 AA-Omniscience 指数(衡量语言模型的内嵌知识和幻觉程度)中,Claude Opus 4.5 以 10 分排名第二,仅次于 Gemini 3 Pro Preview (13),领先于 Claude Opus 4.1 (Thinking, 5) 和 GPT-5.1 (high, 2)。Claude Opus 4.5 (Thinking) 具有第二高的准确率(43%),幻觉率第四低(58%),仅落后于 Claude Haiku (Thinking, 26%)、Claude Sonnet 4.5 (Thinking, 48%) 和 GPT-5.1 (high)。Claude Opus 4.5 延续了 Anthropic 在 AI 安全方面的领先地位,其幻觉率低于 Grok 4 和 Gemini 3 Pro 等其他前沿模型。
➤ ⚡ 非推理性能:在非推理模式下,Claude Opus 4.5 在 Artificial Analysis 智能指数上得分为 60,是最智能的非推理模型,领先于 Qwen3 Max (55)、Kimi K2 0905 (50) 和 Claude Sonnet 4.5 (50)。
➤ ⚙️ Token 效率:Anthropic 继续展现出令人印象深刻的 token 效率。它在不显著增加 token 使用量的情况下提升了智能(与使用 64k token 最大推理预算评估的 Claude Sonnet 4.5 相比)。Claude Opus 4.5 运行 Artificial Analysis 智能指数使用了 4800 万个输出 token,低于其他前沿模型,如 Gemini 3 Pro (high, 9200 万)、GPT-5.1 (high, 8100 万) 和 Grok 4 (Reasoning, 1.2 亿)。
➤ 💲 定价:与 Claude Opus 4.1 相比,Anthropic 降低了 Claude Opus 4.5 的每 token 定价。Claude Opus 4.5 输入/输出每百万 token 定价为 $5/$25(相比之下,Claude Opus 4.1 为 $15/$75)。这使得它与 Claude Sonnet 4.5(每百万 token $3/$15)的价格更加接近,同时提供了更高的思考模式智能。
关键模型详情:
➤ 📏 上下文窗口:200K tokens
➤ 🪙 最大输出 tokens:64K tokens
➤ 🌐 可用性:Claude Opus 4.5 可通过 Anthropic 的 API、Google Vertex、Amazon Bedrock 和 Microsoft Azure 使用。Claude Opus 4.5 也可通过 Claude 应用和 Claude Code 使用。图片 (https://pbs.twimg.com/media/G6mNES2bwAIzoT3.jpg)
Claude 模型的一个关键差异化优势仍然是其 token 效率远高于所有其他推理模型。Claude Opus 4.5 在输出 token 没有大幅增加的情况下显著提升了智能,这与那些依赖推理时更多思考(即更多输出 token)的其他模型系列大不相同。在“Artificial Analysis 智能指数使用的输出 token vs. 智能指数”图表中,Claude 4.5 Opus (Thinking) 位于帕累托前沿。图片 (https://pbs.twimg.com/media/G6mNoWOb0AAYubD.jpg)
这种输出 token 效率使得 Claude Opus 4.5(在思考模式下)在运行 Artificial Analysis 智能指数时,能够比 Claude Opus 4.1 (Thinking) 和 Grok 4 (Reasoning) 提供更好的智能与成本权衡。图片 (https://pbs.twimg.com/media/G6mN9VvbkAAe82m.jpg)
相似文章
NVIDIA Nemotron 3 Ultra 已发布。
NVIDIA 发布了 Nemotron 3 Ultra,这是一款新模型,旨在为长期运行的 AI 智能体提供更快、更高效的推理能力。
NVIDIA推出的Nemotron 3 Ultra
NVIDIA推出了Nemotron 3 Ultra,这是一个新的人工智能模型,旨在为长时间运行的智能体提供更快、更高效的推理能力。
@TheAhmadOsman: 我现在将Nemotron 3 Ultra列为五大开源模型之一——前沿智能到家
作者将Nemotron 3 Ultra列为五大开源AI模型之一,称其为消费者带来前沿智能。
NVIDIA 发布 Nemotron 3 Nano Omni 模型,统一视觉、音频和语言处理,助力 AI Agent 效率提升高达 9 倍
NVIDIA 宣布推出 Nemotron 3 Nano Omni,这是一款开放的多模态模型,通过统一视觉、音频和语言处理,使 AI Agent 能够更快、更高效地运行。与其他开放式的 Omni 模型相比,其吞吐量最高可提高 9 倍。
@AfterQuery:恭喜 @nvidia 发布 Nemotron 3 Ultra!Ultra 在美国开源模型中大幅领先 GDPval-AA...
Nvidia 发布 Nemotron 3 Ultra,这是一款在美国开源模型中领先 GDPval-AA 基准的开源模型。