Gemini 2.5:我们最智能的AI模型

Google DeepMind Blog 模型

摘要

Google推出了Gemini 2.5,这是其最智能的AI模型。Gemini 2.5 Pro Experimental在LMArena基准测试中领先优势显著,并通过改进的思维模型架构展现了增强的推理和编码能力。

Gemini 2.5是我们最智能的AI模型,现已内置思维能力。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:36

# Gemini 2.5:我们最智能的AI模型 来源:https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-model-thinking-updates-march-2025/ Gemini 2.5 是一款思维模型,旨在解决日益复杂的问题。我们的首个 2.5 模型 Gemini 2.5 Pro Experimental 在常见基准测试中领先幅度显著,并展示了强大的推理和代码能力。 五个发光的蓝色矩形,尺寸逐渐缩小,呈对角线排列在深色背景上,暗示深度和层次。 本文内容 - 介绍 Gemini 2.5 (https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-model-thinking-updates-march-2025/#gemini-2-5-thinking) - Gemini 2.5 Pro (https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-model-thinking-updates-march-2025/#gemini-2-5-pro) - 增强型推理 (https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-model-thinking-updates-march-2025/#enhanced-reasoning) - 高级编码 (https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-model-thinking-updates-march-2025/#advanced-coding) - Gemini 的精华 (https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-model-thinking-updates-march-2025/#building-on-best-gemini) *最后更新于 3 月 26 日* 今天,我们推出了 Gemini 2.5,我们最智能的 AI 模型。我们的首个 2.5 版本是 2.5 Pro 的实验版本,在广泛的基准测试中达到业界先进水平,并在 LMArena (https://lmarena.ai/?leaderboard) 上以显著优势排名第一。 Gemini 2.5 模型 (https://deepmind.google/technologies/gemini) 是思维模型,能够在回应之前进行思维推理,从而实现性能提升和准确度改进。 在 AI 领域,系统的"推理"能力不仅指分类和预测,更指其分析信息、得出逻辑结论、融合背景和细微差别、以及做出明智决策的能力。 长期以来,我们一直在探索通过强化学习 (https://www.nature.com/articles/nature16961) 和链式思维提示 (https://arxiv.org/abs/2201.11903) 等技术使 AI 更智能、推理能力更强的方法。在此基础上,我们最近推出了首个思维模型 Gemini 2.0 Flash Thinking (https://deepmind.google/technologies/gemini/flash-thinking/)。 如今,通过 Gemini 2.5,我们结合了显著增强的基础模型和改进的训练后处理,实现了新的性能水平。展望未来,我们将把这些思维能力直接构建到所有模型中,使其能够处理更复杂的问题,并支持更强大且更具上下文感知能力的智能体。 ## 介绍 Gemini 2.5 Pro Gemini 2.5 Pro Experimental 是我们针对复杂任务的最高级模型。它在 LMArena (https://lmarena.ai/?leaderboard) 排行榜上以显著优势排名首位——该排行榜衡量人类偏好——表明这是一个具有高质量风格的高能力模型。2.5 Pro 还展示了强大的推理和代码能力,在常见编码、数学和科学基准测试中领先。 Gemini 2.5 Pro 现已在 Google AI Studio (http://aistudio.google.com/app/prompts/new_chat?model=gemini-2.5-pro-exp-03-25) 和 Gemini 应用 (https://gemini.google.com/) 中面向 Gemini Advanced 用户提供,即将登陆 Vertex AI (https://console.cloud.google.com/freetrial?redirectPath=/vertex-ai/studio)。我们还将在未来几周推出定价,使用户能够以更高的速率限制使用 2.5 Pro 进行规模化生产。 3 月 26 日更新,新增 MRCR(多轮指代消解)评估 详细表格展示多个大型语言模型在数学、编码和推理等测试中的性能。Gemini 2.5 Pro 在多个类别中显示最高成绩,用突出显示的单元格表示。底部的脚注为数据提供背景信息。 ## 增强型推理 Gemini 2.5 Pro 在需要高级推理的各种基准测试中达到业界先进水平。在不使用增加成本的测试时间技术(如多数投票)的情况下,2.5 Pro 在 GPQA 和 AIME 2025 等数学和科学基准测试中领先。 在《人类最后的考试》(由数百位主题专家设计的数据集,旨在捕捉人类知识和推理的前沿)中,它在不使用工具的模型中获得业界先进的 18.8% 成绩。 条形图比较 Gemini 2.5 Pro 与其他 AI 模型(如 OpenAI GPT-4.5 和 Claude 3.7 Sonnet)在三个类别中的性能:推理、科学和数学。Gemini 2.5 Pro 在所有类别中都显示出强劲成绩。 ## 高级编码 我们一直专注于编码性能,通过 Gemini 2.5,我们相对于 2.0 取得了巨大飞跃——还会有更多改进。2.5 Pro 擅长创建视觉效果引人入胜的 Web 应用和智能体代码应用,以及代码转换和编辑。在行业标准的智能体代码评估 SWE-Bench Verified 上,Gemini 2.5 Pro 采用自定义智能体设置时得分为 63.8%。 以下是一个示例,展示 2.5 Pro 如何利用其推理能力通过单行提示生成可执行代码来创建视频游戏。 ## 构建 Gemini 的精华 Gemini 2.5 建立在使 Gemini 模型出色的基础之上——原生多模态和长上下文窗口。2.5 Pro 今天推出时配备 100 万 token 上下文窗口(200 万 token 即将推出),性能强劲且相比前代有所改进。它可以理解庞大的数据集,并处理来自不同信息源的复杂问题,包括文本、音频、图像、视频,甚至整个代码库。 开发者和企业现在可以在 Google AI Studio (http://aistudio.google.com/app/prompts/new_chat?model=gemini-2.5-pro-exp-03-25) 中开始试验 Gemini 2.5 Pro,Gemini Advanced (https://gemini.google.com/) 用户可以在桌面和移动设备上的模型下拉菜单中选择它。它将在未来几周内登陆 Vertex AI (https://console.cloud.google.com/freetrial?redirectPath=/vertex-ai/studio)。 一如既往,我们欢迎您的反馈,这样我们可以继续以快速的步伐改进 Gemini 令人印象深刻的新能力,目标是使我们的 AI 更有帮助。 ### 相关故事

相似文章

Gemini 2.5:我们最聪慧的模型进一步升级

Google DeepMind Blog

谷歌发布 Gemini 2.5 系列更新,包括性能改进的 2.5 Pro 和 Flash 模型,新增功能包括 Deep Think(增强型推理模式)、原生音频输出和通过 Project Mariner 实现的计算机使用能力。这些模型现已在 WebDev Arena 和 LMArena 排行榜中领先。

Gemini 3 开启智能新时代

Google DeepMind Blog

Google 发布了其迄今为止最智能的模型 Gemini 3,具备增强的推理能力和多模态功能。该模型现已集成到 Google 各产品中,面向 Ultra 订阅用户的「深度思考」复杂问题求解模式即将推出。

Gemini

Reddit r/singularity

谷歌的Gemini AI模型代表了多模态AI能力的重大进步。

推出 Gemini 2.5 计算机使用模型

Google DeepMind Blog

Google 通过 Gemini API 发布 Gemini 2.5 计算机使用模型,使开发者能够构建可通过点击、输入和滚动与用户界面交互的 AI 代理。该模型在网页和移动控制基准测试中表现优异,延迟更低,现已在 Google AI Studio 和 Vertex AI 中提供预览版。