Inception Labs 的 Mercury 2 AI 在 Google 的 DiffusionGemma 擅长的领域击败了它(4分钟阅读)

TLDR AI 模型

摘要

Inception Labs 发布了 Mercury 2,这是一个扩散语言模型,每秒可生成约1000个token,在 AIME 2026 基准测试中以 90% 对 69.1% 的得分优于 Google 的 DiffusionGemma,不过 DiffusionGemma 是免费且开源权重的,而 Mercury 2 是付费且闭源权重的 API 模型。

Mercury 2 是一个推理语言模型,每秒可生成约1000个token。它使用了扩散技术,与 Stable Diffusion 等图像生成器中将静态噪声转化为照片的技术相同。该模型最适合工作流中对速度敏感、高吞吐量的部分,而不是最前沿的推理任务。它仅通过 API/云提供服务。
查看原文
查看缓存全文

缓存时间: 2026/06/22 13:31

# Inception Labs 的 Mercury 2 击败谷歌 DiffusionGemma,重现其成功模式 来源:https://decrypt.co/371722/inception-labs-mercury-2-ai-beats-googles-diffusiongemma #### 简讯 - Inception Labs 的 Mercury 2 每秒生成约 1000 个 token,在 AIME 2026 上得分 90 - 谷歌最新的 DiffusionGemma 速度相近,但在基准测试中表现较差。 - DiffusionGemma 在 Hugging Face 上免费开源权重。Mercury 2 是付费的闭权重 API 模型。 Inception Labs 于周四发布了 Mercury 2,称其为全球最快的推理语言模型。根据公司公告,它每秒生成约 1000 个 token(AI 模型读写的基本文本块),相比之下,Anthropic 的 Claude Haiku 4.5 Reasoning 约为每秒 89 个 token,OpenAI 的 GPT-5 Mini 为每秒 71 个 token。 这与谷歌后来为 [DiffusionGemma](https://decrypt.co/370706/google-new-open-model-generates-text-diffusiongemma) 宣称的速度区间相当。 > 欢迎进入扩散时代。我们多年前就押注于并行生成,当时这还是一个反主流观点。很高兴看到行业成熟。Mercury 2 继续在公开可用的扩散大模型中引领质量、速度和成本的帕累托前沿。pic.twitter.com/qSHuiR7vmH (https://t.co/qSHuiR7vmH) — Inception (@_inception_ai) 2026年6月18日 (https://x.com/_inception_ai/status/2067747832573149352?ref_src=twsrc%5Etfw) 两种模型都摒弃了逐字逐句的写作方式。标准聊天机器人写一个词,检查刚写的内容,再写下一个,循环直到答案完成。而扩散模型则先用随机占位符 token 填充一个文本块,然后通过几次并行传递去除噪声——这与图像生成器(如 Stable Diffusion)中将静态噪声转化为照片的原理相同——直到整个块同时锁定为完整的回答。 两者的分歧在于这个过程中保留了什么。在 AIME 2026(基于真实的美国数学邀请赛试题,按正确解答百分比评分)上,Mercury 2 达到了 90%。谷歌在同一测试集上测试 DiffusionGemma,得分为 69.1%,而标准的非扩散 Gemma 4 在同一测试中得分为 88.3%。 在 GPQA(一个博士级别的科学基准测试,采用相同评分方式)上,两个模型几乎持平:Mercury 2 为 77%,DiffusionGemma 为 73.2%。但谷歌自己的开发者指南建议在要求最大质量的应用中使用标准 Gemma 4,承认 DiffusionGemma 在所有方面都落后。 速度声明在实验室外也站得住脚。根据一份[联合案例研究](https://www.inceptionlabs.ai/blog/rise-of-realtime-subagents),AI 编程代理公司 Augment Code 在其上下文压缩子代理中将 Mercury 2 替换为 Anthropic 的 Claude Opus 4.7,延迟降低了 82%,成本降低了 90%,同时报告输出质量相同。 Inception 建立在创始人 Stefano Ermon 的研究基础上,他是斯坦福大学教授,共同撰写了当前图像生成器所依赖的基于分数的扩散技术。这家初创公司 5000 万美元的融资轮吸引了英伟达的风险投资部门以及个人投资者 Andrew Ng 和 Andrej Karpathy 的支持。 对于非技术用户来说,大多数人直到体验到才会注意到的大问题是“流畅度”。传统模型会让您在一次长会话中等待思考间隙。像这样的扩散模型让 AI 感觉像是跟上了您的步伐——即时自动补全、对代码或计划进行快速迭代,以及能够处理繁重重复性工作而不会拖慢整个系统的子代理。 子代理层是一个有趣的架构转变。复杂的 AI 系统不再是一个巨大的智能模型。它们是由专业助手组成的管弦乐团:一个负责深度推理,几个负责快速摘要、路由、工具查找、输出检查等。顺序模型使这些工具调用变得昂贵且缓慢。并行扩散模型使它们足够便宜和快速,可以自由使用。 对普通用户来说的现实注意事项:这些模型仍然最适合工作流程中速度敏感、高容量的部分,而不是最艰难的前沿推理(目前最大的 AR 模型可能仍有优势)。Mercury 2 不是开源的,所以目前只能通过 API/云使用。而且像谷歌的版本一样,完整的生态系统(本地运行时、代理框架)仍在追赶,以使其在任何地方都能无缝运行。 立即可见的用例:实时快速编程和“氛围编码”,模型能跟上您的编辑;多代理编码或支持系统,其中会发生大量快速子调用;没有延迟感的语音界面;以及任何对延迟敏感的自动补全或下一步行动预测。在规模上,标准硬件上更高吞吐量带来的成本和能耗节省会迅速累积。 Inception 分享的数字(https://www.inceptionlabs.ai/models)(以及独立评估)直观地展示了这一点:Mercury 2 位于扩散模型的“又快又好”象限,将曾经需要特殊硬件的任务降级到普通 GPU 上运行。 ### 每日简报 **新闻通讯** 每天以当下最重要的新闻故事开始,还有原创特写、播客、视频等更多内容。

相似文章

DiffusionGemma

Simon Willison's Blog

Google 发布了 DiffusionGemma,这是一个采用 Apache 2 许可证的开源权重文本生成模型(总参数量 26B,活跃参数量 4B),通过 NVIDIA 的 NIM 云 API 展示了极高的推理速度。

google/diffusiongemma-26B-A4B-it

Hugging Face Models Trending

Google DeepMind 发布了 DiffusionGemma,这是一个 26B 参数的 Mixture-of-Experts 模型,使用离散扩散实现更快的文本生成,支持多模态输入和 256K token 上下文。

DiffusionGemma: 文本生成速度提升4倍

Hacker News Top

Google推出DiffusionGemma,这是一个实验性的26B MoE开源模型,通过文本扩散技术,在GPU上实现高达4倍的文本生成速度提升,针对速度要求高的交互式本地工作流。