@StefanoErmon: 今天我们很高兴宣布 Mercury 2.5。它是目前市场上最强大的扩散大语言模型。它是智能方面40%的飞跃…

X AI KOLs Timeline 模型

摘要

Mercury 2.5 被宣布为最强大的扩散语言模型,智能方面比 Mercury 2 提升 40%,在 NVIDIA GPU 上运行速度超过每秒 1,100 个令牌,并针对生产进行了优化,具有低延迟和低成本。

今天我们很高兴宣布 Mercury 2.5。它是目前市场上最强大的扩散大语言模型。智能方面比 Mercury 2 提升 40%,并在广泛可用的 @NVIDIAAI GPU 上运行速度超过每秒 1,100 个令牌。https://inceptionlabs.ai/blog/introducing-mercury-2-5…
查看原文
查看缓存全文

缓存时间: 2026/09/09 01:46

今日我们激动地宣布推出Mercury 2.5——这是目前市场上能力最强的扩散语言大模型。其智能水平较Mercury 2提升40%,在主流@NVIDIAAI GPU上运行速度超过每秒1,100 tokens。https://inceptionlabs.ai/blog/introducing-mercury-2-5…


介绍Mercury 2.5 —— Inception

来源:https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 今天,我们发布了Mercury 2.5,这是我们迄今最强的生产模型。相较于Mercury 2,其质量实现了显著提升,同时保持了低延迟、低成本的推理特性。

自Mercury 2发布以来,已有数千名开发者基于它构建应用,数十家企业将其投入生产环境,使用量增长超过一个数量级。它现已在搜索、语音和编程产品中支撑对延迟敏感的工作负载。

这些实际应用为我们提供了比基准测试更清晰的反馈信号。我们通过客户反馈和生产环境中的故障案例来优化评估体系并聚焦训练方向。Mercury 2.5正是这一闭环迭代的首个成果。

核心改进

Mercury 2.5是目前市场上能力最强的扩散语言大模型。据我们所知,这是迄今为止训练规模最大的扩散语言模型。

  • 质量:智能水平较Mercury 2提升40%,可与GPT-5.6 Luna (Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5等成本优化的前沿模型相媲美。
  • 速度:在主流NVIDIA GPU上达到1,107 tokens/秒。
  • 上下文:支持260K tokens。
  • 价格:输入0.20/百万tokens,输出0.75/百万tokens。
    • 发布期间享受80%折扣:输入0.04/百万tokens,输出0.15/百万tokens。
  • 能力:可调推理、并行工具调用和结构化JSON输出。

速度基准测试:Mercury 2.5 vs Mercury 2.0

自Mercury 2发布以来,我们见证了Inception在NVIDIA AI基础设施上对扩散语言模型的持续突破。Mercury 2.5在智能水平的跃升,结合其持续的高速与低成本特性,展现了新架构在NVIDIA平台上快速成熟为生产就绪系统的潜力。

NVIDIA加速计算产品高级总监 Shruti Koparkar

Mercury生产应用实例

搜索智能体与RAG流程

单次搜索请求可能触发数十次模型调用:规划搜索策略、重写查询词、重排结果、结构化事实、总结信息源并验证答案。Mercury让这些调用保持足够快的速度,以融入单次用户交互。多家领先搜索基础设施公司现已将其投入生产。

查询重写延迟基准测试

语音智能体与交互应用

在语音场景中,延迟不是基础设施细节——它是呼叫者能感知到的停顿。

OpenCall构建了处理实时客户通话的AI语音代理。在实际生产负载中,Mercury将模型响应中位数延迟控制在约170毫秒。

“切换到Mercury后,我们的P99响应时间从数分钟降至仅1秒,P50从0.4秒降至0.2秒以下——这比我们见过的任何其他供应商都快得多,包括那些带推理能力的方案。”

OpenCall联合创始人兼CEO Oliver Silverstein

编程子智能体与助手

编程智能体通常将任务分配给不同模型:有的负责规划或编写代码,有的则搜索信息、运行工具、路由请求、总结状态或压缩长会话。这些辅助调用频繁发生,因此延迟和成本会快速累积。

Augment Code使用Mercury进行上下文压缩、模型路由和MCP工具搜索。将压缩任务迁移至Mercury后,延迟降低82%(从约150秒降至27秒),成本下降90%,同时保持质量。工具搜索摘要可在一秒内返回。

同样的高速体验适用于Web应用开发。请观看以下演示:Mercury 2.5如何根据简单提示生成一个可运行的音乐发现日志Web应用。

Mercury Voice与Mercury Router预览版

在发布Mercury 2.5的同时,我们宣布推出Mercury Voice (https://www.inceptionlabs.ai/models)和Mercury Router (https://www.inceptionlabs.ai/models)的预览版。

  • Mercury Voice 提供低于170毫秒的首token响应时间,是专为延迟预算最严格的语音智能体优化的扩散语言模型。
  • Mercury Router 使用扩散语言模型理解输入提示,并将其路由至在质量、速度和成本方面提供最佳平衡的模型(包括开源与闭源模型)。

快速开始

Mercury模型已通过Inception API、Baseten和OpenRouter提供服务。企业部署支持专属容量、自动扩缩容、合规管控及可配置的数据保留策略。

在chat中体验Mercury 2.5 (http://chat.inceptionlabs.ai/)
获取1亿免费tokens试用API
查阅API文档 (https://docs.inceptionlabs.ai/get-started/get-started)

  • Baseten用户:通过现有Baseten配置部署Mercury 2.5。
  • Y Combinator孵化企业:申请获取50万美元部署支持 (https://deals.ycombinator.com/deals/11140)。
  • 评估Mercury语音方案:我们将与您合作测试负载适配性,并在您的服务约束下验证性能。联系我们 (https://www.inceptionlabs.ai/enterprise#contact-sales)。

未来展望

我们已开始训练下一代模型。这将是我们迄今规模最大的模型,预计在未来数月内发布。下一代模型将在保持扩散模型的速度与token效率优势的同时,实现能力的重大跨越。这需要模型训练、推理优化、评估体系和基础设施的全面进步。如果您希望参与这类挑战,欢迎与我们联系 (https://www.inceptionlabs.ai/careers)。

更多信息即将公布。

相似文章

Mercury 2.5

Hacker News Top

Inception Labs 推出了 Mercury 2.5,这是一款基于扩散技术的语言模型,在智能、速度和成本效益方面均有提升,适用于搜索、语音和编程等生产环境。