Mercury 2.5

Hacker News Top 模型

摘要

Inception Labs 推出了 Mercury 2.5,这是一款基于扩散技术的语言模型,在智能、速度和成本效益方面均有提升,适用于搜索、语音和编程等生产环境。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/08 21:43

# 介绍 Mercury 2.5 —— 起源 来源:https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 今日,我们发布了 Mercury 2.5,这是我们迄今为止功能最强大的生产模型。相较于 Mercury 2,它在质量上实现了显著提升,同时保持了低延迟、低成本的服务特性。 自 Mercury 2 发布以来,已有数千名开发者基于它进行构建,数十家企业将其投入生产环境使用量增长超过一个数量级。它目前为搜索、语音和编程产品中的延迟敏感型工作负载提供服务。 这些工作负载为我们提供了比基准测试更清晰的反馈信号。我们利用客户反馈和生产环境中的失败案例来优化评估体系并指导训练方向。Mercury 2.5 正是这一闭环流程的首个成果。 ## 主要改进 Mercury 2.5 是目前市场上能力最强的扩散语言模型。据我们所知,它是有史以来训练的最大扩散语言模型。 - **质量:** 较 Mercury 2 智能水平提升 40%。与 GPT-5.6 Luna(低)、Gemini 3.5 Flash-Lite 和 Claude Haiku 4.5 等成本优化的前沿模型表现相当。 - **速度:** 在广泛可用的 NVIDIA GPU 上达到每秒 1,107 token。 - **上下文:** 支持 260K token。 - **价格:** 输入 $0.20/百万 token,输出 $0.75/百万 token。- 发布初期享 80% 折扣:输入 $0.04/百万 token,输出 $0.15/百万 token。 - **能力:** 可调推理强度、并行工具调用、结构化 JSON 输出。 **速度基准测试**Mercury 2.5 对比 Mercury 2.0 自 Mercury 2 发布以来,我们目睹了 Inception 在 NVIDIA AI 基础设施上持续推进基于扩散的语言模型发展。Mercury 2.5 在智能水平提升的同时,持续保持高速与低成本,这反映了新架构在 NVIDIA 平台上快速成熟并投入生产系统的能力。 —— Shruti Koparkar,NVIDIA 加速计算组高级产品经理 ## Mercury 在生产环境中的应用 ### 搜索代理与 RAG 管线 一次搜索请求可能触发数十次模型调用:规划搜索、重写查询、重排结果、结构化事实、总结来源并验证答案。Mercury 使这些调用保持足够快的速度,以确保在单次用户交互内完成。目前多家领先的搜索基础设施公司已将其投入生产环境。 **查询重写延迟基准测试** ### 语音代理与交互式应用 在语音场景中,延迟并非基础设施细节,而是呼叫者听到的静默间隙。 OpenCall 构建处理实时客户来电的 AI 电话代理。在生产工作负载中,Mercury 将模型响应延迟中位数控制在约 170 毫秒。 “切换到 Mercury 后,我们的 P99 响应时间从数分钟降至仅一秒,P50 响应时间从 0.4 秒降至 0.2 秒以下——显著快于我们观察过的任何其他提供商,且包含推理时间。” —— Oliver Silverstein,OpenCall 联合创始人兼 CEO ### 编程子代理与辅助工具 编程代理已能跨模型分配工作:一个代理负责规划或编写代码,其他代理则执行搜索、运行工具、路由请求、总结状态或压缩长会话记录。这些辅助调用频繁发生,延迟和成本会快速累积。 Augment Code 使用 Mercury 进行上下文压缩、模型路由和 MCP 工具搜索。将压缩任务迁移至 Mercury 后,延迟降低 82%(从约 150 秒降至 27 秒),成本减少 90%,同时保持质量。工具搜索摘要在一秒内返回。 同样的速度优势也适用于 Web 应用开发。在以下演示中,观察 Mercury 2.5 如何通过几个提示词生成一个可运行的音乐发现日志 Web 应用。 ## Mercury Voice 与 Mercury Router 预览版 在发布 Mercury 2.5 的同时,我们宣布推出 Mercury Voice (https://www.inceptionlabs.ai/models) 和 Mercury Router (https://www.inceptionlabs.ai/models) 的预览版。 - **Mercury Voice** 实现首 token 延迟(TTFT)低于 170 毫秒,是专为延迟要求最严格的语音代理优化的扩散语言模型。 - **Mercury Router** 使用扩散语言模型理解输入提示,并将其路由至在质量、速度和成本方面提供最佳组合的模型(开源与闭源模型)。 ## 开始使用 Mercury 模型可通过我们的 Inception API、Baseten 和 OpenRouter 获取。企业部署支持专用容量、自动扩缩容、合规控制与可配置的数据保留策略。 **在聊天界面体验 Mercury 2.5** (http://chat.inceptionlabs.ai/)**使用 1 亿免费 token 试用 API** · **查阅 API 文档** (https://docs.inceptionlabs.ai/get-started/get-started) - **Baseten 客户:** 通过现有 Baseten 配置部署 Mercury 2.5。 - **Y Combinator 企业:** 领取 (https://deals.ycombinator.com/deals/11140) 50万美元部署权益。 - **评估 Mercury 用于语音场景?** 我们将与您合作测试工作负载适配性,并验证在您服务约束下的性能表现。联系我们 (https://www.inceptionlabs.ai/enterprise#contact-sales)。 ## 下一步计划 我们已开始训练下一代模型。这是我们迄今最大的模型,目标在未来几个月内发布。下一代模型将在不牺牲扩散模型速度与 token 效率的前提下实现能力飞跃。这需要模型训练、推理、评估和基础设施的共同进步。如果您希望参与这类挑战性工作,我们期待与您交流 (https://www.inceptionlabs.ai/careers)。 更多内容即将公布。

相似文章

Mercury逻辑编程系统

Hacker News Top

Mercury是一种逻辑/函数式编程语言,它将声明式编程与静态分析和错误检测相结合。该仓库提供了源代码、文档以及针对多个平台的后端支持。

Gemini 2.5:我们最聪慧的模型进一步升级

Google DeepMind Blog

谷歌发布 Gemini 2.5 系列更新,包括性能改进的 2.5 Pro 和 Flash 模型,新增功能包括 Deep Think(增强型推理模式)、原生音频输出和通过 Project Mariner 实现的计算机使用能力。这些模型现已在 WebDev Arena 和 LMArena 排行榜中领先。