GPT-5.6如何融合前沿智能与前沿效率
摘要
OpenAI发布了GPT-5.6模型系列,包括Sol、Terra和Luna,这些模型在显著提升效率和降低成本的同时实现了前沿智能,背后是推理和智能体框架的创新。
GPT-5.6在模型、推理和智能体工作流中提升了AI效率,有助于每美元提供更有用的智能。
查看缓存全文
缓存时间: 2026/07/29 21:58
# GPT-5.6 如何融合前沿智能与前沿效率
来源:https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency/
我们设计了 GPT‑5.6 模型系列,以在用户使用我们模型的各种任务中平衡能力与成本 (https://openai.com/index/gpt-5-6/)。我们的旗舰模型 GPT‑5.6 Sol 在启用最大推理能力时,在 Artificial Analysis 编码智能体指数上以不到一半的成本超越了 Claude Fable 5。Terra 在智能基准测试中的表现与 GPT‑5.5 相当,但价格仅为一半,而 Luna 是我们速度最快、价格最实惠的模型,价格比 Sol 低 80%。为了实现这些效率提升,我们的研究和技术团队在我们技术栈的每个主要层面都进行了重大优化。这些改进涵盖了我们的模型、推理(即我们如何运行模型以生成输出)以及我们的智能体框架——Codex 和 ChatGPT Work 均使用该框架。
在过去四年中,随着我们的模型扩展到 10 亿活跃用户和超过 200 万家企业,效率一直是让智能惠及所有人的核心。我们的使命是确保通用人工智能造福全人类。在这些年里,我们致力于持续解锁整个技术栈的更大优化,以便在成本-智能曲线的每个点上提供性能最优的模型。我们通过 GPT‑5.6 实现了迄今为止最大的每 Token 智能效率,该模型经过训练,能够实现每个 Token 完成更多工作 (https://openai.com/index/gpt-5-6/)。在训练中,我们同时优化任务成功率和效率,引导模型在任务中采取更直接的路径。
本文不仅探讨我们的模型,还分享我们如何通过其他两个主要技术栈部分的进步来设计效率,包括:
1. **推理**,通过优化负载均衡、推测解码、缓存和内核优化等流程,从相同硬件中获得更多输出;
2. **智能体框架**,包括更好地管理上下文膨胀、工具使用和重复工作。
我们还将分享 GPT‑5.6 Sol 在自主实现其中多项改进中的作用。虽然任何孤立的改进似乎有限,但这些成果的累积效应使我们能够同时提供前沿的智能和效率。
## 利用 GPT‑5.6 Sol 加速推理
在计算资源受限、模型需求增长快于容量的世界中,效率是每个系统设计的核心。这一点在我们的推理栈中尤其如此,它运行训练好的模型来生成响应。我们的主要目标是在相同硬件上服务更多 Token,同时保持用户期望的智能、延迟、可用性和可靠性。
实现这一目标需要优化整个系统。一个模型孤立地看可能非常高效,但如果请求分布不佳、硬件闲置或数据移动拖慢计算速度,提供服务仍然昂贵。每一层的改进都会产生累积效应,收益来自路由(请求发送到哪里)、调度(请求何时发送)、内核(在 GPU 上运行的软件)、缓存(保存和重用结果)以及模型实现(GPU 代码的执行顺序)的优化。Codex 中的 GPT‑5.6 Sol 在所有这些优化中发挥了关键作用。
第一个重要的例子是负载均衡。在全球范围内,我们根据地理位置、可用容量和加速器类型(运行模型的 GPU 或专用芯片类型)等因素路由请求。在集群内,我们根据负载、上下文长度、缓存可用性和其他请求属性在工作模型实例之间分配工作。在每个实例内,工作必须高效地分配到加速器、模型的子网络和计算核心。Codex 中的 GPT‑5.6 Sol 帮助我们分析生产流量,识别以前未被注意的不平衡来源,测试新的路由策略,并不断调整这些启发式方法。仅这些负载均衡的改进就显著降低了模型的推理成本。
我们还使用 GPT‑5.6 Sol 来优化模型的前向传播:即从输入转换为下一个 Token 预测的计算。即使单个操作很快,过多的内存移动、同步和低效的数据布局也可能导致 GPU 空闲。为了避免这种情况,GPT‑5.6 Sol 找到了可以预计算、避免或并行化的工作。借助 Codex,GPT‑5.6 Sol 自主重写并优化了我们的生产内核,即执行构成模型的数学运算的核心代码。这在一定程度上是因为我们训练了 GPT‑5.6,使其能够有效地使用 Triton (在新窗口中打开) (https://triton-lang.org/main/index.html) 和 Gluon (在新窗口中打开) (https://triton-lang.org/main/gluon/index.html) 这两种由 OpenAI 维护的开源 GPU 编程语言来编写和改进内核。这些努力,加上 GPT‑5.6 Sol 更广泛的内核改进,使端到端推理成本降低了 20%。我们还大力投资于验证工具,例如开源工具 FpSan (在新窗口中打开) (https://triton-lang.org/main/programming-guide/chapter-3/fpsan.html)(浮点清理器),以帮助验证 GPT‑5.6 Sol 编写的内核的正确性。
推测解码是提高速度和效率的另一个杠杆。该技术涉及在主模型旁边运行一个较小的草稿(或“推测器”)模型,提出多个 Token 供主模型并行验证。当这些提议被接受时,系统可以单次主模型推理生成多个输出 Token,从而减少昂贵的顺序计算量。GPT‑5.6 Sol 通过设计并运行数百个关于其架构的实验,测试大小、结构和特征的改变,改进了自身的草稿模型。此外,GPT‑5.6 Sol 启动并监控了推测器的训练过程,在出现问题时自主干预,包括硬件故障和训练不稳定。由此产生的改进使 Token 生成效率提高了 15% 以上。
当处理未缓存的输入 Token 时,模型在一次计算密集型过程中构建键值(KV)缓存;当生成输出时,它会反复读取并扩展该缓存。服务的最佳配置(如批处理、分片和 KV 管理)在很大程度上取决于工作负载——提示和输出长度、批大小、缓存命中率、查询特征等。然而,之前配置空间太大,无法系统地进行调整,迫使工程师依赖宽泛的启发式方法。借助 Codex 中的 GPT‑5.6 Sol,我们能够分析生产工作负载,生成并评估候选配置,并为每种场景超优化引擎和模型的配置方式。这使得一种新的工作负载特定优化变得切实可行,从而从相同硬件中提取更多有用的推理结果。
推理优化是一个持续的反馈循环。我们测量生产行为,识别最大的差距,实施变更,并验证它们是否改善了整个系统,而不仅仅是孤立的基准测试。GPT‑5.6 Sol 和 Codex 加速了这个循环的每个部分。这意味着我们的团队可以探索更多想法,更快地响应变化的工作负载,并为用户创建一个延迟更低、容量更高、成本更低的推理栈。
## 我们的智能体框架如何简化重复工作
ChatGPT Work 和 Codex 通过一系列模型请求和工具调用来完成复杂任务。在单轮交互中——从用户请求到最终响应——Codex 可能会检查源代码、搜索部署历史、阅读事件报告、编辑文件并运行测试。每个步骤都可能需要一个请求。
准备上下文、传输数据、运行推理、调用工具和启动进程都需要时间和计算。如果一个任务需要 30 次模型请求,每次请求多花一秒就会累积起来。提高整体性能意味着减少整个系统的重复工作,而不仅仅是让模型更快。
*一次用户交互可能包含许多模型和工具迭代。重复区域内的任何成本都可能被多次支付。*
这些乘数效应影响了我们设计智能体框架的方式,该框架是一个 Rust 编排层,连接我们的模型、工具和用户环境。接下来,我们将介绍如何通过避免上下文膨胀、加载工具和重用工作来提高每次请求的效率。
#### 避免上下文膨胀
随着智能体被授予更多工具、技能、插件和对话历史记录,上下文窗口很容易扩大。这会增加成本,分散模型注意力,并引发不必要的推理。智能体框架可以通过延迟发现来减少这种开销,使得集成、自定义 MCP 工具、技能和插件仅在需要时才可激活。该框架还防止单个工具和 MCP 集成意外消耗上下文窗口。默认情况下,工具输出被限制为 10,000 个 Token,除非模型请求不同的限制。
#### 保留精确前缀以进行提示缓存
如前所述,智能体循环可以在单轮交互中多次将相同的指令、对话历史记录、工具定义和早期结果发送到 GPU。处理这些重复输入是昂贵的,因此提示缓存重用与先前处理的提示前缀相关的计算。为了保留该前缀,框架将所有模型可见的历史记录视为只追加:新消息、工具结果和环境更新被添加到末尾,而不是插入到较早的上下文中。工具也以确定的顺序呈现,而运行时设置(如审批策略)在执行期间应用,而不是嵌入到工具定义中。这种设计选择有助于 Codex 和 ChatGPT Work 实现较高的整体提示缓存命中率。
*增量传输改变了网络传输的内容;提示缓存改变了模型可能避免重新计算的内容。宽度为概念性展示,未显示额外的压缩层。*
## 智能曲线上的效率
我们通过 GPT‑5.6 实现的效率提升是多年来整个技术栈(涵盖研究、推理和智能体框架)累积改进的结果。GPT‑5.6 在实现其中许多改进中扮演的角色让我们对未来优化加速步伐感到乐观。我们将继续在诸如内核优化等领域进行更大的优化,同时对我们技术栈进行基础性改进。我们期待将这些持续的、幕后的改进以更广泛可用、更具成本效益的智能形式回馈给我们的用户和客户。
*特别感谢技术团队成员 Matthew Ferrari、Philippe Tillet、Ahmed Ibrahim、Joe Gershenson 和 Steve Coffey 对本文的贡献。*
相似文章
新的GPT-5.6系列:Luna、Terra、Sol
OpenAI发布了GPT-5.6系列,提供三种规格(Luna、Terra、Sol),具有更强的智能体性能、新的API功能(如程序化工具调用和多智能体支持),以及相比Claude模型更具竞争力的定价。
OpenAI推出其全新模型系列GPT-5.6
OpenAI发布了GPT-5.6,这是一个包含三个模型(Sol、Terra、Luna)的系列,具有更高的效率、更强的网络安全能力以及有竞争力的定价,主要面向企业和编码任务。
GPT-5.6 Sol、Terra 和 Luna(阅读需 39 分钟)
OpenAI 宣布推出 GPT-5.6 预览版,新模型系列(Sol、Terra、Luna)增强了安全措施和能力,尤其在网络安全和生物风险方面,同时保持分层访问方式并与政府协调。
GPT-5.5 正式发布
OpenAI 发布了 GPT-5.5,这是其前沿 AI 模型的重大升级,在保持高效与速度的同时,在智能体编码、研究以及多步骤任务执行等方面具备更强的能力。
预览 GPT-5.6 Sol:下一代模型
OpenAI 预览了 GPT-5.6 系列,包括旗舰版 Sol、均衡版 Terra 和经济实惠版 Luna,具备改进的推理能力、智能体能力以及稳健的安全措施。在更广泛发布前,将进行有限预览。