Netomi 将智能体系统扩展至企业级应用的实践经验
摘要
Netomi 分享了在企业环境中扩展智能体 AI 系统的实践经验,利用 GPT-4.1 和 GPT-5.2 在受监管的执行层中处理复杂的多步骤工作流,服务于联合航空和 DraftKings 等财富500强客户。该公司展示了如何通过合适的提示词模式、并发设计和上下文推理,在生产规模上实现可靠的 AI 智能体部署。
Netomi 如何利用 GPT-4.1 和 GPT-5.2 扩展企业 AI 智能体——结合并发、治理和多步推理,实现可靠的生产工作流。
查看缓存全文
缓存时间: 2026/04/20 14:50
# Netomi 将智能代理系统规模化部署至企业的经验
来源:https://openai.com/index/netomi/
企业期望 AI 代理能够可靠地处理混乱的工作流程、默认遵守政策、在高负载下运行,并展示其工作过程。
Netomi\(在新窗口中打开\) (https://www.netomi.com/) 构建的系统能够满足这一高标准,服务于联合航空和 DraftKings 等财富 500 强客户。其平台将 GPT‑4.1 用于低延迟、可靠的工具调用,与 GPT‑5.2 用于更深层次的多步骤规划相结合,两者均运行在一个受控的执行层内,旨在确保模型驱动的操作在实际生产条件下保持可预测性。
以如此规模运行代理系统,让 Netomi 总结出了一套让这些系统在企业内部成功部署的蓝图。
> "我们的目标是编排人类客服通常需要同时处理的各种系统,并以机器速度安全地完成。"
Puneet Mehta,首席执行官
企业级请求很少能映射到单一 API。实际工作流程横跨预订引擎、忠诚度数据库、CRM 系统、政策逻辑、支付系统和知识库。数据通常是不完整、相互矛盾或具有时效性的。依赖僵硬流程的系统在这种多变性下会崩溃。
Netomi 设计的 Agentic OS 将 OpenAI 模型置于一个为应对此类歧义性而构建的受控编排管道的核心位置。该平台使用 GPT-4.1 进行快速、可靠的推理和工具调用——这对实时工作流至关重要——并在需要多步骤规划或更深层推理时使用 GPT-5.2。
为确保在长时间、复杂的任务中代理行为的一致性,Netomi 遵循了 OpenAI 推荐的代理提示模式:
- **持久性提醒**,帮助 GPT-5.2 在长跨度的多步骤工作流中保持推理连贯性
- **明确的工具使用预期**,通过引导 GPT-4.1 在事务性操作期间调用工具获取权威信息,从而抑制产生幻觉式的回答
- **结构化规划**,利用 GPT-5.2 更深入的推理能力来规划并执行多步骤任务
- **代理驱动的富媒体决策**,依靠 GPT-5.2 检测并指示何时应返回图片、视频、表单或其他丰富的多模态元素
这些模式共同帮助模型可靠地将非结构化请求映射到多步骤工作流,并在非连续的交互中维护状态。
很少有行业能像航空业那样清晰地展现对多步骤推理的需求。在航空业中,一次交互通常会涉及多个系统和政策层面。一个简单的问题就可能需要检查票价规则、重新计算忠诚度积分、发起机票变更,并与航班运营部门协调。
"在航空业,上下文每分钟都在变化。AI 必须理解客户所处的场景——而不仅仅是执行一个孤立的任务,"Mehta 说。"这就是为什么情境感知比单纯的工作流程重要得多,也是为什么以上下文为核心的集成架构至关重要。"
借助 GPT-4.1 和 GPT-5.2,Netomi 能够将这些模式持续扩展到更丰富的多步骤自动化中——模型不仅能回答问题,还能规划任务、序列化行动,并协调大型航空公司所依赖的后端系统。
在高压时刻——比如暴风雨期间重新订票、解决账单问题、或应对突发需求激增——任何犹豫的系统都会被用户抛弃。延迟决定了信任。
大多数 AI 系统失败是因为它们按顺序执行任务:分类 → 检索 → 验证 → 调用工具 → 生成输出。Netomi 则采用了并发设计,充分利用了 GPT-4.1 的低延迟流式传输和稳定的工具调用能力。
GPT-4.1 提供了快速的首次令牌生成时间和可预测的工具调用行为,这使得这种架构在规模上变得可行;而 GPT-5.2 则在需要时提供了更深入的多步骤推理路径。Netomi 的并发框架确保整个系统(而不仅仅是模型)保持在关键的延迟阈值以下。
这种并发需求并非航空业独有。任何面临突发极端流量激增的系统都需要同样的架构严谨性。例如,DraftKings 就经常对此类模型进行压力测试,在大型体育赛事期间,流量峰值可超过每秒 40,000 个并发客户请求。
在此类活动期间,Netomi 能够维持低于三秒的响应时间和 98% 的意图分类准确率,即使工作流程涉及账户、支付、知识查询和监管检查等多个环节。
"AI 在关键时刻如何支持客户方面,是核心且至关重要的,"DraftKings 联合创始人兼运营总裁 Paul Liberman 说道。"Netomi 的平台帮助我们以敏捷性和精确性应对巨大的活动量激增。"
在规模化的运行中,Netomi 的并发模型依赖于 GPT-4.1 快速且可预测的工具调用能力,这使得多步骤工作流即使在极端负载下也能保持响应。
企业级 AI 必须天生可信,治理机制应直接嵌入运行时,而非作为外部附加层。
当意图置信度低于阈值时,或者当请求无法以高确定性分类时,Netomi 的治理机制会介入,决定如何处理该请求,确保系统从自由生成模式退回到受控的执行路径。
在技术层面,治理层负责处理:
- **模式验证**,在执行前根据预期的参数和 OpenAPI 契约验证每一个工具调用
- **策略执行**,在推理和工具使用过程中内联应用主题过滤器、品牌限制和合规性检查
- **PII 保护**,在预处理和响应处理环节检测并屏蔽敏感数据
- **确定性回退**,当意图、数据或工具调用不明确时,回退到已知的安全行为
- **运行时可观测性**,暴露令牌追踪、推理步骤和工具链日志,用于实时检查和调试
在牙科保险等高度监管的领域,这种治理是强制性的。Netomi 的一位保险行业客户每年处理近 200 万个供应商请求,覆盖全美 50 个州,包括资格检查、福利查询和理赔状态查询——任何一个错误的响应都可能带来下游的监管或服务风险。
在开放注册期间,当审查和业务量达到顶峰时,该公司需要 AI 将策略强制执行作为运行时本身的一部分。Netomi 的架构满足了这一复杂要求。
"我们构建的系统使得如果代理遇到不确定性,它确切知道如何安全地回退,"Mehta 说。"治理不是事后添加的——它是运行时的一部分。"
Netomi 的经验展示了赢得企业信任所需的条件:为复杂性而构建、通过并行化满足延迟需求、并将治理融入每一个工作流程。OpenAI 模型构成了推理的核心,而 Netomi 的系统工程则确保了智能在操作上是安全、可审计的,并准备好应用于财富 500 强环境。
这些原则帮助 Netomi 在世界上一些要求最严苛的行业中进行规模化部署——并为任何希望将代理式 AI 转变为生产级基础设施的初创公司提供了蓝图。
在财富 500 强环境中部署代理系统需要速度、准确性和内置的治理能力。Netomi 的架构实现了这三者,即使在极端流量激增和复杂的多步骤工作流中也能保持性能。
- 在高流量事件中实现了低于三秒的响应时间
- 在规模化运行中保持了 98% 的意图分类准确率
- 处理了超过每秒 40,000 个并发客户请求的流量峰值
- 将治理机制直接嵌入运行时,具备确定性回退和策略执行能力
相似文章
构建企业级自主AI环境
英特尔的实验为企业领导者提供了构建自主AI基础设施的五项实用经验,强调这是一个超越推理的系统问题,并提供了代理密度和任务延迟等指标以有效部署。
为公司构建 AI Agent
作者分享了在工作中构建代理系统的经验教训,描述了使用巨型提示、过多工具和动态子代理的失败,最终通过固定编排器和针对每个领域的专业子代理取得成功。
企业AI现状
OpenAI发布了2025年企业AI采用报告,显示超过100万商业客户使用OpenAI工具,并呈现显著规模化指标:ChatGPT消息量增长8倍,API推理令牌消耗同比增长320倍。报告强调了可衡量的生产力提升(每天节省40-60分钟)、全球扩张,以及组织中AI领先者与落后者之间日益扩大的差距。
企业利用OpenAI在Cloudflare Agent Cloud中驱动智能代理工作流
Cloudflare与OpenAI合作,使OpenAI的前沿模型(包括GPT-5.4)可直接在Cloudflare Agent Cloud中访问,从而使企业能够大规模部署AI代理以执行实际任务。该集成还包括Codex工具,这些工具现已在Cloudflare Sandboxes中全面可用,并即将在Workers AI中提供。
OpenAI的GPT-5.6系列、训练机器人的新方法、模型调用模型
吴恩达解释了DeepLearning.AI选择课程主题和合作伙伴的'学习者优先'理念,强调基础AI工程技能而非供应商特定工具。