构建企业级自主AI环境
摘要
英特尔的实验为企业领导者提供了构建自主AI基础设施的五项实用经验,强调这是一个超越推理的系统问题,并提供了代理密度和任务延迟等指标以有效部署。
<p>对于企业而言,自主AI的前景远不止是更好的聊天机器人。它是能够跨人员、业务流程、数据和系统端到端执行业务任务的软件代理。最适合运行代理的平台应具备适当的CPU容量、弹性的数据访问、策略感知的工具使用、可观测性、内存管理,以及可预测地规划和扩展代理的能力。</p>
<figure class="wp-block-image size-full"><img loading="lazy" decoding="async" width="1280" height="720" src="https://wp.technologyreview.com/wp-content/uploads/2026/07/Intel-image-contributed-article.png" alt="" class="wp-image-1140679" srcset="https://wp.technologyreview.com/wp-content/uploads/2026/07/Intel-image-contributed-article.png 1280w, https://wp.technologyreview.com/wp-content/uploads/2026/07/Intel-image-contributed-article.png?resize=300,169 300w, https://wp.technologyreview.com/wp-content/uploads/2026/07/Intel-image-contributed-article.png?resize=768,432 768w" sizes="auto, (max-width: 1280px) 100vw, 1280px" /></figure>
<p>为了更好地理解这些依赖关系,英特尔进行了数千次自主AI工作负载实验。我们的初步发现总结并支持了为企业领导者提供的五项实用经验:</p>
<ol class="wp-block-list">
<li>自主AI是一个更大的系统问题,而不仅仅是推理问题。</li>
<li>大多数现有的自主AI框架存在局限,无法衡量整体系统性能。</li>
<li>容量规划应使用每虚拟CPU(vCPU)的代理密度,而非代理数量。</li>
<li>监控代理任务延迟,而不仅仅是平均CPU利用率。</li>
<li>对于托管代理的系统,默认采用横向扩展。将纵向扩展留给每代理计算量更重或存在架构约束的工作负载。</li>
</ol>
<h3 class="wp-block-heading"><strong>超越推理:代理作为工作流自动化</strong></h3>
<p>自主AI不仅仅是LLM推理。其企业价值取决于整个系统:任务编排、数据访问、工具执行、延迟管理、治理和可扩展的基础设施。代理是一种目标驱动的自动化企业工作流流程:它规划多步骤任务、调用工具、读取结果,并在失败时重试。因此,企业代理不仅仅是推理问题,而是一个系统问题。</p>
<p><strong>定义何为良好</strong></p>
<p>大多数自主AI评估指标侧重于评估所用的LLM。平台团队还需要了解任务耗时、系统能支持多少代理、执行过程结束时用户的体验,以及同时运行更多代理时成本如何变化。</p>
<p>更有用的企业视角关注六个指标:</p>
<ol class="wp-block-list">
<li>任务成功率</li>
<li>每任务成本</li>
<li>每任务时间</li>
<li>任务吞吐量</li>
<li>代理密度(每vCPU代理数)</li>
<li>延迟</li>
</ol>
<p>这些指标共同回答了企业AI运营者关心的问题:系统是否按预期运行?系统能支持多少代理?应如何扩展以支持更多代理?</p>
<h3 class="wp-block-heading"><strong>奠定坚实基础</strong></h3>
<p>为了更深入地了解自主AI工作负载性能,英特尔扩展了<a href="https://github.com/harbor-framework/terminal-bench" target="_blank" rel="noreferrer noopener">Terminal-Bench</a>,这是一个开源基准测试框架,用于评估AI代理,具备性能分析、遥测和重放功能。这使得我们能够了解代理在LLM推理之外的时间消耗。</p>
<p>该基准测试扩展使用了确定性的LLM响应记录重放,将代理性能与LLM可变性分离。LLM响应被记录一次,并在多次运行中完全相同地重放,从而减少运行间差异,为比较提供更可靠的基础。</p>
<p>使用的Terminal-Bench任务组合故意广泛。它包括编译、测试、数据库操作、布尔逻辑、解释、光线追踪、压缩、线性代数、视频转码和机器学习训练。这种多样性使得发现更贴近真实的企业环境。</p>
<h3 class="wp-block-heading"><strong>自主AI的三个维度</strong></h3>
<p>部署自主AI应分三个阶段进行:</p>
<p><strong>根据代理密度而非代理数量进行规划</strong>:第一个规模规划规则是将代理数量按可用计算资源归一化。代理密度(以每vCPU代理数衡量)是饱和度的首要信号。例如,在8 vCPU系统上运行10个代理与在16 vCPU系统上运行20个代理,若密度相同,则行为相似。这为架构师提供了一种跨实例大小和处理器代际比较容量可移植的方法。</p>
<p>合适的密度还取决于业务目标。交互式副驾驶和面向用户的助手应偏好较低密度,因为响应时间至关重要。批处理工作负载(如IT工作流)通常可以运行在较高密度下。这为团队提供了一种实用方法,根据服务级别目标和总拥有成本来调整集群。</p>
<p>自主AI需要一种新的可观测性:平均CPU利用率对于自主工作负载来说是一个较弱的主要性能监控信号。代理经常在等待模型响应和进行短时密集计算之间交替。由于这种“突发”模式,即使这些突发正在创建队列并拖慢用户体验,平均利用率看起来也可能可以接受。任务延迟(P95)是更好的领先指标。即使在平均任务持续时间明显恶化之前,它就能显示工作流何时开始等待。一个实用的运营模式是首先对P95延迟发出警报,然后通过观察持续的任务持续时间来确认问题。</p>
<p><strong>默认采用横向扩展:</strong>横向扩展增加更多系统,提升总代理容量;而纵向扩展为单系统增加核心或内存,适用于计算突发更重的代理。</p>
<p>我们的测试数据表明,横向扩展通常是更好的默认选择。这与代理通常半独立且每代理突发较小的事实相符:它能提升整体性能,支持高可用性,通常降低成本,并且随着平台增长更容易维持目标代理-每vCPU比率。</p>
<p>当代理需要更重的并行计算、共享状态限制分区、内存局部性重要或存在许可约束时,则应采用纵向扩展。</p>
<p><strong>考虑业务影响:</strong>自主AI首先会在哪里创造业务价值?获得生产级成果的组织正在围绕已有编码规则和可衡量服务级别的工作流(如代码创建、回归测试农场、工单分类、市场分析和安全审查)包裹自动化层。</p>
<p>因此,自主AI的理想企业角色并非追求新奇性的实验用户,而是负责任的领导者,他们必须缩短周期时间、提高生产力、保护服务质量、执行政策,并在考虑成本的前提下扩展采用规模。 </p>
<p>自主AI的价值来自帮助企业在团队、系统、数据和流程之间完成实际工作。对于企业而言,优先事项不仅是更好的模型性能,更是创建一个可靠的环境,使AI代理能够支持业务工作流、提高生产力、在治理要求内运行,并随着采用增长而扩展。</p>
<p>在实践中,成功运用自主AI取决于正确的基础,以提供一致的结果、管理成本、保持控制,并从试点顺利过渡到生产。</p>
<p><em>本文内容由英特尔制作,并非由《麻省理工科技评论》编辑团队撰写。</em><br><br><b
查看缓存全文
缓存时间: 2026/07/27 13:41
# 为代理型AI构建企业环境
来源:https://www.technologyreview.com/2026/07/27/1140668/building-the-enterprise-environment-for-agentic-ai
对企业而言,代理型AI的潜力远不止于一个更出色的聊天机器人。它是由软件代理组成,能够跨人员、业务工作流、数据和系统,端到端地执行业务任务。最适合运行代理的平台应具备适当的CPU容量、弹性的数据访问、策略感知的工具使用、可观测性、内存管理,以及可预测地规划和扩展代理的能力。
为了更好地理解其中一些依赖关系,Intel 执行了数千次代理型AI工作负载实验。我们的初步发现为企业领导者总结并支撑了五条实用经验:
1. 代理型AI是一个更大的系统问题,而不仅仅是推理问题。
2. 现有的大多数代理型AI框架都存在局限性,无法衡量整体系统性能。
3. 容量规划应基于每虚拟CPU(vCPU)的代理密度,而非代理总数。
4. 监控代理任务延迟,而非仅监控平均CPU利用率。
5. 承载代理的系统默认采用横向扩展。对于每代理计算负载更重或存在架构约束的工作负载,则保留纵向扩展。
### **超越推理:代理即工作流自动化**
代理型AI不仅仅是LLM推理。其企业价值取决于整个系统、任务编排、数据访问、工具执行、延迟管理、治理和可扩展的基础设施。代理是一个目标驱动的自动化企业工作流过程:它规划多步骤任务、调用工具、读取结果,并在失败时重试。因此,企业代理不只是推理问题,更是一个系统问题。
**定义理想状态**
大多数代理型AI指标侧重于评估所使用的LLM。平台团队还需要了解任务耗时、一个集群能支持多少个代理、用户在执行过程结束时的体验,以及当多个代理同时工作时成本如何变化。
一个更有用的企业视角关注以下六个指标:
1. 任务成功率
2. 每任务成本
3. 每任务时间
4. 任务吞吐量
5. 代理密度(每vCPU的代理数)
6. 延迟
这些指标共同回答了企业AI运营者关心的问题:系统是否按预期运行?系统能支撑多少个代理?应如何扩展以支持更多代理?
### **建立在坚实基础之上**
为了更深入地了解代理型AI工作负载性能,Intel 扩展了 Terminal-Bench(https://github.com/harbor-framework/terminal-bench),这是一个开源基准测试框架,用于评估AI代理,具备性能分析、遥测和回放能力。这使我们能够了解代理在LLM推理之外的时间消耗。
该基准测试扩展采用确定性记录-回放LLM响应,将代理性能与LLM可变性分离。LLM响应被记录一次,然后在各次运行中完全相同地回放,从而减少运行间的差异,并提供一个更可靠的比较基础。
所使用的Terminal-Bench任务组合刻意广泛,包括编译、测试、数据库操作、布尔逻辑、解释、光线追踪、压缩、线性代数、视频转码和机器学习训练。这种广泛的多样性使结果更贴近真实企业环境。
### **代理型AI的三维度**
部署代理型AI应分三个阶段进行:
**按代理密度而非代理总数进行规划**:首要的规模确定规则是将代理数量归一化到可用计算资源上。代理密度(以每vCPU的代理数衡量)是饱和度的主要信号。例如,10个代理在8-vCPU系统上,与20个代理在16-vCPU系统上,若密度相同,则行为相似。这为架构师提供了一种跨实例大小和处理器代际比较容量的可移植方法。
合适的密度也取决于业务目标。交互式副驾驶和面向用户的助手应倾向于低密度,因为响应时间至关重要。而IT工作流等批处理工作负载通常可以在更高密度下运行。这为团队提供了一种围绕服务水平目标和总拥有成本来调整集群的实用方法。
代理型AI需要一种新的可观测性形式:平均计算(CPU)利用率对于代理型工作负载而言,是一个弱的主要性能监控信号。代理往往在等待模型响应和短时爆发式计算工作之间交替。由于这种“突发”模式,即使这些突发正在形成队列并拖慢用户体验,平均利用率看起来也可能尚可。任务延迟(P95)是更好的领先指标。它能在工作流开始等待时(甚至在平均任务持续时间显著恶化之前)就发出信号。一个实用的运营模式是:先根据P95延迟发出警报,然后通过查看持续的任务持续时间来确认问题。
**默认采用横向扩展**:横向扩展增加更多系统,从而提高总代理容量;而纵向扩展则向单个系统添加更多核心或内存,以承载计算爆发更重的代理。
我们的测试数据表明,横向扩展通常是更好的默认选择。这与代理通常半独立、每代理计算突发不大的特点相符。横向扩展能提升整体性能、支持高可用性、通常降低成本,并在平台扩展时更容易维持目标代理-每vCPU比例。
当代理需要更重的并行计算、共享状态限制了分区、内存局部性重要,或存在许可约束时,则应考虑纵向扩展。
**考虑业务影响**:代理型AI将首先在哪些领域创造业务价值?那些获得生产级成果的组织,正在将自动化层包裹在已有既定规则和可衡量服务级别的工作流周围:代码创建、回归测试农场、工单分类、市场分析和安全审查。
因此,代理型AI的理想企业用户画像并非追逐新奇体验的实验性用户,而是那些必须缩短周期时间、提高生产力、保障服务质量、执行策略,并在顾及成本的前提下推广采用的责任型领导者。
代理型AI的价值在于帮助企业跨团队、系统、数据和流程完成实际工作。对于企业而言,优先级不仅是获得更好的模型性能,更是创建一个可靠的环境,让AI代理能够支持业务工作流、提高生产力、在治理要求内运行,并随着采用增长而扩展。
在实践中,代理型AI的成功取决于正确的基础设施,以提供一致的结果、管理成本、保持控制,并自信地从试点走向生产。
*本文内容由Intel制作。并非由MIT Technology Review编辑部撰写。*
相似文章
大型科技与企业中的代理AI
一位企业研发经理对大型公司采用AI的现实情况的第一手视角,凸显了高管期望与实际生产力提升之间的差距,以及让团队有效使用AI工具所面临的挑战。
@Aurimas_Gr: 作为AI工程师,你必须了解这些𝗔𝗴𝗲𝗻𝘁𝗶𝗰 𝗦𝘆𝘀𝘁𝗲𝗺 𝗪𝗼𝗿𝗸𝗳𝗹𝗼𝘄 𝗣𝗮𝘁𝘁𝗲𝗿𝗻𝘀。如果你……
文章描述了在企业环境中构建代理式AI系统的五种关键工作流模式,由Anthropic总结:提示链、路由、并行化、编排器以及评估器-优化器,并建议在使用完整Agent之前优先采用更简单的工作流。
为公司构建 AI Agent
作者分享了在工作中构建代理系统的经验教训,描述了使用巨型提示、过多工具和动态子代理的失败,最终通过固定编排器和针对每个领域的专业子代理取得成功。
为何如此多的代理型AI项目失败?
探讨代理型AI项目在企业环境中失败的常见原因,重点分析基础设施、遗留系统、数据碎片化及治理挑战。
@levie: 刚刚结束与几十位企业IT领导者关于AI智能体的会议。以下是几个常见的…
与数十位企业IT领导者讨论AI智能体的会议中提炼出的共同主题总结,涵盖运营模式挑战、数据碎片化、定义数据护城河、AI采纳的衡量指标、多模型策略、人才短缺以及转型用例等。