Agent Substrate 为 GKE 带来高密度、可扩展、可信赖的基础设施(9分钟阅读)
摘要
Agent Substrate 是一款开源的代理执行运行时,现已在 Google Kubernetes Engine 上可用,提供高密度沙箱,具有亚秒级激活和安全功能,用于扩展 AI 代理。
Agent Substrate 现已在 Google Kubernetes Engine (GKE) 上可用。Agent Substrate 是一款开源、默认安全的代理执行运行时,专为运行数百万个沙箱而设计,密度是标准容器运行时的 10 倍。它提供亚 500 毫秒的恢复操作,每秒超过 500 次挂起/恢复激活,具有原生零信任内核和网络隔离功能。Agent Substrate 可在任何 Kubernetes 基础设施上运行,并针对 GKE 进行了优化。
查看缓存全文
缓存时间: 2026/09/17 14:32
# Agent Substrate 已在 GKE 上线
来源:https://cloud.google.com/blog/products/containers-kubernetes/agent-substrate-available-on-gke
**今天我们宣布 Agent Substrate 已在 Google Kubernetes Engine (GKE) 上可用。** Agent Substrate (http://ate.dev/) 是一个开源、默认安全的智能体执行运行时,旨在以**比标准容器运行时高10倍的密度**运行数百万个沙箱。它专为自主智能体时代设计,能够在**每秒超过500次暂停/恢复激活**的情况下提供**低于500毫秒的恢复操作**,同时具备原生零信任内核和网络隔离。
Agent Substrate 作为开源解决方案,可在任何 Kubernetes 基础设施上运行,并针对 GKE 进行了优化。领先的 AI 团队已在构建基于它的应用:**Nous Research**(**Hermes Agent** 背后的团队)正在积极基于 Agent Substrate 进行开发。**Hermes** 目前在 OpenRouter 的生产力、编码、CLI 和个人智能体使用量上排名第一。
### 从本地到百万智能体规模
开发者已在本地运行 Antigravity、Claude Code、Codex、OpenClaw、Hermes 等工具,但这与运行数十万个并发的长驻智能体有本质区别——后者需要生成代码、交互工具并驱动自动化执行,这是现有架构常常难以应对的挑战。
将智能体平台从本地原型扩展到大规模运行智能体,会从根本上改变基础设施的限制条件,可能包括:
- **不透明的信任边界**:模型可以动态生成并运行任意代码。如果没有内核级隔离和动态网络控制,运行无人审查的不可信代码将导致主机逃逸、凭证窃取和数据泄露风险。
- **工具访问摩擦**:智能体需要完整的计算机环境来调用命令行工具、无头浏览器和文件系统工作区。安全高效地运行这些工具至关重要。
- **海量突发流量**:智能体框架、基准测试和强化学习展开可能每分钟生成数千个沙箱。通用调度器难以应对这种频繁变更,反复解压容器镜像可能导致严重的磁盘争用。
- **空闲计算资源**:自主智能体绝大部分时间都处于休眠状态,等待模型推理、工具响应或人类反馈。为闲置容器预留专用 CPU 和内存会浪费宝贵资源。
### 专为智能体构建的基底
当平台团队遇到这些挑战时,他们将面临一个不可接受的取舍:牺牲控制与隔离性,或忍受虚拟机带来的高延迟与低效率。我们认为团队不应该被迫做出选择。
Agent Substrate 通过将智能体执行与机器管理解耦来避免这一问题。基于云原生 Kubernetes 基础设施构建,Agent Substrate 提供了一个专为智能体工作负载设计的新执行层。
https://storage.googleapis.com/gweb-cloudblog-publish/images/1_2dtrRM6.max-1900x1900.jpg
该执行层直接管理沙箱化智能体环境的生命周期,具备以下特点:
- **默认安全**:硬件隔离的 Cloud Hypervisor microVM 或 gVisor 沙箱,配合出口代理实施细粒度网络策略,并在智能体本身无法触及的位置注入凭证,防止凭证窃取。
- **亚秒级激活**:按需将激活的智能体毫秒级调度到预热工作节点,无容器启动延迟。
- **高效率**:闲置组件在数百毫秒内被暂停并取消调度,释放计算资源。
- **开源且可移植**:可在任何计算环境中的任何 Kubernetes 集群上运行,兼容任何智能体框架或工具,包括 Claude Code、OpenClaw 和 Hermes。
### 核心架构原则
我们遵循四个核心架构原则,指导 Agent Substrate 解决这些挑战:
#### 1. 默认安全:内核与网络层
AI 智能体的核心功能是生成并运行不可信代码和终端命令。在共享服务器上运行这些代码,会在共享内核或网络层面造成严重的逃逸和意外数据泄露风险。
https://storage.googleapis.com/gweb-cloudblog-publish/images/2_zC5wfpY.max-1900x1900.jpg
Agent Substrate 在主机内核和网络层均采用默认安全立场。团队可以选择硬件隔离的 Cloud Hypervisor microVM(提供完整 Linux 内核兼容性)或开销更低的 gVisor 沙箱内核隔离。Agent Substrate 的集成网关管理所有出入口请求,实现对网络访问的细粒度、可扩展控制。
#### 2. 专为低延迟激活构建的控制平面与数据平面
为了优化隔离、长驻智能体工作负载的密度,需要专用的控制平面和数据平面,以实现尽可能低的延迟和尽可能高的暂停/恢复操作频率。Agent Substrate 引入专用控制平面处理数据感知调度,将延迟降至最低。同时,数据平面在预热工作节点上直接处理每秒数百次暂停/恢复操作,减少环境准备开销。快照被写入本地磁盘和 Google Cloud Storage 以实现持久化状态保存。在不到 500 毫秒内,沙箱环境可恢复到先前状态,并在空闲时立即重新暂停。
https://storage.googleapis.com/gweb-cloudblog-publish/images/3_AQ7nEJ0.max-1900x1900.jpg
#### 3. 高密度与仅活跃计算经济学
智能体大部分时间都在等待模型推理、工具响应或用户输入。为闲置容器保留物理 CPU 和内存会锁定昂贵且稀缺的容量,使大规模运行智能体集群不可持续。
Agent Substrate 可在智能体暂停时立即释放资源。它将客户机管理程序的状态快照写入本地磁盘和 Cloud Storage,释放 RAM 和 CPU 以运行其他智能体,同时保持状态完整。当下一轮交互或工具调用到达时,Agent Substrate 可在毫秒内恢复快照会话。这种零空闲模型每台主机可容纳超过 1,000 个休眠智能体,计算密度是传统计算方式的 10 倍。对于需要跨轮次共享文件系统的工作负载,可选的 Filestore (https://cloud.google.com/filestore) 智能体卷控制器提供持久化 NFS 存储——更多详情见下文。
#### 4. 以 Kubernetes 为基础:可扩展性与可靠性
在标准虚拟机上构建自定义沙箱编排器迫使团队维护繁琐的运维工具:节点恢复、自动伸缩、多区域调度和网络策略。但通过标准 Kubernetes Pod 生命周期路由每次亚秒级工具调用,会给每个请求增加数秒延迟。
Agent Substrate 结合了两种方法。高频暂停/恢复通过专用数据平面直接在本地工作节点上运行。同时,Kubernetes 管理机器,处理自愈节点、集群自动伸缩和集群可靠性,并驱动工作节点 Pod 自身的生命周期。对于需要标准 Pod 语义的工作负载,现有的原语(如 Agent Sandbox 和内核隔离 Pod)仍可并行工作。
### **针对 Google Cloud 基础设施优化**
构建可实现百万智能体规模的智能体平台,依赖于正确的底层计算和存储基础设施。GKE 上的 Agent Substrate 通过自定义 ComputeClasses (https://docs.cloud.google.com/kubernetes-engine/docs/concepts/about-custom-compute-classes) 动态管理不同规格和系列的机器池(包括 Spot 和按需池),最大化机器可获取性和灵活性。这包括对 Google Axion(我们基于 Arm 的定制处理器)的原生支持,与竞争性云产品相比,为沙箱工作负载提供高达 30% 的性价比提升。对于有状态工作空间,GKE 上的 Agent Substrate 可选择与 Filestore 智能体卷 (https://cloud.google.com/blog/products/storage-data-transfer/filestore-agent-volumes) 集成——这是一项新服务,可在毫秒内挂载和卸载 NFS,允许智能体近乎即时地启动/恢复,并提供原生的读写多(RWX)访问和 POSIX 兼容的文件锁定,以实现安全的多智能体协作,避免写入冲突。
### 在可扩展基础上构建智能体平台
构建生产级智能体应用时,不应在强安全性、低延迟和运维规模之间妥协。
Nous Research 开发的 Hermes 是根据 OpenRouter 使用量排名世界第一的 AI 智能体,同时在生产力、编码、个人和 CLI 智能体类别中也排名第一。Nous Research 是 Agent Substrate 的早期设计合作伙伴,评估该运行时如何处理智能体工作负载引入的隔离和身份需求。
“我们构建 Hermes Enterprise 是为了让客户能够部署到现有基础设施,同时处理每个智能体的隔离和可扩展访问控制。Agent Substrate 在平台层解决了这两者,同时保留了宝贵的计算资源。我们与 Agent Substrate 的合作经验让我们相信,该架构能够随着智能体工作负载的增长而高效扩展。” —— Hervé Bizira,Nous Research 首席商务官
通过将 Kubernetes 的机器弹性、自愈节点和声明式管理与专为内核隔离、仅活跃计算和亚秒级执行构建的智能体原生数据平面相结合,Agent Substrate 为工程团队提供了清晰的扩展路径。
Agent Substrate 是开源的,所有 GKE 客户均可用于非生产工作负载。生产环境的正式支持(GA)可通过允许列表获取。要在您的 GKE 集群上部署,请参阅 Agent Substrate on GKE 文档 (https://docs.cloud.google.com/kubernetes-engine/ai-ml/install-overview-substrate)。欲了解更多信息,请参阅 About Agent Substrate 或访问开源仓库 (http://ate.dev/)。
发布于 - Containers & Kubernetes (https://cloud.google.com/blog/products/containers-kubernetes)
相似文章
Agent Substrate/基底
Agent Substrate 是一个开源运行时环境,专为AI代理的高密度部署而设计,利用 Kubernetes 和沙箱技术实现高效的多路复用和生命周期管理。
@Saboo_Shubham_: GitHub 仓库:
Agent Substrate 是 Google 开源的运行时,支持大规模 AI 代理部署的高密度生命周期管理,通过 Kubernetes 和 microVM/gVisor 沙箱将多个有状态代理多路复用至更少的物理工作节点,并具备亚秒级挂起/恢复能力。
介绍 Agent Executor,谷歌的分布式 Agent 运行时(6分钟阅读)
谷歌推出 Agent Executor,这是一个开源分布式运行时,用于可靠的长时运行代理工作流,具有持久执行、安全隔离和会话一致性等特点。
AI 代理可能需要迎来自己的 Kubernetes 时刻!
讨论了大规模部署 AI 代理的运营挑战,并将其与 Kubernetes 解决容器编排问题的方式相类比。认为代理生态系统需要类似的基础设施突破。
@AniHermit: 我正在思考如何将编码代理部署到云端,用于大规模自动化审查+质量保证,从接口测试…
文章讨论了将编码代理部署用于大规模自动化审查和质量保证,并介绍了'agent-sandbox'作为一个基于Kubernetes的工具,用于管理隔离的AI代理工作负载。