编码智能体强化学习中的推演基础设施代价

arXiv cs.LG 论文

摘要

本文研究了编码智能体强化学习中的基础设施开销,测量了四种执行环境下的冷启动延迟差异高达110倍,并对训练吞吐量有显著影响。

arXiv:2607.01415v1 公告类型:新 摘要:编码智能体强化学习将执行基础设施视为背景实现细节,尽管它依赖于大量交互式软件推演。这是一个错失的机会:衡量基础设施开销可以揭示强化学习后训练中的实际效率提升,其中每次推演的微小节省在规模上会累积。我们针对四种执行环境进行了比较研究:单容器、托管沙箱、Kubernetes编排的容器和云端虚拟机。我们发现冷启动延迟差异高达 $110\times$,而一百万条150步轨迹的预计工人小时差异为 $1.8\times$。我们的结果表明,未来的编码智能体强化学习系统应将执行环境优化作为训练系统本身的一部分,而不仅仅是部署管道。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:40

# The Rollout Infrastructure Tax in Coding-Agent Reinforcement Learning
Source: https://arxiv.org/html/2607.01415
Lovre PešutDaytonaUnited States,Ivan DagelićDaytonaUnited States,Vedran JukicDaytonaUnited StatesandIvan BurazinDaytonaUnited States

###### 摘要.

编码智能体强化学习将执行基础设施视为背景实现细节,尽管它依赖于大量交互式软件推出。这是一个错失的机会:测量基础设施开销可以揭示后训练强化学习的实际效率提升,其中每个推出的微小节省会在大规模下累积。我们提出了一项关于四种执行基板的比较研究:单一容器、托管沙盒、Kubernetes编排容器和云虚拟机。我们发现冷启动延迟差异高达110倍,预计一百万次150步轨迹的工作小时数相差1.8倍。我们的结果表明,未来的编码智能体强化学习系统应优化执行基板,将其视为训练系统本身的一部分,而不仅仅是部署的管道。

预印本。提交至 ACM SoCC 2026。

††版权:无††会议:ACM云计算研讨会; 2026年11月18–20日; 新加坡††ccs:计算机系统组织 云计算††ccs:软件及其工程 软件性能††ccs:计算方法 机器学习

## 1. 引言

编码智能体强化学习将后训练转变为大规模系统工作负载。它不再产生单个静态答案,而是让智能体通过检查文件、编辑代码、运行命令和观察结果,在软件环境内反复行动。因此,每次推出不仅依赖于模型推理和奖励计算,还依赖于提供和管理环境的执行基板。

本文研究一个具体的系统问题:执行基板本身会使编码智能体强化学习变慢多少?这个问题范围狭窄,但影响重大:看似微小的每次推出和每次动作延迟会在训练规模下迅速累积。

表1. 微小的基板开销会变成巨大的训练成本。并行性不会消除这种成本,而是将其转化为对更多工作节点、更多调度能力以及更高训练开销的需求,以达到相同的墙钟吞吐量。

我们将这种开销称为“推出基础设施税”:由执行编码智能体强化学习轨迹的系统引入的延迟和成本。执行基板必须配置环境、执行智能体动作、管理状态,并在每次尝试后清理。它们还必须提供隔离性和可重现性,使一条轨迹不会污染另一条轨迹或扭曲奖励信号。这些要求带来了启动延迟、每次动作延迟、可扩展性和隔离性之间的权衡。

尽管其重要性,但这种税很少被直接测量。最近的智能体强化学习系统越来越认识到推出生成是一个主要的训练瓶颈,一些工作报告推出生成占运行时的90%以上(Zhou et al., 2025)。生产环境追踪进一步显示,软件环境会引入自身的故障和长尾:在故障期间,容器化环境重置可能主导推出时间,由Docker镜像拉取、网络争用和主机I/O争用引起的延迟(Gao et al., 2026)。这些观察表明,推出执行不仅仅是背景实现细节。然而,现有工作通常优化推出调度、GPU利用率或端到端训练吞吐量,留下一个更具体的系统问题:执行基板本身引入多少延迟?

我们通过一项对四种编码智能体执行基板的测量研究来研究这个问题:单一容器、托管沙盒、Kubernetes编排容器和云虚拟机。我们的研究做出了以下贡献:

- 我们定义了“推出基础设施税”,并识别出贡献于它的系统操作,包括环境创建、就绪、编排、命令执行、观察收集和清理 (§2)。
- 我们提出了一种受控评估方法,用于在相同编码智能体工作负载下比较执行基板 (§3)。
- 我们展示了基板选择直接影响推出性能:冷启动延迟变化高达110倍,但在较重工作负载下差距缩小 (§4)。
- 我们将这些测量结果投射到训练规模,并发现对于一百万次150步轨迹,基板选择导致推出工作小时数相差1.8倍,相当于额外5316个工作小时 (§4.4)。
- 我们将测量结果转化为三个具体的推出原生基板设计需求:位置感知热池、低延迟动作API,以及根据推出规模选择的隔离机制 (§5)。

我们不声称执行基板能解决强化学习后训练的低效率问题,但表明它们是训练系统中可测量和可优化的部分。随着编码智能体强化学习扩展到更大工作负载和更长轨迹,推出基础设施应被视为核心系统问题,而非实现细节。

## 2. 推出基础设施税

本文的关键思想很简单:编码智能体推出不仅是模型计算,也是与执行系统的重复交互。在智能体行动之前,系统必须创建环境并使其就绪。每次智能体行动时,系统必须执行命令、收集结果、更新状态并返回观察。轨迹结束后,系统必须保留、重置或丢弃环境,以便后续试验保持隔离和可重现。

我们将此执行系统引入的延迟称为“推出基础设施税”。此税不包括模型推理和奖励计算。它仅捕获运行智能体所在环境的系统成本。

在高层次上,推出具有以下结构:

\(T_{\text{create}}+T_{\text{ready}}\) (固定每条轨迹) + \(\sum_{i=1}^{S}T_{\text{action},i}\) (重复每个智能体步骤) + \(T_{\text{orchestration}}\) (控制平面开销)

其中 \(S\) 是轨迹中的智能体动作数量。这种分解很有用,因为税的不同部分在不同情况下影响不同。对于短轨迹,固定的启动和就绪成本可能主导总推出时间。对于较长轨迹,这些固定成本被摊销,重复的每次动作开销变得越来越重要。因此,一个基板对于长推出可能看起来很好,但对于短推出则很差,反之亦然。

推出基础设施税的组成部分包括:

- 环境创建时间:配置新执行环境所需的时间。
- 就绪时间:从环境创建到可以执行第一个智能体动作之间的时间。
- 摊销的每次动作成本:总推出延迟除以智能体动作数量。
- 编排开销:协调推出执行的控制平面引入的延迟。

这种分解为本文其余部分提供了一个测量框架。我们不仅问哪个基板最快,还问每个基板在哪里支付税:在第一个动作之前、在每个动作期间,还是在协调推出的控制平面中。答案决定了基板选择何时最重要,以及基础设施开销如何在训练规模下复利。

## 3. 评估概述

我们通过固定编码智能体工作负载而改变执行基板来评估推出基础设施税。我们的目标不是对每种可能的部署配置进行基准测试,而是在受控推出工作负载下比较常见的基板原型。

我们研究了推出基板设计空间中的四个常见点:轻量级单一容器、商用托管编码智能体沙盒、Kubernetes编排容器和强隔离的云虚拟机。

我们评估三个工作负载层级。T0 是最小命令工作负载,隔离了启动开销和启动命令的成本。T1 使用预加载的python/attrs仓库来衡量在已加载仓库中的简单代码检查,反映了近期软件智能体强化学习系统使用的代码导航操作,包括基于AST的搜索工具(Cao et al., 2025)。T2 使用固定有bug提交的python/attrs,并包括仓库克隆、源码检查、补丁应用和测试执行。这个层级反映了软件工程智能体任务中常见的较重设置和验证循环,其中环境创建和步骤执行可能成为显著延迟来源(Gao et al., 2026)。这些层级共同将最小基板开销与越来越现实的编码智能体设置、执行和验证成本分开。

在这些工作负载中,我们测量冷启动延迟、延迟分解、多步轨迹完成时间,以及训练规模下的预计推出工作小时数。每个基板和工作负载配置下,新回合和多步轨迹实验各重复100次。我们报告p50和p95延迟,以捕获典型和尾部行为。

所有基板在可用时使用可比的软件环境、资源限制和区域放置。我们避免特定于提供商的优化,例如专门的镜像预取、依赖缓存或调度器调优。由此产生的测量结果应被解释为执行基板的受控比较,而非底层技术的理论极限。

## 4. 结果

我们围绕四个研究问题组织评估,旨在表征推出基础设施税及其对大规模编码智能体强化学习的影响。

### 4.1. RQ1: 推出时间如何分解?

我们的第一个目标是了解推出延迟在执行生命周期中的分布情况。使用第2节中介绍的分解,我们测量所有评估执行基板的环境创建延迟、就绪延迟、每次动作执行延迟和编排开销。

该分析揭示了推出性能是否主要受启动成本、命令响应性、调度延迟或工作负载设置的限制。我们专注于T2网络仓库工作负载,它最接近真实的编码智能体轨迹:环境克隆仓库、执行源码检查、执行命令行操作,并在重复试验中重置状态。

参见图注 图1. 层级2工作负载下执行基板的延迟分解。如图1所示,各基板的主要延迟来源不同。轻量级基于容器的环境将大部分推出时间花在智能体动作和设置上,而具有更强隔离性或更重编排的基板则产生更大的启动和就绪成本。这个结果表明,推出延迟不是一个单一瓶颈:不同的基板在执行生命周期的不同点上支付基础设施税。

### 4.2. RQ2: 执行基板在冷启动下如何比较?

许多编码智能体强化学习系统为每次推出配置全新的执行环境,使冷启动延迟成为推出吞吐量的直接约束。这种效应在短视界任务中尤为明显,其中基础设施开销可能主导有用计算。

我们在相同工作负载和资源配置下测量所有基板的冷启动延迟。每个实验配置一个新的隔离环境,并记录到可以执行第一个命令的经过时间。结果报告了三个工作负载层级(T0-T2),每个配置100次试验。

参见图注 图2. 各基板和工作负载层级的P50(中位数)冷启动延迟。图2显示了各执行基板在冷启动性能上的显著差异。托管沙盒实现了最低的冷启动延迟,其次是单一容器配置。Kubernete编排容器增加了调度开销,而云VM在我们测量的配置中具有最高的配置成本。在工作负载层级中,最快和最慢基板之间的冷启动延迟跨度超过两个数量级。

冷启动开销还对轻量级工作负载产生不成比例的影响。对于T0任务,托管沙盒和云VM之间的差距超过两个数量级。然而,随着工作负载复杂性的增加,冷启动延迟被执行时间摊销:到T2时,云VM与托管沙盒的差距缩小到大约1.9倍。

参见图注 图3. 各基板的冷启动延迟分布。图3显示了冷启动的分布行为。编排容器表现稳定的启动性能,方差低,中位数和尾部延迟之间差距窄。托管沙盒实现了最快的中位数启动时间,但在轻量级工作负载上表现出更大的变异性。总体而言,这些结果表明,基板选择对于短轨迹最为明显,其中启动成本占主导,但对于较长的推出仍然重要,因为即使每个轨迹的差异很小,也会在训练规模下跨并行批次复利。

### 4.3. RQ3: 基础设施成本何时被摊销?

仅冷启动延迟不能决定推出效率。编码智能体强化学习轨迹通常包含数十或数百个智能体动作,因此随着轨迹增长,固定的启动成本被分摊到更多动作上。因此,我们测量推出延迟和延迟组成如何随轨迹长度变化。

我们执行包含10、50和150个动作的固定长度轨迹。每个轨迹包括代表性的编码智能体操作,包括文件系统检查、命令执行、源码修改和测试执行。我们报告总轨迹完成时间和摊销的每次动作延迟,定义为总轨迹时间除以动作数量。这个第二个指标应被解释为包括摊销启动和设置开销的每个动作平均成本,而不是孤立命令的延迟。

参见图注 图4. 轨迹从10步变为150步时归一化延迟组成。图4显示了推出延迟组成如何随轨迹长度变化。固定的基础设施成本在短轨迹中最明显,而随着轨迹增长,每次动作执行在总推出时间中占据更大份额。

参见图注 图5. 按动作数量划分的轨迹完成时间。图5显示,增加轨迹长度摊销了固定的启动成本,并缩小了基板之间的相对差距。这表明

相似文章

编程代理的胜负不在于提示词,而在于运行时基础设施

Reddit r/AI_Agents

随着编程代理能力增强,瓶颈从模型质量转向支持长时间运行的基础设施,包括持久状态、权限、检查点、可观测性和成本控制。作者认为,最好的代理产品更像是运行时和工作流系统,而非仅仅改进提示界面。

CacheRL:基于缓存回滚和混合奖励的多轮工具调用智能体

arXiv cs.CL

CacheRL训练用于多步工具调用任务的小型智能体基础模型,通过缓存回滚和混合奖励塑造,以100倍更少的计算量实现了92%的过程准确率(接近GPT-5的94%),并在知识迁移、缓存感知奖励以及迭代SFT/GRPO训练方面进行了创新。