AOSpec:面向低延迟智能体服务的动作与观察协同推测

arXiv cs.LG 论文

摘要

AOSpec 是一个无损框架,它在 LLM 智能体-环境循环中协同推测动作和观察,以降低延迟,在各种服务设置下实现了显著的端到端延迟降低。

arXiv:2608.00881v1 公告类型:新 摘要:大型语言模型智能体日益通过有状态工具行动,但模型生成与环境执行在每一步仍然是串行的。随着解码速度加快,工具执行成为日益严重的瓶颈。现有的仅动作推测或仅观察推测使大量此类延迟暴露在外:价值集中在少数慢速调用上,某些结果只能通过执行才能显现,而更长的前瞻通常需要一条越来越不可能的动作预测链。我们提出 AOSpec,这是一个无损框架,在整个智能体-环境循环中对动作和观察进行协同推测。期望值解码(EVD)将观察推测引导至具有最大预期延迟收益的结果,优化的是预期隐藏时间而非命中率。对于只有执行才能揭示的结果,AOSpec 在包含其效果的隔离分支中启动延迟关键的目标动作,同时联合动作-状态验证(JASV)在复用前根据已提交的执行验证动作及其来源状态。JASV 将长视野动作依赖从全链预测重塑为目标动作-状态验证,打破了前瞻-准确率权衡,并在不牺牲串行语义的前提下解锁长距离重叠。在涵盖四种 harness、五种 actor 模型和五种服务速度的 Terminal-Bench 服务设置中,AOSpec 优于所有实际基线,将平均端到端延迟降低 11.8%-32.5%,p99 延迟最高降低 42.8%。其收益随解码加速而增加,其观察模型无需重新训练即可从 Terminal-Bench 迁移至 SWE-bench Verified。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:44

# 动作与观测协同投机:面向低延迟 Agent 服务

来源:https://arxiv.org/html/2608.00881

###### 摘要

大语言模型智能体越来越多地通过有状态工具行动,但模型生成与环境执行在每个步骤中仍然保持串行化。随着解码速度的加快,工具执行日益成为瓶颈。现有的纯动作投机或纯观测投机会暴露大量此类延迟:价值集中在少数缓慢调用中,某些结果只能通过执行获得,而更长的前瞻通常要求一条越来越不可能成真的动作预测链。我们提出 AOSpec,一个无损失(lossless)框架,在完整的智能体–环境循环中联合投机动作与观测。期望值解码(Expected Value Decoding,EVD)将观测投机引导至具有最大期望延迟收益的结果,优化的是期望隐藏时间而非命中率。对于只能通过执行揭示的结果,AOSpec 在包含其效果的隔离分支(isolated fork)中启动延迟关键型目标动作;联合动作–状态验证(Joint Action–State Verification,JASV)则在复用之前,同时验证预测动作及其来源状态是否与已提交的执行状态一致。JASV 将长视界动作依赖从全链条预测重构为目标动作–状态验证,打破了前瞻–准确率权衡,在不牺牲串行语义的前提下解锁了长距离重叠。在跨越四个 harness、五个 actor 模型和五种服务速度的 Terminal-Bench 服务场景中,AOSpec 优于所有实用基线,平均端到端延迟降低 11.8–32.5%,p99 延迟最高降低 42.8%。其收益随解码加速而增大,且其观测模型无需重训练即可从 Terminal-Bench 迁移到 SWE-bench Verified。

## 1 引言

现代基于大语言模型(LLM)的智能体通过迭代的推理、动作和观测循环与外部环境交互(Yao et al. 2022 (https://arxiv.org/html/2608.00881#bib.bib27))。它们日益依赖检查或修改动态运行环境的有状态工具,而不再局限于简单的信息检索。Claude Code 和 OpenClaw 等框架将模型服务与工具执行环境解耦(Anthropic 2026 (https://arxiv.org/html/2608.00881#bib.bib1); OpenClaw Foundation 2026 (https://arxiv.org/html/2608.00881#bib.bib17)),构成了我们所说的“解耦智能体循环”(disaggregated agent loop)。由于标准循环将模型生成与工具执行串行化,随着解码加速,工具在端到端延迟中占有的份额越来越大(Tile-AI 2026 (https://arxiv.org/html/2608.00881#bib.bib23); Artificial Analysis 2026a (https://arxiv.org/html/2608.00881#bib.bib2), b (https://arxiv.org/html/2608.00881#bib.bib3); Groq 2024 (https://arxiv.org/html/2608.00881#bib.bib11); Cerebras Systems 2025 (https://arxiv.org/html/2608.00881#bib.bib7))。

投机(speculation)可以通过提前启动可能需要的未来工作来打破这种串行化。现有系统只针对循环的一侧:(i)动作投机预测并提前启动未来的工具调用(Ye et al. 2025 (https://arxiv.org/html/2608.00881#bib.bib28); Sui et al. 2026 (https://arxiv.org/html/2608.00881#bib.bib21); Nichols et al. 2025 (https://arxiv.org/html/2608.00881#bib.bib16); Song 2026 (https://arxiv.org/html/2608.00881#bib.bib20); Bai et al. 2026 (https://arxiv.org/html/2608.00881#bib.bib4)),而(ii)观测投机则从异步验证的临时观测继续生成(Saberi, Rezaei, and Feizi 2026 (https://arxiv.org/html/2608.00881#bib.bib19))。

然而,现有的投机方法在异构有状态工具负载上存在不足,暴露了有效投机的三个障碍。(1)延迟集中:少数慢调用主导工具时间,使命中率与延迟节省脱钩(第3.1节 (https://arxiv.org/html/2608.00881#S3.SS1))。(2)环境依赖性:一些依赖环境的观测只能通过执行获得,使得仅靠观测预测不够,还需要沙箱化的动作投机(第3.2节 (https://arxiv.org/html/2608.00881#S3.SS2))。(3)前瞻权衡:更早启动投机动作可以增加其与模型生成的重叠,但无损失生成要求中间动作链完全一致;复合误差会使准确率崩塌,抹掉潜在的加速(第3.3节 (https://arxiv.org/html/2608.00881#S3.SS3))。这些发现共同要求一种在完整智能体–环境循环上进行投机的新方法。

我们提出 AOSpec,一个在解耦智能体循环中联合投机动作与观测的无损失框架(第4节 (https://arxiv.org/html/2608.00881#S4))。为了解决延迟集中问题,*期望值解码*(EVD)通过结合候选观测的概率与估计工具时间来生成观测候选,直接优化期望隐藏时间而非命中率。对于只能通过执行揭示的观测,AOSpec 在包含其效果的隔离分支中启动延迟关键型目标动作(Tencent Cloud 2026 (https://arxiv.org/html/2608.00881#bib.bib22); Dong et al. 2026 (https://arxiv.org/html/2608.00881#bib.bib9))。为了打破前瞻–准确率权衡,*联合动作–状态验证*(JASV)将长视界动作依赖从全链条预测重构为目标动作–状态验证:只有当预测动作及其来源状态与已发射动作和已提交状态一致时,分支才会被验证并选中。这在不预测中间动作的情况下解锁了长距离重叠,同时精确验证保留了串行语义并保证无损失。这些机制共同带来了 11.8–32.5% 的端到端延迟节省,且收益随解码加速而增加,如图1 (https://arxiv.org/html/2608.00881#S3.F1) 所示。

我们有三项贡献:

- 我们刻画并量化了限制有状态工具投机效果的延迟集中、信息边界和前瞻张力。
- 我们提出 AOSpec,结合了用于延迟感知观测草拟的 EVD、用于环境依赖观测的隔离动作执行,以及用于无需全链条预测即可实现无损失长距离前瞻的 JASV。
- 在 Terminal-Bench 上的 4 种不同 harness 和 5 个模型上,AOSpec 实现了 11.8–32.5% 的端到端延迟节省,p99 延迟最高降低 42.8%,并优于实用基线。

## 2 相关工作

##### LLM 智能体的投机执行。

投机解码通过草拟–验证执行来加速生成(Cai et al. 2024 (https://arxiv.org/html/2608.00881#bib.bib5); Li et al. 2026 (https://arxiv.org/html/2608.00881#bib.bib14); Chen et al. 2024 (https://arxiv.org/html/2608.00881#bib.bib8))。智能体系统通过预执行预测的动作或工具调用来扩展这一原理(Ye et al. 2025 (https://arxiv.org/html/2608.00881#bib.bib28); Song 2026 (https://arxiv.org/html/2608.00881#bib.bib20); Nichols et al. 2025 (https://arxiv.org/html/2608.00881#bib.bib16); Bai et al. 2026 (https://arxiv.org/html/2608.00881#bib.bib4); Zhong et al. 2026 (https://arxiv.org/html/2608.00881#bib.bib29); Sui et al. 2026 (https://arxiv.org/html/2608.00881#bib.bib21)),或从临时观测继续生成(Saberi, Rezaei, and Feizi 2026 (https://arxiv.org/html/2608.00881#bib.bib19); Cao et al. 2026 (https://arxiv.org/html/2608.00881#bib.bib6))。与先前方法不同,AOSpec 在一个为具有高度偏斜延迟、环境依赖输出和副作用的“有状态运行时工具”设计的无损失框架中联合优化这两种形式。

##### 智能体沙箱。

诸如 CubeSandbox 和 DeltaBox 等智能体沙箱可以隔离并回滚文件和进程效果,从而支持对带副作用工具的投机(Tencent Cloud 2026 (https://arxiv.org/html/2608.00881#bib.bib22); Dong et al. 2026 (https://arxiv.org/html/2608.00881#bib.bib9))。AOSpec 使用这些原语来实现其隔离契约,而无法隔离的效果仍不符合投机条件。

## 3 动机

参见图注图1:在 Terminal Bench 上对九种 (harness, model) 配置进行轨迹回放的平均端到端延迟节省。左图:Spec. Act、带前瞻的 Spec. Act、Spec. Obs 与 AOSpec 之间的差距上限。右图:AOSpec 与 SpecHop 在 20/10/1 ms/token 下的对比。

我们将解耦智能体建模为一个 actor 和一个环境运行时。在第 i 步,actor 花费 D_i 时间生成动作 a_i,运行时花费 T_i 时间执行它并返回观测 o_i,由此产生的串行延迟为 ∑_i(D_i+T_i)。观测投机草拟观测 ô_i,使 actor 能在 a_i 执行期间继续推进。动作投机在 a_i 被发射之前就草拟并开始执行 â_i。通过对 Terminal Bench 九种 harness–模型配置的 1,921 条训练集轨迹进行剖析(Merrill et al. 2026 (https://arxiv.org/html/2608.00881#bib.bib15)),我们识别出三个基本挑战:延迟集中、环境依赖观测,以及更长重叠与复合链预测误差之间的张力。

参见图注

(a) 集中性

参见图注

(b) 延迟散点

参见图注

(c) 定性示例

参见图注

(d) 重叠上限

图2:来自 Terminal Bench 的动机性测量。(a) 一小部分长调用占用了几乎全部工具时间。(b) 每步延迟横跨模型主导与工具主导两种状态。(c) 高代价环境依赖观测的定性示例。(d) 更长前瞻提高 oracle 重叠上限,但经验上的精确链命中率急剧下降。

### 3.1 延迟集中使命中率与节省脱钩

如图2(a) 所示,使用计算机的智能体(computer-using agents)的工具时间高度集中:占比 17% 的耗时至少一秒的调用占据了总工具时间的 97%。图2(b) 在步骤层面显示了同样的不匹配:执行同时跨越模型主导与工具主导状态,因此相同的命中次数不一定隐藏相同的时间量。一个只在这些长调用上预测正确的预测器,可以通过仅 17% 的命中率隐藏 97% 的工具时间。相反,一个在其余所有调用上都正确的预测器可以达到 83% 的命中率,却只隐藏 3% 的时间。因此,仅靠命中率很难反映投机带来的延迟节省。

★ 洞察 1:投机价值是集中的:预测少数慢调用即可隐藏几乎所有工具时间。

### 3.2 环境依赖性限制观测预测

观测投机受限于 actor 上下文中可用的信息。图2(c) 对比了可预测的文件比较结果与只能通过执行揭示的训练指标。更广泛地看,许多延迟关键型观测依赖于隐藏的环境状态,例如文件、运行中的进程或可用资源,因此无法仅从 actor 的上下文可靠预测。

对于超出这一信息边界的观测,提前执行预测动作可以补充缺失的结果,但这只是条件性的。由于预测错误的动作可能污染环境,投机执行只有在支持快照和分支的沙箱中加以隔离时,才能安全地补足观测预测。

★ 洞察 2:依赖环境的结果需要执行而非预测:沙箱化的动作投机可以提前揭示这些结果,而不危及已提交状态。

### 3.3 更长前瞻提供跑道但压垮预测准确率

一个在其发起解码开始时启动的投机动作最多可以隐藏 min(D_i,T_i)。随着解码加速,这一跑道缩短:图2(d) 显示,当每 token 延迟从 20 ms 降至 1 ms 时,单步重叠上限从 43.3% 降至 25.7%。

看得更远可以恢复失去的跑道:在 1 ms 时,将视界从一步增加到五步,理想化上限从 25.7% 提高到 65.2%。然而,先前的多步方法要求整个预测动作链完全匹配(Sui et al. 2026 (https://arxiv.org/html/2608.00881#bib.bib21); Song 2026 (https://arxiv.org/html/2608.00881#bib.bib20); Ye et al. 2025 (https://arxiv.org/html/2608.00881#bib.bib28)),导致准确率从单步的 20.9% 乘法式坍缩为三步的 2.4% 和五步的 1.2%。因此,提供最多跑道的投机时机恰恰最不可能实现该跑道。

★ 洞察 3:更远的前瞻创造跑道,但乘法式链误差会抹掉它本应解锁的重叠。

这些发现共同指出了有效投机的三个障碍,并推动了 AOSpec 的设计。

参见图注图3:AOSpec 在一个代表性智能体轨迹上的总览。(a) 串行执行暴露工具延迟。(b) 纯观测投机可以推进可预测输出,但无法推断依赖环境的结果。(c) 纯动作投机提供很少的同步步重叠,且精确链前瞻脆弱。(d) AOSpec 使用 EVD 草拟观测,并将其与隔离的目标动作前瞻结合,通过 JASV 验证动作分支。

## 4 方法

### 4.1 算法总览

AOSpec 解决了第3节 (https://arxiv.org/html/2608.00881#S3) 中识别出的三个需求:优先考虑延迟而非命中率,结合预测观测与环境产生观测,以及在不预测整个未来轨迹的情况下扩展动作重叠。图3 (https://arxiv.org/html/2608.00881#S3.F3) 说明了 AOSpec 如何解决这些挑战。

在每个已验证的观测边界上,actor 开始生成下一个动作,同时投机动作在隔离的沙箱分支中启动。投机候选可以针对当前或更晚的窗口。当 actor 发射目标动作 a 时,*联合动作–状态验证*(JASV)只有在投机动作与目标动作匹配且原始环境与已提交环境匹配时才选择某个分支;否则,a 从已提交环境执行。

已完成的动作立即提供其实际观测。在执行仍挂起时,*期望值解码*(EVD)草拟候选观测,每个候选观测都可以启动一个临时的 actor 延续。当实际观测返回时,只有草拟与实际观测一致的延续会被保留。随后提交结果环境,并剪除无效分支。算法1 (https://arxiv.org/html/2608.00881#alg1) 总结了 AOSpec 的控制流。

算法 1 AOSpec:动作–观测联合投机
1: H, S ← 已验证历史与已提交环境
2: B ← StartActor(H)
3: F ← LaunchActions(H, S)
4: while true do
5:     x ← FinishActor(B)
6:     if x 是终止响应 then
7:         return x
8:     end if
9:     a ← x
10:    f ← F 中满足 VerifyAction(f, a, S) 的分支(若存在)
11:    if 不存在这样的 f then
12:        f ← Execute(S, a)
13:    end if
14:    P ← ∅
15:    if f 尚未完成 then
16:        启动 PredictObservations(H, a)
17:        for 每个在 f 完成前结束的候选观测 ô do
18:            P[ô] ← StartActor(H ∘ (a, ô))
19:        end for
20:    end if
21:    (o, S+) ← Wait(f)

相似文章

OoO-Spec:用于快速工具调用的无序语义推测

arXiv cs.CL

介绍了 OoO-Spec,一种通过小型辅助模型以无序方式计算语义槽位来加速 LLM 工具调用的方法,相比自回归解码实现了最高 5.34 倍的加速,并在多个目标和基准测试中超越了现有的草稿模型方法。

基于记忆的推测:LLM代理的无损加速

arXiv cs.LG

本文介绍了面向LLM代理的记忆增强型推测执行技术,利用三种在线记忆系统在行动预测上提升19-39%的准确率,在观察预测上提升最高2.5倍,同时保持无损且零额外挂钟时间成本。

AgentSPEX:一种智能体规范与执行语言

Hugging Face Daily Papers

AgentSPEX 提出了一种领域专用语言,用于构建模块化、可解释的大模型智能体工作流,具备显式控制流、状态管理与可视化编辑器,性能优于现有 Python 耦合框架。

Skim:用于快速高效网络代理的推测执行框架

arXiv cs.AI

Accio 是一种推测执行框架,通过利用离线站点结构分析和在线快速路径选择,降低网络代理的成本和延迟,实现每任务成本降低1.9倍,延迟降低33.4%,同时保持准确性。