基于记忆的推测:LLM代理的无损加速

arXiv cs.LG 论文

摘要

本文介绍了面向LLM代理的记忆增强型推测执行技术,利用三种在线记忆系统在行动预测上提升19-39%的准确率,在观察预测上提升最高2.5倍,同时保持无损且零额外挂钟时间成本。

arXiv:2607.12236v1 公告类型:新 摘要:推测执行通过使用更小、更便宜的模型在环境空闲时预测并预启动下一步,从而加速LLM代理。然而,现有的推测器是无状态的,会丢弃任务之间的所有信息,从而阻止预测质量随经验提升。我们为推测器配备了三种在线记忆系统,这些系统从过去的代理轨迹中学习:对比转移表跟踪行动序列统计,情景记忆检索上下文相似的片段,以及混淆跟踪器抑制重复错误。我们在六个基准上评估了这种方法,涵盖三种推测类型:行动预测、观察预测和链式预测。记忆增强的推测在行动预测上实现了19--39\%的相对准确率提升,在具有重复行动空间的观察预测任务上提升高达$2.5\times$。这些收益随着记忆的积累而持续增长,并泛化到不同成本的推测器模型。所有推测都是无损的,因为它是在空闲时间运行,零额外挂钟时间成本,并且代理的轨迹与非推测执行相同。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:18

# 基于记忆的推测执行:LLM智能体的无损加速
来源:https://arxiv.org/abs/2607.12236
查看PDF (https://arxiv.org/pdf/2607.12236)

> 摘要:推测执行通过使用更小、更廉价的模型在环境空闲时预测并预启动下一步,从而加速LLM智能体。然而,现有的推测器是无状态的,会丢弃任务之间的所有信息,使得预测质量无法随经验提升。我们为推测器配备了三种在线记忆系统,使其能够从过去的智能体轨迹中学习:一个对比式状态转移表,用于追踪动作序列统计信息;一个情景记忆模块,用于检索上下文相似的片段;以及一个混淆追踪器,用于抑制反复出现的错误。我们在六个基准测试上评估了该方法,涵盖三种推测类型:动作预测、观察预测以及链式预测。记忆增强的推测在动作预测上带来了19%–39%的相对准确率提升,在具有重复动作空间的观察预测任务上取得了高达2.5倍的提升。随着记忆的累积,这些增益持续增长,并能在不同成本的推测器模型上泛化。所有推测均为无损,因为在空闲时间运行且不额外增加挂钟时间成本,并且智能体的执行轨迹与非推测执行完全一致。

## 提交历史

来自:于力 [查看邮箱](https://arxiv.org/show-email/b7ad814a/2607.12236) **\[v1\]** 2026年7月14日星期二 00:36:31 UTC (423 KB)

相似文章

面向长周期LLM智能体的选择性记忆保留

arXiv cs.AI

本文提出TraceRetain,这是一个用于冻结LLM智能体中绑定外部存储的轻量级框架,表明选择性记忆保留主要在记忆流包含噪声时与缓存启发式方法区分开,从而带来任务成功率和效率的提升。