基于记忆的推测:LLM代理的无损加速
摘要
本文介绍了面向LLM代理的记忆增强型推测执行技术,利用三种在线记忆系统在行动预测上提升19-39%的准确率,在观察预测上提升最高2.5倍,同时保持无损且零额外挂钟时间成本。
arXiv:2607.12236v1 公告类型:新
摘要:推测执行通过使用更小、更便宜的模型在环境空闲时预测并预启动下一步,从而加速LLM代理。然而,现有的推测器是无状态的,会丢弃任务之间的所有信息,从而阻止预测质量随经验提升。我们为推测器配备了三种在线记忆系统,这些系统从过去的代理轨迹中学习:对比转移表跟踪行动序列统计,情景记忆检索上下文相似的片段,以及混淆跟踪器抑制重复错误。我们在六个基准上评估了这种方法,涵盖三种推测类型:行动预测、观察预测和链式预测。记忆增强的推测在行动预测上实现了19--39\%的相对准确率提升,在具有重复行动空间的观察预测任务上提升高达$2.5\times$。这些收益随着记忆的积累而持续增长,并泛化到不同成本的推测器模型。所有推测都是无损的,因为它是在空闲时间运行,零额外挂钟时间成本,并且代理的轨迹与非推测执行相同。
查看缓存全文
缓存时间: 2026/07/15 04:18
# 基于记忆的推测执行:LLM智能体的无损加速 来源:https://arxiv.org/abs/2607.12236 查看PDF (https://arxiv.org/pdf/2607.12236) > 摘要:推测执行通过使用更小、更廉价的模型在环境空闲时预测并预启动下一步,从而加速LLM智能体。然而,现有的推测器是无状态的,会丢弃任务之间的所有信息,使得预测质量无法随经验提升。我们为推测器配备了三种在线记忆系统,使其能够从过去的智能体轨迹中学习:一个对比式状态转移表,用于追踪动作序列统计信息;一个情景记忆模块,用于检索上下文相似的片段;以及一个混淆追踪器,用于抑制反复出现的错误。我们在六个基准测试上评估了该方法,涵盖三种推测类型:动作预测、观察预测以及链式预测。记忆增强的推测在动作预测上带来了19%–39%的相对准确率提升,在具有重复动作空间的观察预测任务上取得了高达2.5倍的提升。随着记忆的累积,这些增益持续增长,并能在不同成本的推测器模型上泛化。所有推测均为无损,因为在空闲时间运行且不额外增加挂钟时间成本,并且智能体的执行轨迹与非推测执行完全一致。 ## 提交历史 来自:于力 [查看邮箱](https://arxiv.org/show-email/b7ad814a/2607.12236) **\[v1\]** 2026年7月14日星期二 00:36:31 UTC (423 KB)
相似文章
SimpleMem: 面向大语言模型智能体的高效终身记忆
介绍SimpleMem,一种面向LLM智能体的高效记忆框架,利用语义无损压缩提升准确率并降低token消耗,F1分数提升26.4%,推理时token使用量减少高达30倍。
更少的上下文,更高的准确性:一种用于LLM代理的双时态记忆引擎,其中精简检索的上下文胜过了完整历史
本文介绍了Engram,一个开源的用于LLM代理的双时态记忆引擎,它通过检索一个紧凑的上下文片段(约9.6k token),在LongMemEval上以混合读取路径融合稠密、词汇、图和时间信号,比完整历史基线(79k token)高出10.4个准确率点。
ActiveMem:面向长程LLM推理的分布式主动记忆
ActiveMem提出了一种分布式主动记忆系统,将智能体记忆与大模型核心推理过程解耦,在长程任务上实现了最先进的准确率,同时显著降低了开销。
面向长周期LLM智能体的选择性记忆保留
本文提出TraceRetain,这是一个用于冻结LLM智能体中绑定外部存储的轻量级框架,表明选择性记忆保留主要在记忆流包含噪声时与缓存启发式方法区分开,从而带来任务成功率和效率的提升。
RecMem:基于重复的记忆整合方法,用于高效且有效的长期运行LLM智能体
RecMem是一种基于重复的记忆整合方法,适用于长期运行的LLM智能体,通过仅在语义相似的交互重复出现时调用LLM,可减少高达87%的令牌消耗,同时提高准确性。