变化下的程序性记忆:受控网络任务中的重用与干扰
摘要
本研究探讨了语言代理中程序性记忆不匹配如何影响网络任务,发现在受控条件下,不匹配不会导致行为中断或错误。
arXiv:2609.09774v1 公告类型:新
摘要:程序性记忆使语言代理能够重用成功的例程,但重用假设存储的例程仍然适用。我们研究当这种假设被故意违反时会发生什么。该研究结合了来自BrowserGym TimeWarp的追溯性、人类辅助的界面适应案例,以及针对合成购物决策的受控冻结记忆比较。在记录的WebShop V1-V6开发路径中,特定于界面的代码被调整,而单独存储的高层程序据报告未发生变化;此阶段不构成自主记忆代理评估。在受控阶段,一个早期试点产生了一个任务,其中两个记忆条件选择了更昂贵的物品,而无记忆条件选择了参考最小值。后续探测未建立重复的行序或身份绑定模式。然后,我们测试了四种形式的不匹配:改变的数量、不同的证据表示、局部和全局优化之间的冲突,以及分布式推广证据,在32个正式单元中。每个单元使用一次温度为0的生成,相同的本地qwen3:8b配置且无自适应重试。在这些配对中,当当前任务证据明确且充足时,未在为此定义的任务上出现任何预定义的诊断干扰签名。该结果识别了一个已测试的非干扰区域:程序性记忆可以不匹配而不会变得行为中断。它并未建立一般安全性或机制。剩余的问题是哪些额外条件将适用性不匹配转化为可观测的、由记忆导致的错误。
查看缓存全文
缓存时间: 2026/09/11 08:40
# 变化中的程序性记忆:受控网页任务中的复用与干扰
来源:https://arxiv.org/html/2609.09774
Yanze Cao
###### 摘要
程序性记忆使语言智能体能够复用成功的操作流程,但复用的前提是存储的流程依然适用。本研究探讨当这一前提被刻意违背时会发生什么。研究结合了来自BrowserGym TimeWarp的、人类辅助的界面适应性案例回顾分析,以及在合成购物决策任务上的受控冻结记忆对比实验。在文档记录的WebShop V1–V6开发路径中,针对特定界面的代码进行了适配,而单独存储的高层级流程未被报告发生改变;该阶段并非自主记忆智能体评估。在受控实验阶段,一个早期试点在某项任务上发现:两种记忆条件选择了更昂贵的物品,而无记忆条件选择了参考最低价。后续探测未能确立重复的行序或身份绑定模式。随后,我们在32个形式化测试单元中检验了四种失配形式——数量变化、不同的证据表示、局部与全局优化之间的冲突,以及分散的促销证据。每个单元使用相同的本地qwen3:8b配置进行一次温度为0的生成,且不进行自适应重试。在这些对比对中,当当前任务证据明确且充分时,为特定任务定义的预定诊断干扰特征均未出现。该结果划定了一个已测试的非干扰区域:程序性记忆可能与任务失配,却不会产生行为干扰。这并未确立普遍安全性或具体机制。遗留的问题是:哪些额外条件会将适用性失配转化为可观测的、由记忆引起的错误。
## 1引言
网页智能体学习到,可通过搜索每个请求的类别、拒绝语义误匹配项并汇总各类别最低价来找到可接受的最便宜商品。该流程在任务引入捆绑折扣前一直有效。此时,旧流程依然连贯、可执行且先前成功,但其局部优化规则已无法解决当前问题。这对智能体的长期记忆构成了难点:先前有用的记忆,其适用性已发生改变。
近期的语言智能体存储反思、经验、工作流或可执行技能,并在后续决策中检索利用[6、10、8、9、5]。专注于程序性记忆的研究使这些流程变得愈发明确和可复用[4、1、11]。正向迁移只是问题的一半。长期运行的智能体还需要在界面、数量、约束和优化目标发生变化后继续运作。检索的相关性不保证程序的适用性,而仅程序失配本身并不构成危害。
我们区分了三个常被混为一谈的观察:
**记忆–任务失配 ≠ 可观测错误 ≠ 记忆引起的错误。**\\text\{记忆–任务失配\}\\;\\neq\\;\\text\{可观测错误\}\\;\\neq\\;\\text\{记忆引起的错误\}\. (1)
存储的指令可能不完整或在局部不适用,而最终响应依然正确。反之,在记忆条件下出现的错误响应,其本身并非反对该记忆的因果证据。同一任务在没有记忆时可能同样困难,或者该错误可能反映身份绑定、解析、算术或其他过程的失败。图1展示了从失配到与干扰一致的行为的证据步骤。
[图1:从记忆–任务失配到行为干扰。] 失配关注流程是否适用;干扰关注观测到的行为。与过时流程匹配的错误是与干扰一致的证据,但其本身并非完整的因果判定。本文探讨的问题是:*失配的程序性记忆需要满足哪些额外条件才会产生可观测的干扰?*我们通过两个相关联的阶段来探究此问题。阶段一是基于TimeWarp任务57在WebShop V1–V6版本间的界面适应性案例回顾分析[2, 3]。保留的Python基线代码负责搜索杏仁和米饼,并在不同界面变体中提取商品标题和价格。它不加载存储的记忆、不自主执行最终的语义选择与汇总,也不提交答案。因此,阶段一提供了关于人类辅助开发路径的溯源信息,而非端到端记忆智能体的成功性声明。
阶段二使用冻结的提示词和保存的首次响应来对比程序性记忆条件。一个九单元试点暴露了一个具体异常:在某项任务上,原始记忆和表格适配记忆得到的结果是36.80美元,而无记忆条件得到的是20.00美元的参考最低价。随后的十八个单元测试了行序和身份绑定解释,但未确立重复模式。批次03(Batch 03)进一步细化了失配。四对任务设计检验了记忆是否遗漏了变化的数量、误用了不同的表示方式、在存在捆绑折扣时仍遵循独立的局部最小值,或在折扣证据需要跨字段组合时失败。四种记忆条件包括:原始记忆、无记忆、表格适配指令和原始记忆的语义改写。
主要实验结果是有意设计得非常狭窄。在所有四对批次03的测试中,在测试的短期条件下,且当前任务证据明确充分时,为特定诊断任务定义的预定干扰特征均未出现。配对01和配对02在各自的历史评估边界内,均在八个单元中产生了八个与参考结果兼容的选择和总计。配对03在八个单元中均实现了正确的全局优化;其六个严格正确性字段的空值结果未知,而非被推断。配对04在八个单元中均实现了全局优化和严格任务正确性,包括在全部四个分散证据单元中进行了明确的促销规则组合。
本研究区分了界面适应与高层级程序修订,以及记忆–任务失配与可观测干扰。实验序列从初始异常出发,逐步转向涉及数量、表示、局部与全局优化以及分散组合的针对性诊断冲突。在当前任务证据明确且充分的条件下,这些测试的失配未产生预定的干扰行为。本研究无法确定模型是忽略了记忆、对其进行了弱加权,还是纠正了中间偏差。一个直接的后续测试是降低当前证据的可获得性,同时保持任务客观可解。
[图2:实验进程。] 试点和批次02的计数为描述性兼容参考结果。配对01/02的计数并非回顾性严格正确性分数。箭头表示科学动机的顺序,而非独立重复实验。
## 2相关工作
### 2.1语言智能体中的经验复用
语言智能体的记忆常被介绍为从孤立试验通往累积改进的路径。Reflexion存储先前尝试的言语反馈并在后续试验中复用[6]。ExpeL提取自然语言洞见,并在推理时回忆洞见与经验[10]。ReasoningBank从成功和失败的经验中提炼策略,并将检索与测试时扩展相结合[5]。这些系统在记忆的产生和检索方式上各不相同,但都关注跨越情景的信息传递。
我们的关注点位于成功存储之后。一旦记忆被学习和检索,何时它仍然适用于当前任务?这个问题不同于记忆是否提高平均基准性能。记忆可能与任务族相关,但编码了一个不再有效的优化假设。
### 2.2程序性记忆与技能迁移
程序性表示将经验打包为可复用的动作结构。Voyager为开放式的具身探索积累可执行技能库[8]。Agent Workflow Memory从轨迹中归纳出重复性工作流,并为后续的网页导航决策提供所选工作流[9]。ProcMEM以激活、执行和终止结构形式化可复用技能[4];AFTER研究跨企业任务和模型骨干网的程序控制、适应和迁移[1]。Neural Procedural Memory则通过激活引导来表示程序,并研究其与显式工作流的互补性[11]。
这些方法都将适用性视为首要关注点,无论是通过检索、激活条件、验证还是迁移评估。本工作隔离出一个更简单的行为问题。我们保持提供的程序文本固定,改变任务需求,并预定义过时程序使用在响应层面的特征。实验不评估学习的检索策略或记忆更新算法。
### 2.3变化环境下的网页智能体
网页智能体面临布局、控件、观察和内容的差异。BrowserGym为网页智能体研究提供了通用环境和评估生态系统[3]。TimeWarp通过提供历史界面版本,将网页变化转化为一个显式的基准变量[2]。WebArXiv通过固定的网页快照追求时间不变性评估,并报告了一种涉及过度刚性复用交互历史的失败模式[7]。
我们的两个阶段位于该谱系的不同点上。回顾阶段关注在用户界面变化下,搜索、解析和动作代码的适应性。受控阶段移除了实时浏览,直接呈现紧凑的决策证据,从而能够精确地指定程序冲突和诊断错误。它未复现主动网页交互中的观察不确定性或长轨迹。
## 3问题设定
设\(M\)为检索到的程序性记忆,\(T\)为当前任务。一个流程包含一系列推荐,以及关于观察、约束或目标的假设。当至少一个推荐或假设对于\(T\)不充分或在局部不适用时,我们称\(M\)**失配**。这是文本与任务之间的适用性关系;它不依赖于智能体是否遵循该流程。
对于任务\(T\),设\(y^*\(T\)\)为冻结的参考结果,\(s(T)\)为预定的诊断特征。特征是一种响应模式,预期在某个特定的过时指令控制行为时出现。示例包括:添加单位最低价而遗漏请求的数量,或选择独立的类别最低价而忽略符合条件的捆绑折扣。当观测到的响应\(y\)在可用于该证据块的历史评估字段中,其报告的选择和总计与\(y^*\(T\)\)匹配时,称其为**参考兼容**。当\(s(T,y)=1\)时,它表现出诊断特征。
我们将**可观测干扰**保留给与失配程序一致的任务级错误。即使是这个标签也是行为性的:要确立记忆引起了该错误,需要对比(如无记忆条件)以及针对替代解释的充分控制。因此,我们的设计包含条件\(B\),即不提供程序性记忆。研究在记忆条件下发生错误而条件\(B\)下未发生时报告记忆相关的异常,同时避免仅从单一对比得出机制性结论。
这一区分很重要,因为评估字段在不同历史序列中并不统一。参考兼容性、全局优化正确性、严格任务正确性和诊断特征回答不同的问题。一个空的严格正确性值意味着保存的答案缺乏该评估器所需的证据;它不会被转换为成功或失败。同样,一个能够找到和解析产品的流程并非端到端任务求解器。
受控任务使用两种产品类别:杏仁和米饼。候选表指定了有效的类别、商品标识符、价格,以及相关的数量或促销。紧凑的设置使过时流程的特征变得透明。它也限定了主张的范围:这些是具有明确证据的短期合成决策,而非对网页任务群体的估计。
## 4方法
### 4.1研究设计
研究包含两个具有不同证据作用的阶段。阶段一是关于界面适应性的人类辅助回顾性案例研究。阶段二是一系列冻结提示词的对比。在阶段二内部,第一个试点和批次02先于批次03,并保留了各自的评分历史。我们不将各阶段或批次合并计算一个共同的成功率。
正式的阶段二结构为:
> 首个冻结批次:试点01(任务1-3);批次02,包含02A行序(任务4-5)、02B身份绑定(任务6-7)和02C重复式探测(任务8-9);以及批次03程序性记忆内容干扰,包含配对01(任务10-11)、配对02(任务12-13)、配对03(任务14-15)和配对04(任务16-17)。
“重复式”描述了任务8-9的相关设计。它不是随机重复、多种子实验或重复随机试验。
### 4.2阶段一基线
阶段一涉及BrowserGym TimeWarp任务57和WebShop版本V1–V6。保留的制品是`baseline_v05.py`。直接代码检查显示,它搜索杏仁和米饼,提取商品标题和价格,检查预期的商品数量,并处理多种用户界面、解析器和定位器变体。它不加载或执行单独存储的记忆M1。它也不自主执行最终的语义产品选择、最低成本汇总或答案提交。
历史工作流结合了用户运行的代码、终端或截图证据,以及用户-助手的共同解读。其记录报告了V3读取器补丁、V4定位器和结果边界补丁、V5动作适配器补丁,以及没有进一步的V6补丁。存储的高层级流程未被报告发生改变。相似文章
管理LLM智能体中的程序性记忆:控制、适应与评估
介绍了AFTER,一个包含382个企业任务的基准,用于评估LLM智能体中的程序性记忆,表明技能迁移能提升跨任务、角色和模型骨干的性能,部分技能广泛泛化,而另一些则专业化。
当成功记忆误导具身智能体:面向任务条件执行的记忆适配
该论文提出 MATE,一种确定性的检索后记忆适配方法,将检索到的轨迹转换为面向执行的记忆,供具身智能体使用。在 134 个 ALFWorld 任务上,使用 Qwen2.5-14B 和 72B 分别取得 81.3% 和 93.3% 的成功率,同时 token 消耗约为原始轨迹的十分之一。
你的智能体什么都记得,唯独忘了怎么干活
分析 LLM 智能体中情景记忆与程序性记忆之间的差距,引用浙江大学和阿里巴巴的一篇新论文 (Memp),该论文从智能体轨迹中构建程序性记忆,并利用失败信号修正存储的程序。
通过认知实验范式探究智能体记忆中的稳定性-可塑性权衡
本文介绍了MemProbe,一个认知科学启发的框架,通过实验范式评估智能体记忆系统中的稳定性-可塑性权衡,提供记忆维护随时间变化的可解释剖面。
持续LLM智能体中的受控记忆干扰
提出了受控记忆干扰(CMI),一个用于研究LLM智能体在不同记忆关系下记忆演化的诊断框架,揭示了特定关系的干扰会抑制更新可塑性,且干扰感知训练能够改进对有效更新的区分。