AWM:用于长文档VQA代理的可回答工作记忆

arXiv cs.CL 论文

摘要

本文介绍了可回答工作记忆(AWM)和AWM-GRPO,以增强长文档VQA代理中终端工作记忆的质量,提高准确性并减少记忆问题。

arXiv:2608.25618v1 公告类型:新 摘要:长文档视觉问答日益依赖于VLM代理,这些代理检索候选页面、检查页面图像、将发现写入工作记忆并综合答案。工作记忆应在跨页面检查中携带支持回答的证据,以供后续基于上下文的作答,然而现有评估主要检查最终答案的正确性和证据页面的访问。这造成了记忆质量的盲点:代理可能找到正确页面并正确回答,但留下的记忆过于通用或不完整,一旦页面上下文被移除,就无法支持作答。我们引入\emph{仅记忆可回答性},这是一种诊断方法,询问读者是否仅凭问题和终端工作记忆就能回答。基于此诊断,\emph{可回答工作记忆}(AWM)将终端工作记忆视为可回答的证据工件,而AWM-GRPO将此信号融入GRPO奖励中,同时保留最终答案的优先级。在GRPO下,此奖励为终端工作记忆仍保持可回答的正确答案轨迹分配更高的优势值。在\textsc{MMLongBench-Doc}上,即使提供了黄金证据页面,仍有42.5%的正确答案无法仅从终端工作记忆中回答。AWM-GRPO在\textsc{MMLongBench-Doc}和\textsc{LongDocURL}上分别将最终答案准确性提高了8.1和11.9个百分点,并将记忆缺失正确率较仅答案GRPO降低了2.7个百分点。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:23

# AWM:面向长文档视觉问答代理的可回答工作记忆  
来源:https://arxiv.org/html/2608.25618  
余启程 斯图加特大学 博世人工智能中心 刘宇乐 香港科技大学(广州)杨振 清华大学 卢睿 清华大学董宇霄 清华大学 唐杰 清华大学 Evgeny Kharlamov 奥斯陆大学 博世人工智能中心  

###### 摘要  

长文档视觉问答(VQA)日益依赖视觉语言模型(VLM)代理,这些代理会检索候选页面、查看页面图像、将发现写入工作记忆并最终合成答案。工作记忆应跨页面检查携带答案支撑证据,以便后续基于上下文的回答。然而现有评估主要检查最终答案的正确性和证据页面访问情况,这导致了一个记忆质量盲区:代理可能找到正确页面并给出正确答案,但其留下的记忆过于笼统或不完整,一旦移除页面上下文就无法独立支撑回答。我们引入*仅记忆可回答性*这一诊断方法,检验读者能否仅凭问题和终止工作记忆进行回答。基于此诊断方法,*可回答工作记忆*(AWM)将终止工作记忆视为可回答的证据产物,而AWM-GRPO则将该信号纳入GRPO奖励机制,同时保持最终答案的优先性。在GRPO框架下,该奖励机制为答案正确且终止工作记忆保持可回答性的轨迹赋予更高优势。在MMLongBench-Doc测试中,即使提供了黄金证据页面,仍有42.5%的正确答案无法仅凭终止工作记忆独立回答。与RAG基线相比,AWM-GRPO在MMLongBench-Doc和LongDocURL上分别将最终答案准确率提高了8.1和11.9个百分点,并将记忆缺失正确率降低了2.7个百分点。  

脚注:通讯作者。代码已开源于 github.com/DongzhuoranZhou/AWM (https://github.com/DongzhuoranZhou/AWM)  

## 1 引言  

长文档问答类似于目标导向的信息检索:读者搜索相关证据、保存中间发现并将其整合为答案。近期长文档VQA系统通过VLM代理实现了类似的循环:检索候选页面、查看页面图像、用发现更新工作记忆并最终合成答案(Faysse等人,2025;Yu等人,2025;Cho等人,2024;Zheng等人,2026;Lin等人,2026;Lim等人,2026)。工作记忆应跨页面检查携带答案支撑证据,以便后续基于上下文的回答。然而当前评估仅检查最终答案正确性和证据页面访问情况,却不验证终止工作记忆是否保持答案支撑能力。因此代理可能在页面上下文下正确回答,但留下的记忆过于笼统,无法独立支撑答案。  

我们提出*仅记忆可回答性*概念:读者仅接收问题和代理撰写的终止工作记忆,无需页面图像或轨迹上下文,仅凭记忆进行回答。这揭示了记忆质量差距:即使提供黄金证据页面,MMLongBench-Doc中42.5%的正确回答实例也无法通过仅记忆可回答性测试。受控记忆对比进一步表明,提升终止工作记忆质量能改善回答效果,这激励了对记忆产物本身的优化。  

基于此观察,我们提出AWM-GRPO。对于每条轨迹,代理输出最终答案和终止工作记忆。冻结的阅读器仅凭问题和终止工作记忆进行回答,评判器则对最终答案和仅记忆答案进行评分。在GRPO框架下,该奖励机制根据最终答案正确性和记忆可回答性对轨迹进行排序,形成对“答案正确且终止工作记忆可回答”轨迹的偏好。  

我们评估了受控训练流程,其中三个AWM-代理变体共享相同的Qwen3-VL-4B策略、RAG Top-3检索框架、工具、记忆架构、提示词和优化器,仅训练后处理和奖励机制不同。我们对比了直接输入、RAG Top-3、SFT、纯答案GRPO和AWM-GRPO。在MMLongBench-Doc/LongDocURL上,AWM-GRPO分别超越RAG Top-3达8.1/11.9个百分点,超越SFT达4.7/4.4个百分点,超越纯答案GRPO达2.3/2.7个百分点。其在MMLongBench-Doc上还使记忆缺失正确率较纯答案GRPO降低了2.7个百分点(第4.3节)。  

本文贡献三点:(1)揭示长文档VQA代理中的记忆质量差距:最终答案正确性和证据页面访问情况并不能决定终止工作记忆是否保留答案支撑证据;(2)提出AWM-GRPO,将仅记忆可回答性作为GRPO奖励信号,根据最终答案正确性和记忆可回答性双重标准排序轨迹,形成对答案正确且终止工作记忆可回答轨迹的偏好;(3)通过与直接输入、RAG、SFT和纯答案GRPO基线的对比评估,证明AWM-GRPO在最终答案准确率和记忆质量诊断指标上均有提升。  

## 2 代理框架与记忆质量动机  

本节介绍代理-记忆框架及全文使用的仅记忆可回答性指标。通过两个诊断验证:当前代理撰写的记忆即使在页面访问受控时仍常不充分;提升终止工作记忆质量能改善回答效果。  

**图1说明**:代理-记忆框架与记忆质量诊断。(a)代理检索页面图像,将带来源链接的发现写入工作记忆,输出最终答案和终止工作记忆;(b)标准评估评分最终答案,仅记忆评估检验能否仅凭终止工作记忆回答问题,受控对比在固定证据页面访问下调整终止工作记忆。  

#### 代理-记忆框架  

长文档VQA实例为三元组(D,q,y),其中D={p1,...,pN}是多页文档,q是问题,y是真实答案;当可用时,E⊆D表示黄金证据页面。策略π使用证据页面检索和记忆更新。检索调用直接返回候选页面图像,查看图像后代理必须将带来源链接的发现追加到工作记忆Mt。交互持续直到代理输出最终答案ŷ和终止工作记忆Mterm,或达到步数限制(图1a)。  

如图1a所示,记忆条目是带来源链接的发现,其质量取决于是否保留问题相关证据。“图表显示趋势”这样的泛化描述,远不如“2020年自给率达4.7%”这样的问题具体发现实用。  

#### 仅记忆可回答性  

为评估终止工作记忆Mterm是否足以独立支撑回答,我们采用*仅记忆可回答性*测试:冻结的阅读器R仅接收问题q和Mterm,无需轨迹或页面图像,生成仅记忆答案R(q, Mterm)。官方评判器J同时评估代理最终答案和读者仅记忆答案相对于真实答案y的准确性。在四格分析中,我们将J的任何正分映射为1,零分映射为0。这为每个实例产生两个二元评分:最终答案正确性s_ans=1[J(ŷ,y)>0]和仅记忆可回答性s_mem=1[J(R(q,Mterm),y)>0]。R和J的实现细节见附录B。  

评分对(s_ans, s_mem)将实例分为四类(表1)。核心情况是*记忆缺失正确*(MMC):s_ans=1且s_mem=0,即代理回答正确但终止工作记忆独立支撑能力不足。  

**表1:最终答案正确性与仅记忆可回答性产生的结果分类**  
我们通过P_mmc=∑i1[s_ans(i)=1∧s_mem(i)=0] / ∑i1[s_ans(i)=1]总结每次运行,该值表示最终答案正确实例中终止工作记忆不可回答的比例。基于s_ans=1条件分析,可排除通用回答失败干扰,专注检验代理正确回答后记忆是否仍不充分。  

#### 当前记忆质量  

我们在MMLongBench-Doc的固定500例可回答子集(排除不可回答问题)上测量P_mmc。*完整多轮*设置运行完整代理流程(含自主检索和记忆更新)。*证据页面给定*(EP-given)设置用黄金证据页面替代检索,控制页面访问变量。表2报告结果。  

**表2:基础AWM-代理(Qwen3-VL-4B,无训练后处理)在固定500例MMLongBench-Doc可回答子集上的记忆质量诊断**  
排除不可回答问题。准确率采用官方平均问题评分;对MMC/正确率和P_mmc,将正分视为正确进行二值化。  

在完整多轮设置中,四分之一的正确轨迹(P_mmc=25.0%)留下的终止工作记忆无法独立支撑回答。EP-given设置通过替换为黄金证据页面控制页面访问,P_mmc升至42.5%,表明页面访问和最终答案正确性并不等同于终止工作记忆可回答性。  

#### 受控记忆对比  

我们进一步探究提升记忆质量是否改善回答。构建受控场景:检索返回黄金证据页面,对比三种终止记忆变体:(1)*空记忆*;(2)*原始代理记忆*;(3)*增强记忆*(由更强模型基于相同黄金页面生成)。为隔离记忆质量变量,该对比固定黄金页面访问和评估流程,仅替换不同终止工作记忆。答案生成器、仅记忆阅读器和评判器跨条件共享,仅终止记忆内容变化(图1b)。附录D提供完整设置、置信区间、结果细分和产物审计。  

**表3:固定500例MMLongBench-Doc EP-given可回答子集上的受控记忆对比**  
阅读器和评分器固定,仅改变终止记忆条件。增强记忆由GPT-4o生成。  

表3揭示了终止记忆的关键作用:空记忆下,最终答案和仅记忆二元正确率接近零;重用4B代理原始记忆使二者分别达到36.2和30.2;GPT-4o增强记忆则提升至44.4和44.8。在答案生成器、阅读器和评判器固定条件下,仅改善终止记忆即可提升双重指标。  

**关键结论**:页面访问和最终答案正确性不能保证终止工作记忆可回答性。仅记忆可回答性揭示了该差距,受控对比表明仅改善终止工作记忆即可提升回答效果。  

## 3 基于GRPO优化可回答工作记忆  

**图2说明**:AWM-GRPO概览。对于采样轨迹,代理同时输出最终答案和终止工作记忆。冻结的阅读器仅凭终止记忆回答,冻结的评分器评估最终答案和仅记忆答案。两个评分共同构成AWM奖励,经GRPO组内归一化后用于策略更新。  

第2节揭示了AWM-GRPO针对的失败模式:轨迹可能正确回答但终止工作记忆不可回答。由于GRPO通过组相对优势更新策略,奖励应使该记忆质量差异在优势排序中可见。我们先明确期望的优势行为,然后实例化实现该行为的四格奖励机制,最后通过合成结果分布展示群体组成如何改变诱导偏好。  

### 3.1 GRPO框架下的期望优势行为  

对于每个提示,GRPO采样G条轨迹并对每条轨迹的奖励进行组内归一化:  

A_i = (r(τ_i) - μ_g) / (σ_g + ε)  

其中μ_g和σ_g为组均值和标准差,ε=10⁻⁶用于稳定零方差组。由于GRPO通过归一化优势更新策略,关键不在原始奖励尺度而在其诱导的*排序*:对于任意两个结果单元z和z',  

A_z - A_{z'} = (r_z - r_{z'}) / (σ_g + ε)  

因此奖励排序决定优势排序。我们设计AWM奖励以实现三重成对偏好:  

#### 记忆优化偏好  

在答案正确轨迹中,终止工作记忆保持可回答的轨迹应获得比记忆不可回答轨迹更高的优势。  

#### 最终答案门槛  

最终答案正确性始终优先:答案正确但记忆有缺陷的轨迹,应仍优于答案错误的轨迹,即使后者记忆可回答。  

#### 有效记忆失败  

答案错误但记忆可回答的轨迹并非成功,但比完全失败更优,因为保留了有效证据。  

GRPO仅对奖励超过当前组均值的单元赋予正优势。因此同一单元可能随群体组成变化改变角色:当多数样本失败时,答案正确但记忆有缺陷的轨迹可能被容忍;但当记忆支撑正确的轨迹普遍时,这类轨迹会失宠。形式化表述:A_z > 0 当且仅当 r_z > μ_g。  

### 3.2 AWM奖励实例化  

为用最小标量奖励实现这些偏好,我们重用第2节的两个二元变量:最终答案正确性s_ans和仅记忆可回答性s_mem。在线训练时,冻结的本地Qwen3-14B

相似文章

SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准

Hugging Face Daily Papers

SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。

AdMem:面向任务求解智能体的高级记忆系统

arXiv cs.AI

本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。