诊断资源受限视觉智能体中共享状态协作的失效模式

arXiv cs.AI 论文

摘要

本文研究了资源受限视觉智能体中共享状态协作推理的失效模式,引入了CoSee审计框架,该框架形式化了读写验证循环。研究发现,简单的共享工作区可能会放大幻觉,并识别出噪声增强和策略崩溃是主要的失效模式。

arXiv:2605.31354v1 公告类型:新 摘要:模块化视觉推理系统日益依赖共享工作记忆进行多步协作,然而低容量场景下中间状态演变的失效动力学仍未得到充分探索。我们通过噪声累积的视角,研究了弱学习器(4B-8B模型)协作推理的失效模式。我们引入了CoSee审计框架,该框架形式化了读写验证循环,以追踪文档视觉问答中的信息流。在多页、图表和基于网络的基准测试中,我们发现了一个反直觉的退化现象:简单的共享工作区往往放大幻觉而非消除它们。我们识别出两种主要的失效模式:噪声增强(将未基于事实的笔记重复用作证据)和策略崩溃(增加的上下文使模型转向未充分指定的简短答案)。通过成本-准确率帕累托前沿,我们表明在没有明确验证的情况下,增加计算量可能与性能负相关。我们的发现表明,对于资源受限的智能体,瓶颈不在于推理深度,而在于通信保真度,这为可靠的模块化设计提供了追踪级诊断和机制基准。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:27

# 资源共享协作在资源受限视觉智能体中的故障模式诊断  
来源:https://arxiv.org/html/2605.31354  

###### 摘要  

模块化视觉推理系统日益依赖共享工作记忆进行多步协作,然而在低容量场景下中间状态演化的故障动态仍鲜有探索。我们通过噪声累积的视角,研究了弱模型(4B–8B模型)协作推理的故障模式。我们提出CoSee审计框架,将读写验证循环形式化,用于追踪文档视觉问答中的信息流。在多页面、图表和网页基准测试中,我们发现一种反直觉的退化现象:朴素的共享工作空间往往放大而非消除幻觉。我们识别出两种主要故障模式:噪声强化(无依据笔记被重用为证据)和政策崩溃(增加上下文导致模型倾向于生成未充分指定的简短答案)。通过成本-准确率帕累托前沿,我们表明在缺乏显式验证的情况下,增加计算量可能与性能负相关。我们的发现表明,对于资源受限智能体,瓶颈不在于推理深度,而在于通信保真度,这为可靠的模块化设计提供了轨迹级诊断和机制基线。  

机器学习,ICML  

## 1 引言  

视觉语言模型(VLM)的最新进展使其能够对高信息密度内容(如多页幻灯片、量化图表和网页文档)进行推理。为处理这些复杂输入,该领域正日益转向利用共享工作空间(例如白板)来外部化中间状态的模块化设计。原则上,这种形式的外部工作记忆允许有限容量的模型“在纸上思考”:将难以处理的查询分解为可验证的读写交叉检查步骤。普遍直觉认为,这种显式状态跟踪通过降低单次推理的认知负担,本质上能提升可靠性。然而,该范式的有效性在其动机所在的边界条件(即资源受限场景,特征为弱模型和小计算预算)下尚未得到验证。在此设定下,我们假设协作循环扮演的是一个噪声通信信道,而非可靠记忆存储。每增加一轮交互不仅带来线性计算成本,还引入噪声累积风险:协作会改变每一步的条件分布,可能导致策略漂移(如简洁性或覆盖范围的变化)或幻觉强化——无依据的中间笔记被“固化”为错误证据。这些故障模式通常难以察觉,若无严格的完整性审计则诊断困难。  

为探究这些限制,我们提出CoSee,一个旨在在弱模型约束下严格度量共享上下文效用的审计框架和协作协议。CoSee将智能体循环形式化为最小动作接口(读取、写入白板、验证),记录中间状态的结构化轨迹,并强制执行严格的输出完整性检查,以区分推理失败与格式错误。与临时评估不同,我们使用严格匹配的提示和解码上限对所有配置进行基准测试,确保观察到的差异源于交互动态而非隐藏的计算优势。我们利用此管道研究三种配置:直接单轮回答、单智能体白板变体、以及双智能体扫描-检查架构。  

![图1](https://arxiv.org/html/2605.31354#fig1)  
图1:CoSee概述。共享白板协作配合轨迹日志和完整性审计,可在严格预算下进行受控、成本归一化的评估。本研究发现,在弱模型约束下朴素的白板使用并非可靠优势,而轻量级验证白板门控可缓解图表为中心的失败。  

我们在三个代表性分布——SlideVQA、ChartQAPro和VQAonline上开展实证研究,以Qwen3-VL-4B-Instruct为主骨干,并在Qwen3-VL-8B、Phi-4和Gemma-3-4B上进行规模和鲁棒性检查。结果揭示了明显的效率悖论:朴素使用共享内存在检索任务上仅带来边际收益,在推理密集型任务上往往导致性能下降。具体而言,我们发现多智能体设定由于协调开销和覆盖失败,常常表现不如单轮基线。为量化这些权衡,我们分析成本-准确率帕累托前沿,表明在缺乏质量控制的情况下,增加 token 使用量与性能往往负相关。基于轨迹的诊断进一步隔离了性能下降背后的机制——主要是图表上的噪声强化和开放式问答上的政策崩溃(简短答案漂移)——表明轻量级验证是阻止错误传播的最小必要条件。  

#### 贡献。我们提出CoSee,一个用于审计模块化VQA系统中信息流和完整性的形式化框架,能够对弱模型协作的局限性进行系统性实证探究。通过整合计算感知指标——特别是成本-准确率帕累托前沿和格式鲁棒评分——我们量化了外部记忆因噪声累积而由资产变为负债的操作边界。此外,我们建立了主导故障机制的分类,包括噪声强化和政策崩溃,并通过实验验证,在资源受限的文档VQA中,实现基于轻量级验证的接地信息瓶颈是可靠扩展的最小必要条件。  

## 2 相关工作  

#### 文档和图表VQA作为推理测试床。近期数据集转向高信息密度内容,将文档和图表问答确立为复杂视觉背景下接地推理的严格测试床(Mathew等,2021(https://arxiv.org/html/2605.31354#bib.bib14);Masry等,2022(https://arxiv.org/html/2605.31354#bib.bib15);Nguyen等,2025(https://arxiv.org/html/2605.31354#bib.bib16))。具体而言,ChartQAPro引入了对抗性扰动和无法回答的查询,暴露了当前LVLM在处理分布外图表类型时的脆弱性(Masry等,2025(https://arxiv.org/html/2605.31354#bib.bib1))。互补地,VQAonline挑战模型从真实网络数据中进行开放式生成,其中评估指标必须从语义正确性中区分出覆盖范围和简洁性的策略漂移(Chen等,2024(https://arxiv.org/html/2605.31354#bib.bib2))。这些分布偏移要求评估协议明确考虑格式敏感性以及生成充分支持答案的计算成本,超越原始准确率指标(Rajpurkar等,2016(https://arxiv.org/html/2605.31354#bib.bib17))。  

#### 以架构为中心的文档理解。先前工作主要集中于编码文档结构的归纳偏置,通过利用布局信号和多页上下文改善理解(Xu等,2021a(https://arxiv.org/html/2605.31354#bib.bib18),b(https://arxiv.org/html/2605.31354#bib.bib19))。诸如DocLLM和LayoutLLM的方法优化了面向结构理解的指令微调(Wang等,2024(https://arxiv.org/html/2605.31354#bib.bib3);Luo等,2024(https://arxiv.org/html/2605.31354#bib.bib4)),而DocOwl2等架构通过高分辨率压缩机制应对效率-准确率权衡(Hu等,2025(https://arxiv.org/html/2605.31354#bib.bib5))。与此同时,开源LVLM持续扩展视觉编码器以处理多图像分辨率动态(例如LLaVA-UHD、LLaVA-OneVision)(Guo等,2024(https://arxiv.org/html/2605.31354#bib.bib6);Li等,2024(https://arxiv.org/html/2605.31354#bib.bib7)),近期技术报告(如Qwen3-VL)展示了文档解析方面增强的基础能力(Bai等,2025(https://arxiv.org/html/2605.31354#bib.bib8))。我们的工作与这些架构进展正交:我们不提出新的骨干,而是隔离固定小模型设定下通过共享内存进行协议级协作的推理时动态,分析其与输出格式和语义覆盖的交互(Kim等,2022(https://arxiv.org/html/2605.31354#bib.bib20);Lee等,2023(https://arxiv.org/html/2605.31354#bib.bib21))。  

#### 模块化智能体与编排成本。交互式多模态智能体日益部署在动态环境中,如GUI导航,成功取决于接地感知和顺序规划(Koh等,2024(https://arxiv.org/html/2605.31354#bib.bib9);Hong等,2024(https://arxiv.org/html/2605.31354#bib.bib10);Zheng等,2024(https://arxiv.org/html/2605.31354#bib.bib22))。近期研究通过角色特化和迭代验证探索模块化推理(Li等,2024(https://arxiv.org/html/2605.31354#bib.bib11)),特别是在文档导向的管线中(Han等,2025(https://arxiv.org/html/2605.31354#bib.bib12);Sun等,2025(https://arxiv.org/html/2605.31354#bib.bib13);Jain等,2025(https://arxiv.org/html/2605.31354#bib.bib23);Yu等,2025(https://arxiv.org/html/2605.31354#bib.bib31))。然而,此类编排的有用性常被混淆因素遮蔽,包括更重的骨干容量或未归一化的交互成本(Wei等,2022(https://arxiv.org/html/2605.31354#bib.bib24);Wang等,2022(https://arxiv.org/html/2605.31354#bib.bib25);Yao等,2023(https://arxiv.org/html/2605.31354#bib.bib26))。相比之下,我们提出了一个用于共享工作空间协议的形式化审计框架,重点关注输出完整性和轨迹产物。我们通过计算日志实验强调成本归一化比较,以识别导致协作在资源受限VQA中性能下降的具体机制——例如噪声累积(Wang等,2025(https://arxiv.org/html/2605.31354#bib.bib27);Jiang等,2024(https://arxiv.org/html/2605.31354#bib.bib28);Yi等,2025(https://arxiv.org/html/2605.31354#bib.bib29);Kugo等,2025(https://arxiv.org/html/2605.31354#bib.bib30))。  

## 3 方法  

我们将文档视觉问答问题形式化为在严格计算约束下的顺序决策过程。我们的目标是分析弱模型在配备外部工作记忆时的推理动态。  

### 3.1 问题形式化  

令\\(M_\\theta\\)表示一个视觉-语言模型,参数为\\(\\theta\\),受资源约束\\(\\Omega\\)(由有限的参数规模,例如4B–8B,以及单GPU内存定义)。给定视觉输入\\(I=\\{I_k\\}_{k=1}^K\\)(代表幻灯片、图表或文档)和自然语言查询\\(q\\),目标是生成一个答案\\(a\\in\\mathcal{A}\\),最大化似然\\(P(a|I,q)\\)。在协作设定中,答案\\(a\\)的生成由一系列中间离散潜在状态\\(B_{1:T}\\)(代表共享工作空间的轨迹)所中介。推理过程旨在近似给定推理链的答案的难解后验:  

\\[  
P(a|I,q)\\approx\\sum_{B_T}P_\\theta(a|I,q,B_T)\\prod_{t=1}^T P_\\theta(B_t|I,q,B_{t-1})  
\\]  

(1)  

我们关注\\(M_\\theta\\)的**推理时**行为,将权重视为固定。  

### 3.2 外部工作记忆(白板)  

为外部化中间推理步骤,CoSee引入了一个结构化的潜在状态——**白板**(\\(B_t\\))。与内部隐藏状态不同,\\(B_t\\)是一个离散的、可解释的条目序列,所有智能体均可读取。形式上,在时间步\\(t\\),白板状态定义为有序序列\\(B_t=[e_1,e_2,\\dots,e_t]\\),其中每个条目\\(e_i\\)是一个元组\\((\\mathbf{m},\\mathbf{p},\\texttt{id})\\)。这里,\\(\\mathbf{m}\\)表示自然语言笔记(证据或假设),\\(\\mathbf{p}\\)表示可选的接地指针(例如页面索引或区域坐标),\\(\\texttt{id}\\)标识作者智能体。白板的转移动态由一个轻量级控制器管理,该控制器强制执行严格的读写接口。在每个步骤\\(t\\),控制器将当前状态\\(B_{t-1}\\)暴露给活动智能体策略\\(\\pi\\),后者采样一个新更新\\(e_t\\)。状态确定性地演变为\\(B_t = B_{t-1} \\oplus e_t\\),其中\\(\\oplus\\)表示追加操作。这种设计确保整个推理轨迹可观察且可审计。  

### 3.3 推理动态与协议  

我们研究三种不同的推理协议,将其视为状态转移概率\\(P(B_t|B_{t-1})\\)和读取函数的变化。  

#### 直接推理(基线)。基线将顺序过程坍缩为单一步骤。模型仅基于输入直接采样输出分布:  

\\[  
\\hat{a}\\sim P_\\theta(a|I,q)  
\\]  

(2)  

这作为计算成本的下界和推理质量的参考点。  

#### 开环迭代精化(单智能体与多智能体)。在此机制中,智能体在固定预算\\(T\\)步内与白板交互,无需显式外部反馈。  

- • **单智能体动态**:单一策略\\(\\pi_\\theta\\)迭代更新白板。在步骤\\(t\\),智能体采样\\(e_t\\sim\\pi_\\theta(\\cdot|I,q,B_{t-1})\\)。  
- • **双智能体动态(扫描-检查)**:我们实例化两个互补角色\\(\\pi_{\\text{scan}}\\)和\\(\\pi_{\\text{check}}\\),通过提示从同一骨干\\(M_\\theta\\)派生。智能体交替运行,有效建模一个协作博弈,其中\\(\\pi_{\\text{scan}}\\)提出证据,\\(\\pi_{\\text{check}}\\)基于共享上下文\\(B_{t-1}\\)精化或反驳它。关键的是,在两种设定中,最终答案通过专用读取步骤\\(\\hat{a}\\sim P_\\theta(a|I,q,B_T)\\)生成,确保中间产物\\(e_{1:T}\\)不会直接泄露到答案格式中,除非明确关注。  

#### 带信息瓶颈的门控转移(验证白板)。为减轻无根据幻觉(噪声)的传播,我们在状态转移上引入条件门控机制。令\\(V_\\phi(e,I,q)\\in\\{0,1\\}\\)为一个验证函数(由同一骨干\\(M_\\theta\\)参数化),将提议的条目\\(e\\)映射为二元有效性分数。更新规则变为:  

\\[  
B_t=\\begin{cases}  
B_{t-1}\\oplus e_t & \\text{if } V_\\phi(e_t,I,q)=1 \\text{ (支持)} \\\\  
B_{t-1} & \\text{否则 (丢弃)}  
\\end{cases}  
\\]  

(3)  

该机制充当一个**信息瓶颈**,在高熵或幻觉笔记成为后续步骤的条件上下文之前将其过滤掉。我们假设这种控制对于防止弱模型中的噪声累积至关重要。

相似文章

AgentCollabBench:诊断优秀智能体为何成为糟糕的协作者

arXiv cs.CL

本文介绍了 AgentCollabBench,这是一个针对多智能体系统的诊断性基准,用于评估四大主流大语言模型(LLM)中的指令衰减和上下文泄漏等行为风险。文章认为,通信拓扑结构是多智能体可靠性的关键因素,其重要性往往超越了模型的原始能力。

AI代理中的操作幻觉与安全漂移

arXiv cs.AI

本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。

当记忆说谎:VLM智能体空间记忆过时性的实证研究

Hugging Face Daily Papers

本文实证研究了视觉语言模型智能体中的空间记忆过时性问题,发现模型常常忽略矛盾的视觉证据,并且信任过时记忆会增加安全风险。作者提出了审计机制,但表明在记忆-观察冲突下的视觉接地仍是一个重大开放挑战。