良好记忆需有ECC:超越准确率评估视觉-语言模型的记忆能力
摘要
本文提出了ECCBench,一个用于评估视觉-语言模型记忆能力的基准和评估框架,超越准确率指标,聚焦于效率、压缩与校准三个维度。
arXiv:2609.00103v1 类型:新论文发布
摘要:记忆被广泛视为大语言模型与视觉-语言模型中一个重要的未解决问题,现有基准通常通过测试长文本或视频的准确率来评估记忆能力。然而,仅准确率指标会忽略对实际长期任务至关重要的特性。我们提出ECCBench,一个超越系统容量——即特定预算下的原始准确率——的基准和评估框架,通过三个我们称为ECC的维度来衡量记忆:效率——从记忆中回答所需的计算量(以FLOPs计);压缩——可压缩输入是否被更准确或高效地记忆;校准——系统是否会根据自身的不确定性和错误成本选择拒绝回答。研究发现,预训练视觉-语言模型在文本记忆上实现了压缩,但在视频记忆上未能实现,且在两者上均表现出较差的校准性。在更广泛的记忆骨干架构中,几种非Transformer架构比RoPE Transformer实现了更好的压缩-校准权衡,这表明它们可能成为长期任务智能体的有用组件。
查看缓存全文
缓存时间: 2026/09/02 06:10
# 好记忆具有ECC:超越准确率评估视觉-语言模型的记忆能力 来源:https://arxiv.org/html/2609.00103 Shmuel Berman 隶属单位:计算机科学系 隶属单位:普林斯顿大学 邮箱:[[email protected]](mailto:) Jia Deng 隶属单位:计算机科学系 隶属单位:普林斯顿大学 邮箱:[[email protected]](mailto:) ###### 摘要 记忆被广泛视为大语言模型(LLM)和视觉-语言模型(VLM)中一个尚未解决的重要问题。现有基准测试通常通过考察长文本或长视频中的回答准确率来评估记忆。然而,仅靠准确率无法衡量那些对实际长期任务至关重要的特性。我们提出了 ECCBench,这是一个基准测试和评估协议,通过三个维度(我们称为 ECC)来衡量超越系统*容量*(在特定计算预算下的原始准确率)的记忆能力: - **效率**:从记忆中回答问题所需的计算量(以浮点运算次数 FLOPs 为单位); - **压缩**:具有可压缩性的输入是否在记忆准确率或效率上表现更优; - **校准**:系统是否能够根据自身的不确定性和错误成本来选择拒绝回答。 我们发现,预训练的 VLM 对文本记忆进行了压缩,但对视频没有;并且在这两种模态上的校准性都很差。在更广泛的记忆骨干模型中,几种非 Transformer 架构在压缩-校准权衡方面优于 RoPE Transformer,这表明它们可能是在长期任务中运行的智能体的有用组件。 *关键词*:记忆⋅\\cdot视觉-语言模型⋅\\cdot长上下文⋅\\cdot基准测试⋅\\cdot校准⋅\\cdot压缩 ## 1 引言 记忆被广泛视为 LLM 和 VLM 缺失的重要能力,也是当前研究的热点领域(Du 等人,2025 (https://arxiv.org/html/2609.00103#bib.bib8);Long 等人,2026 (https://arxiv.org/html/2609.00103#bib.bib21);Hong 等人,2025 (https://arxiv.org/html/2609.00103#bib.bib15);Sinha 等人,2026 (https://arxiv.org/html/2609.00103#bib.bib24))。但是,对于 LLM 或 VLM 来说,什么才算是“好记忆”?我们又该如何评估它?这个问题听起来很简单,并且现有基准测试(Packer 等人,2023 (https://arxiv.org/html/2609.00103#bib.bib1);Hu 等人,2026 (https://arxiv.org/html/2609.00103#bib.bib2);Wang 等人,2025 (https://arxiv.org/html/2609.00103#bib.bib3))似乎已经给出了一个广泛实践的解决方案。该方案是通过考察关于长文本或视频的问答准确率来衡量记忆——如果模型达到了高准确率,就说明它有好的记忆。但是,事实真的如此吗? 在本文中,我们认为并非如此——仅测量准确率是不够的,不能构成对记忆的适当评估。我们主张必须测量额外的方面,包括**效率**、**压缩**和**校准**(ECC)。 **图 1**:仅靠准确率无法区分两个记忆系统;ECC 可以。两个黑箱记忆系统 A 和 B 回答相同的回忆任务,在标准准确率上得分几乎相同,但在准确率之外的维度上存在差异:*效率*(每次查询的计算开销)、*压缩*(当输入具有结构而非随机时获得的准确率提升)和*校准*(在无法回忆答案且错误成本高昂时选择拒绝回答)。系统 B 在所有三个维度上都是更强的记忆。数字仅为说明。 **效率**——访问记忆信息所需的计算资源——在准确率之外也值得测量,因为没有它,强大的记忆可能变得微不足道。如果给予无限时间,一个能力强但没有记忆的模型可以通过暴力检查原始输入的每一块来达到高准确率,就像一个人可以重新阅读一本书的每一页来寻找答案一样。直观地说,好的记忆意味着信息能够快速且毫不费力地被回忆。对记忆的适当评估必须在准确率之外考虑计算成本。 现在,如果一个系统能够准确且高效地回答关于长输入的问题,是否就意味着它拥有好的记忆?令人惊讶的是,答案是否定的,除非问题选择得当,因为一个记忆差的系统仍然可以通过利用其看到的数据和被问到的问题中的偏见来表现良好。例如,如果人脸在长视频中只偶尔出现,但每个问题都是关于人脸的,那么一个只记住人脸而忽略其他内容的系统就能击败一个记住所有其他内容的系统。如果我们让问题完全随机,使得每一条信息被查询的概率都相等呢?在这种情况下,给定足够长的输入和有限的存储空间,选择记住什么将毫无帮助,唯一能超越其他系统的方法就是**压缩**——利用输入中的冗余和规律性(例如,交通信号灯重复出现的绿-黄-红模式)。这表明,对记忆的适当评估应该将压缩与**显著性**(即哪些信息更重要的先验知识)区分开来。这种先验知识高度依赖于任务和领域,并且如果问题被对抗性地选择,实际上可能是有害的。然而,现有的评估并未设计成将显著性作为一个混淆变量分离出来,因此通常不清楚一个系统表现良好是由于显著性还是压缩。 现实系统中的记忆也是有限的,即使经过压缩,也不可能记住所有内容。因此,一个有用的记忆系统需要具备**校准**能力:它能够根据自身的不确定性和错误成本来选择拒绝回答。一个记忆模块应该能够在检测到请求的信息未被保留或不确定,并且错误检索有成本时,选择拒绝回答。然而,现有的基准测试并未设计来评估校准性,因为在大多数情况下,模型没有被提供拒绝选项或错误回答的成本。 我们提出了 **ECCBench**,这是一个*通用的*记忆评估方案,考虑了记忆的所有这些方面。我们通过产生答案所需的计算量来衡量*效率*。我们的数据集允许我们通过改变输入流的信息量并比较相对准确率来衡量*压缩*。最后,我们通过给系统一个明确的拒绝选项(并关联错误成本)来衡量*校准*。这些维度共同提供了一个更完整的图景,展示了一个系统存储、检索和使用信息的效率。图 1 (https://arxiv.org/html/2609.00103#S1.F1) 阐释了这三个轴。在任务中,系统观看一个流,之后被问及一个简短的候选片段是否出现在其中。我们的代码可在此处获取 (https://github.com/princeton-vl/ECCBench),数据集可在此处获取 (https://huggingface.co/datasets/anonstreammem/substream-recollection/tree/main)。 我们的评估揭示了 VLM 的显著弱点。虽然一些 VLM 对文本记忆进行了压缩,但我们测试的模型通常无法对视频进行压缩。它们在两种模态上的校准性也很差;增加错误回答的成本对它们的覆盖率影响甚微。 受到我们 VLM 结果的启发,我们在超出训练时所见序列长度的条件下,评估了多种不同的记忆骨干模型。我们发现,几种架构在压缩-校准权衡方面显著优于 RoPE Transformer。我们的实验表明,底层架构本身可以显著改变记忆的准确率、压缩和校准特性。 ## 2 相关工作 ##### 长上下文与长视频基准测试。 有大量工作通过对长文档或视频提问来评估记忆。自然基准测试使用问答、摘要和长视频理解,而合成基准测试则插入小目标(或称为“探针”),并要求模型检索、排序或计数它们(Bai 等人,2024 (https://arxiv.org/html/2609.00103#bib.bib5);An 等人,2024 (https://arxiv.org/html/2609.00103#bib.bib4);Zhang 等人,2024 (https://arxiv.org/html/2609.00103#bib.bib35);Fu 等人,2025 (https://arxiv.org/html/2609.00103#bib.bib9);Wu 等人,2024 (https://arxiv.org/html/2609.00103#bib.bib32);Lin 等人,2026 (https://arxiv.org/html/2609.00103#bib.bib20);Kamradt, 2023 (https://arxiv.org/html/2609.00103#bib.bib39);Hsieh 等人,2024 (https://arxiv.org/html/2609.00103#bib.bib16);Zhao 等人,2025 (https://arxiv.org/html/2609.00103#bib.bib40);Wang 等人,2024 (https://arxiv.org/html/2609.00103#bib.bib30))。这些测试通过准确率来检验记忆,但混淆了记忆与预测哪些信息会重要的能力。Mangalam 等人(2023)(https://arxiv.org/html/2609.00103#bib.bib22) 用*时间证书*(验证一个答案所需的最小视频片段)形式化了一个相关概念。虽然相关,但我们在第 3 节 (https://arxiv.org/html/2609.00103#S3) 定义的量度捕捉了在整个问题分布上必须保留的流特征。 ##### 记忆的定义与评估。 先前的工作在多种意义上使用*记忆*。早期的神经网络系统描述了一个可以读写的状态,而智能体框架则区分了用于过去事件的情景记忆与语义和程序记忆(Weston 等人,2015 (https://arxiv.org/html/2609.00103#bib.bib31);Graves 等人,2014 (https://arxiv.org/html/2609.00103#bib.bib11);Sumers 等人,2024 (https://arxiv.org/html/2609.00103#bib.bib50)),近期工作则将模型组件本身视为联想记忆(Behrouz 等人,2025a (https://arxiv.org/html/2609.00103#bib.bib51))。我们的定义抽象了这些机制,将记忆系统定义为一个观察流、保留某些状态并基于其后续回答问题的系统。情景记忆的基准测试则测试在对话和交互中的有用能力,包括回忆、时间推理、更新和冲突解决(Maharana 等人,2024 (https://arxiv.org/html/2609.00103#bib.bib57);Wu 等人,2025 (https://arxiv.org/html/2609.00103#bib.bib58);Hu 等人,2026 (https://arxiv.org/html/2609.00103#bib.bib2);Tan 等人,2025 (https://arxiv.org/html/2609.00103#bib.bib59);Long 等人,2026 (https://arxiv.org/html/2609.00103#bib.bib21))。其中一些已经测量了拒绝或效率,但通常是作为整个智能体的属性来测量的,其中检索、推理和存储策略交织在一起。HELM 为沿多个维度(而不仅仅是准确率)评估模型提供了一个重要的更广泛的先例(Liang 等人,2023 (https://arxiv.org/html/2609.00103#bib.bib52))。它的维度是语言模型行为的通用属性,并未识别出一个与实现无关的记忆应该提供什么。我们通过容量、效率、压缩和对成本敏感的拒绝来指定这些记忆特定的属性,并将其应用于文本和视频。 ##### 联想回忆与压缩。 联想回忆是一种历史悠久的记忆测试,其中使用线索来恢复存储的信息,它仍然是比较序列架构的常用方法(Hopfield, 1982 (https://arxiv.org/html/2609.00103#bib.bib56);Graves 等人,2014 (https://arxiv.org/html/2609.00103#bib.bib11);Arora 等人,2024a (https://arxiv.org/html/2609.00103#bib.bib53);Arora 等人,2024b (https://arxiv.org/html/2609.00103#bib.bib54))。ECCBench 在不同模态的任务中将其作为基础单元,因为它需要的语义知识或多步推理很少,允许独立评估记忆的其他属性。在先前的工作中,压缩也被用于不同的方面,包括无损编码和减少存储激活、缓存条目或令牌的方法,主要用于与存储空间的关系(Delétang 等人,2024 (https://arxiv.org/html/2609.00103#bib.bib7);Rae 等人,2020 (https://arxiv.org/html/2609.00103#bib.bib23);Xiao 等人,2024 (https://arxiv.org/html/2609.00103#bib.bib33);Tang 等人,2024 (https://arxiv.org/html/2609.00103#bib.bib27))。先前工作观察到重复提高了循环模型中的回忆率(Arora 等人,2024c (https://arxiv.org/html/2609.00103#bib.bib55)),但没有将其推广到可预测的结构。我们提出的压缩概念是行为性的,可以通过实验确定。 ##### 记忆架构与智能体。 许多架构旨在使用循环状态、学习的更新或缩减的注意力缓存来保留长历史记录,而记忆增强模型和智能体则保留可以被搜索、总结或编辑的内部或外部存储(Katharopoulos 等人,2020 (https://arxiv.org/html/2609.00103#bib.bib17);Sun 等人,2023 (https://arxiv.org/html/2609.00103#bib.bib25);Gu 和 Dao, 2024 (https://arxiv.org/html/2609.00103#bib.bib13);Dao 和 Gu, 2024 (https://arxiv.org/html/2609.00103#bib.bib42);Yang 等人,2025 (https://arxiv.org/html/2609.00103#bib.bib44);Peng 等人,2025 (https://arxiv.org/html/2609.00103#bib.bib45);Sun 等人,2025 (https://arxiv.org/html/2609.00103#bib.bib26);Behrouz 等人,2025b (https://arxiv.org/html/2609.00103#bib.bib41);Zhang 等人,2025 (https://arxiv.org/html/2609.00103#bib.bib47);Lewis 等人,2020 (https://arxiv.org/html/2609.00103#bib.bib37);Packer 等人,2023 (https://arxiv.org/html/2609.00103#bib.bib1);Long 等人,2026 (https://arxiv.org/html/2609.00103#bib.bib21))。ECCBench 将记忆视为一个黑箱,评估能够回忆什么、需要多少总计算量、可预测的经验是否有所帮助,以及系统是否能识别不确定的回忆。因此,同一框架可以评估 Transformer 上下文窗口、循环模型、压缩缓存或检索系统(如 RAG);我们受控的骨干模型实验在比较架构时进一步固定了任务和训练分布。 ## 3 背景 我们首先将记忆形式化为一个在线问题,并定义我们用来评估它的属性。一个记忆系统观察输入,保留其某些记录,并稍后使用其状态回答问题。输入可能零散到达,问题可以在任何时候被提出,关于已经看到的任何内容。我们将流记为 \(x_{1:L}\),其中每个 \(x_i\) 是一个单独的观察,例如一帧或一段文本。长度 \(L\) 不会提前暴露给系统。记忆系统必须维护一个内部状态,尽管它不一定是有界大小的。它提供两种操作,写入和读取,其中写入将下一个观察折叠到状态中,读取接受一个问题 \(q\) 并仅根据该状态回答: \[ S_{t+1} = \mathsf{Write}(S_t, x_{t+1}), \qquad (\hat{y}, S_t^{+}) = \mathsf{Read}(S_t, q), \qquad \hat{y} \in \mathcal{Y} \cup \{\bot\}. \tag{1} \] 这里 \(\mathcal{Y}\) 是允许的答案集合,\(\bot\) 表示拒绝回答。写入是一个通用操作,可以追加、驱逐或重组记忆状态,读取可以在任何时间 \(t\) 发生,并返回更新后的状态。我们对记忆系统唯一假设是我们可以计算它所使用的算术运算;否则我们将它视为黑箱。该算术运算以浮点运算次数(FLOPs)计数,\(F^\mathrm{w}\) 用于读取流,\(F^\mathrm{r}\) 用于回答问题。例如,在预训练的 VLM 中,这可能对应于预填充(prefill)和解码(decode)。我们报告总量 \(F = F^\mathrm{w} + F^\mathrm{r}\),因为一个系统可能在早期花费计算使得后续回答便宜,或者将大部分处理推迟到问题到达时。两者之间的最佳分配取决于每个流需要服务多少查询,这取决于具体任务。在计算 FLOPs 时,我们假设每个流只有一个查询。然而,我们的框架可以扩展为分离 \(F^\mathrm{w}\) 和 \(F^\mathrm{r}\),并衡量记忆相对于它们的属性。我们不对记忆系统做任何其他假设,因此它可以应用于上下文窗口、循环状态、检索索引或显式编辑的存储(如 Lewis 等人 (https://arxiv.org/html/2609.00103#bib.bib37) 所述的 RAG)。
相似文章
ComMem: 用于视觉语言模型测试时自适应的互补记忆系统
ComMem 提出了受生物记忆启发的互补记忆系统,以改进视觉语言模型的测试时自适应,在15个基准测试上超越了现有最先进方法。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。
MBench:面向视频世界模型记忆能力的综合基准
本文介绍了MBench,一个用于评估视频世界模型在长时间跨度下对实体、环境和因果一致性记忆能力的基准。
Almieyar-Oryx-BloomBench:一种用于认知驱动评估视觉语言模型的双语多模态基准
BloomBench是一个基于认知理论的双语(英语-阿拉伯语)多模态视觉语言模型基准,系统评估基于布鲁姆分类学的六个认知层次。实验揭示了当前模型中显著的认知不对称和跨语言性能差距。
MemoBench:动态变化环境中世界建模的基准测试
MemoBench是一个诊断基准,用于评估视频生成模型在动态变化环境中的记忆一致性,其中物体消失并以更新后的状态重新出现。它包括360个真实视频片段和一个结合自动指标与基于VQA评估的测试套件,揭示了记忆一致性挑战的洞见。