RENDER:控制大语言模型记忆评估中面向读者的证据

arXiv cs.AI 论文

摘要

本文介绍了RENDER,这是一个控制大语言模型记忆评估中面向读者证据的基准测试,展示了基于记忆条目呈现给模型的方式的显著准确性变化。

arXiv:2608.23568v1 公告类型:新 摘要:记忆和检索增强生成评估常常将回答模型的输入视为实现细节,尽管系统可能将相同的历史记录呈现为记忆条目、摘要、类型化记录或原始摘录。我们介绍了RENDER,一个基准测试控制,它固定对话内容,同时改变面向读者的制品。RENDER结合了五级数据包阶梯,定位回答承载内容何时进入输入,以及确定性模板,近似ChatGPT风格的条目、LangChain摘要、MemGPT风格的类型化记录和原始对话。在500个LongMemEval问题和九个模型上,匹配预算的解析数据包比近期截断的原始对话高出42.4-72.6分。在部署风格的模板中,最佳-最差分布为每个模型24.6-48.8分;在主要评分器下,ChatGPT风格的条目在9个模型中有7个的点估计高于原始对话。评审员重新评分保留了正向的总体效应,但特定模型的显著性混合。三个在正式账本数据包上得分为0%的模型从自然语言条目中回答相同事实的比率为45.4-53.4%。该效应在检索噪声下持续存在并转移到HotpotQA,表明记忆/RAG评估应报告或控制面向读者的制品。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:08

# RENDER:在LLM记忆评估中控制读者可见证据
来源:https://arxiv.org/html/2608.23568  
Yuan Si  University of Waterloo  Waterloo, Canada  yuan\.si@uwaterloo\.ca  
& Simeng Han  Stanford University  Stanford, USA  shan6@law\.stanford\.edu  
Daming Li  Independent Researcher  USA  damingliyale22@gmail\.com  
& Jialu Zhang  University of Waterloo  Waterloo, Canada  jialu\.zhang@uwaterloo\.ca  

###### 摘要  
记忆与RAG评估常将回答模型的输入视为实现细节,即使系统可能将同一历史记录渲染为记忆条目、摘要、类型化记录或原始片段。我们引入RENDER,一种基准控制方法,它固定对话内容,同时改变读者可见的制品。RENDER结合了五级数据包阶梯(定位答案内容进入输入的时机)与确定性模板,这些模板近似模拟了ChatGPT风格条目、LangChain摘要、MemGPT风格类型化记录和原始对话。在LongMemEval的500个问题和九个模型上,预算匹配的已解析数据包比按近因截断的原始对话高出42.4–72.6分。在部署风格的模板中,每个模型最佳与最差得分的差距为24.6–48.8分;根据主要评分器,9个模型中有7个的ChatGPT风格条目得分估计值高于原始对话。评审员重新评分保持了整体正向效果,但针对具体模型的显著性表现不一。三个在正式账本数据包上得0分的模型,能从自然语言条目中回答出相同事实,得分达45.4–53.4%。该效果在检索噪声下依然存在,并可迁移至HotpotQA,这表明记忆/RAG评估应报告或控制读者可见的制品。

**RENDER:在LLM记忆评估中控制读者可见证据**  
Yuan Si  
University of Waterloo  
Waterloo, Canada  
yuan\.si@uwaterloo\.ca  

Simeng Han  
Stanford University  
Stanford, USA  
shan6@law\.stanford\.edu  

Daming Li  
Independent Researcher  
USA  
damingliyale22@gmail\.com  

Jialu Zhang††thanks:Corresponding author  
University of Waterloo  
Waterloo, Canada  
jialu\.zhang@uwaterloo\.ca  

## 1 引言  
记忆或检索增强生成(RAG)系统传递给读者的并非原始对话,而是对话的一种*渲染*形式。我们广义地使用“渲染”一词:读者可见制品包括选择、紧凑性、冲突解决暴露、元数据密度、弃用提示和表面形式。在诊断性和预算匹配的控制实验中,我们表明这一选择并非中性的实现细节:测量到的准确率范围从接近0%到82%,取决于到达回答模型的是何种制品。  
这是一个评估问题。  
记忆和RAG基准测试通常比较那些读者接收不同制品的流水线:一个系统传递原始检索到的对话,另一个传递摘要,还有一个传递结构化的记忆记录。如果这些制品未被报告或控制,分数将混淆模型能力、检索质量、记忆更新逻辑、紧凑性、冲突解决暴露、弃用提示和证据渲染。因此,报告的提升可能反映的是更好的读者可见制品,而非更好的模型或记忆系统。  
我们提出:*在固定底层对话、问题和回答约定的前提下,读者可见的证据制品能在多大程度上改变测量的记忆问答准确率?*  
考虑一个用户先说住在波士顿,后来说搬到了丹佛,然后问“我现在住在哪里?”。一个ChatGPT风格的记忆条目可能显示*“用户住在丹佛(从波士顿搬来)”*;一个MemGPT风格的记录可能暴露`user.city = "Denver"` (Packer et al., 2023 (https://arxiv.org/html/2608.23568#bib.bib3));一个LangChain风格的摘要可能将此会话压缩成一段话 (LangChain, 2026 (https://arxiv.org/html/2608.23568#bib.bib4))。这些制品编码了相同的事实,但它们并非等价的读者输入。在我们的实验中,部署风格的模板在每个模型上造成了24–49分的准确率差异。  

我们引入RENDER(*读者证据渲染诊断*),一种基准控制方法,它固定底层对话和回答约定,同时改变读者可见的制品。RENDER包含两个工具。  
第一,五级数据包阶梯逐步揭示包含答案的内容:P0P\_\{0\}和P1P\_\{1\}仅暴露见证地址;P2P\_\{2\}首次将已解析的当前状态值写入数据包主体;P3P\_\{3\}/P4P\_\{4\}则围绕该值添加元数据。该阶梯可定位失败是源于缺失内容、未解决的冲突,还是周围的数据包表面。  
第二,模板系列比较将同一底层对话渲染为部署记忆表面的确定性近似:ChatGPT风格的自然语言条目、LangChain摘要、MemGPT风格的类型化记录以及原始对话。  
RENDER是一项输入侧研究,而非输出格式研究。先前工作询问模型在被要求*产生*JSON、XML或受约束输出时推理能力是否下降(Tame et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib13); Lee et al., 2026 (https://arxiv.org/html/2608.23568#bib.bib59))。我们固定回答约定,仅改变读者看到的证据。我们在LongMemEval(500个问题;Wu et al. 2025 (https://arxiv.org/html/2608.23568#bib.bib1))、LoCoMo(200个问题;Maharana et al. 2024 (https://arxiv.org/html/2608.23568#bib.bib2))、检索噪声变体和HotpotQA迁移上运行了约238,000次模型调用。主要实验使用来自OpenAI、Anthropic和Google的九个商业模型,并禁用了工具、搜索和提供商原生记忆功能。一个独立的LLM评审员对来自两个标题实验的31,500个项目进行重新评分,一个600项目的第二评审员样本确认了评分一致性(附录C (https://arxiv.org/html/2608.23568#A3))。  

#### 主要发现。  
1. 1\.**当答案进入数据包时,准确率上升。** 所有九个模型在P0P\_\{0\}/P1P\_\{1\}时接近0%;有反应能力的模型在P2P\_\{2\}时恢复到15–25%。P2P\_\{2\}之上的元数据使准确率变化最多±\pm2分。  
2. 2\.**预算控制逆转了原始与结构化的结论。** 完整的原始对话优于预算受限的正式数据包,但在匹配的词数预算下,精简的已解析P2P\_\{2\}数据包在每个模型上都比按近因截断的原始对话高出42.4–72.6分。  
3. 3\.**部署风格的表面选择显著改变分数。** 在主要的子串评分器下,9个模型中有7个的ChatGPT风格条目得分估计值高于原始对话;评审员重新评分保持了整体正向效果,但针对具体模型的显著性表现不一。LangChain摘要得分为4.4–10.6%;MemGPT风格的类型化记录得分为14.8–33.0%。最佳与最差得分的差距在每个模型上达到24.6–48.8分。  
4. 4\.**证据制品可能导致拒绝回答。** 三个模型在正式账本数据包上得0分,但从自然语言条目中回答相同事实时得分达45.4–53.4%,这与制品/提示触发的弃用行为一致,而非能力缺失。  

这些结果支持一种报告规范:记忆/RAG评估应说明读者可见的证据制品,或包含固定的制品控制。在我们的实验中,若无此控制,24–49分的制品差异与模型或流水线的进步无法区分。  

## 2 相关工作  
#### 长上下文与记忆评估。  
长上下文基准测试关注检索、上下文长度、位置鲁棒性或长期推理,而非固定证据的渲染形式。例子包括RULER (Hsieh et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib5))、InfiniteBench (Zhang et al., 2024d (https://arxiv.org/html/2608.23568#bib.bib46))、L-Eval (An et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib47))、ZeroSCROLLS (Shaham et al., 2023 (https://arxiv.org/html/2608.23568#bib.bib48))、LongBench 和 LongBench v2 (Bai et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib51), 2025 (https://arxiv.org/html/2608.23568#bib.bib9))、Marathon (Zhang et al., 2024c (https://arxiv.org/html/2608.23568#bib.bib16)) 和 BABILong (Kuratov et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib8))。  
架构层面的工作通过循环、压缩、检索或记忆扩展可用上下文 (Dai et al., 2019 (https://arxiv.org/html/2608.23568#bib.bib55); Rae et al., 2020 (https://arxiv.org/html/2608.23568#bib.bib57); Wu et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib58); Khandelwal et al., 2020 (https://arxiv.org/html/2608.23568#bib.bib56))。  
LongMemEval (Wu et al., 2025 (https://arxiv.org/html/2608.23568#bib.bib1)) 和 LoCoMo (Maharana et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib2)) 最接近我们的设置,因为它们评估具有更新和时间范围的多会话对话记忆。关于位置敏感性的工作表明,即使相关信息存在,模型也可能失败 (Liu et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib53));RENDER研究的是一个正交变量:这些信息如何被渲染给读者。  

#### 记忆、检索和RAG系统。  
现代记忆系统通常在生成前重写原始历史。MemGPT (Packer et al., 2023 (https://arxiv.org/html/2608.23568#bib.bib3)) 将记忆外化为类操作系统层级;HippoRAG 和 GraphRAG 通过图索引组织证据 (Gutierrez et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib6); Edge et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib7));ENGRAM 使用类型化记忆模式 (Patel and Patel, 2025 (https://arxiv.org/html/2608.23568#bib.bib10));智能体记忆工作包括 MemoryBank、Generative Agents 和 Reflexion (Zhong et al., 2023 (https://arxiv.org/html/2608.23568#bib.bib22); Park et al., 2023 (https://arxiv.org/html/2608.23568#bib.bib21); Shinn et al., 2023 (https://arxiv.org/html/2608.23568#bib.bib23))。像LangChain这样的生产库也提供基于摘要的对话记忆工具 (LangChain, 2026 (https://arxiv.org/html/2608.23568#bib.bib4))。  
RAG工作将外部存储附加到读者 (Lewis et al., 2020 (https://arxiv.org/html/2608.23568#bib.bib24); Guu et al., 2020 (https://arxiv.org/html/2608.23568#bib.bib25); Borgeaud et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib26); Izacard et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib28); Zhang et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib64)),将检索扩展到多跳推理 (Trivedi et al., 2023 (https://arxiv.org/html/2608.23568#bib.bib29); Asai et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib27)),并评估检索质量、忠实度和上下文使用情况 (Es et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib52))。  
这些研究通常评估端到端系统;RENDER则隔离了读者可见制品本身。  

#### 格式敏感性与评审。  
输出侧的结构化生成研究改变了模型回答的方式,例如要求JSON、XML、Markdown或LaTeX (Tame et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib13); Lee et al., 2026 (https://arxiv.org/html/2608.23568#bib.bib59))。RENDER在固定回答约定的同时,改变模型读取的证据。  
更广泛地说,LLM对提示格式、少样本排序、示例组合、思维链提示和自一致性解码敏感 (Sclare et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib35); Lu et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib36); Min et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib38); Zhao et al., 2021 (https://arxiv.org/html/2608.23568#bib.bib37); Wei et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib39); Kojima et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib50); Wang et al., 2023 (https://arxiv.org/html/2608.23568#bib.bib40); Zhang et al., 2024b (https://arxiv.org/html/2608.23568#bib.bib67));最近的RAG工作也表明,上下文格式和更强的原始段落基线可以改变下游推理和评估结论 (Chen et al., 2025 (https://arxiv.org/html/2608.23568#bib.bib14); Laitenberger et al., 2025 (https://arxiv.org/html/2608.23568#bib.bib15))。  
用于受限生成的工具帮助系统生成类型化记录 (Willard and Louf, 2023 (https://arxiv.org/html/2608.23568#bib.bib49)),但并未测试这些记录是否是下游读者的最佳证据制品。我们使用子串匹配、归一化精确匹配和LLM评审员,基于MT-Bench/Chatbot Arena、G-Eval、PandaLM以及已知的评审员偏差相关工作 (Zheng et al., 2023 (https://arxiv.org/html/2608.23568#bib.bib32); Liu et al., 2023 (https://arxiv.org/html/2608.23568#bib.bib33); Wang et al., 2024b (https://arxiv.org/html/2608.23568#bib.bib54), a (https://arxiv.org/html/2608.23568#bib.bib34); Zhang et al., 2025a (https://arxiv.org/html/2608.23568#bib.bib66); Gu et al., 5–9 July 2026 (https://arxiv.org/html/2608.23568#bib.bib65))。  
HotpotQA及相关的多跳问答数据集提供了非对话式的迁移设置 (Yang et al., 2018 (https://arxiv.org/html/2608.23568#bib.bib20); Ho et al., 2020 (https://arxiv.org/html/2608.23568#bib.bib30); Trivedi et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib31))。  
弃用和知识冲突工作表明,拒绝行为可以被任务框架和上下文冲突所塑造 (Zhang et al., 2024a (https://arxiv.org/html/2608.23568#bib.bib17), 2025b (https://arxiv.org/html/2608.23568#bib.bib18); Wen et al., 2025 (https://arxiv.org/html/2608.23568#bib.bib19); Röttger et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib60); Kadavath et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib41); Tian et al., 2023 (https://arxiv.org/html/2608.23568#bib.bib42); Lin et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib43); Xu et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib11); Wilie et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib12); Longpre et al., 2022 (https://arxiv.org/html/2608.23568#bib.bib44); Xie et al., 2024 (https://arxiv.org/html/2608.23568#bib.bib45));我们的贡献在于表明读者可见制品及其弃用提示可以触发此类行为。  

## 3 系统设计与方法论  
RENDER是一个针对特定输入侧问题的基准控制:当底层对话、问题和回答约定固定时,读者可见的证据制品能在多大程度上改变记忆问答准确率?  
每个项目包含三个固定对象:原始对话、问题和预期的回答行为。RENDER改变展示给最终回答模型的制品,我们称之为*读者*;如果控制同时改变了提示包装,我们将其标记为条件的一部分。读者接收一个渲染的证据制品,回答相同的自由形式问题,并被禁止使用外部工具、搜索、提供商原生记忆或隐藏上下文。  
在内部,RENDER存储按轮次寻址的对话,识别包含答案的事件,解决冲突,并渲染不同的读者可见制品。在外部,读者只看到渲染的制品和固定的自由形式回答约定。没有任何条件要求读者输出JSON、XML、类型化记录或任何其他结构化输出;所操纵的变量是输入侧的证据制品。  

#### 数据包阶梯。  
第一个控制是一个五级阶梯,从相同证据中逐步揭示更多包含答案的信息。该阶梯是一个处理阶段诊断工具:它识别失败是因为读者看不到相关内容、冲突解决未被明确化,还是因为周围的数据包表面改变了读者行为。  
我们使用:  
P0P\_\{0\} `raw_packet`,包含见证地址和阻塞标志,但无答案文本;  
P1P\_\{1\} `positive_only`,仅包含见证地址;  
P2P\_\{2\} `active_only`,这是第一个将已解析的当前状态值写入数据包主体的级别;  
P3P\_\{3\} `ctx_normalized`,在

相似文章

内存

Reddit r/artificial

解释了为什么由于KV缓存随上下文长度和并发用户数扩展,LLM推理越来越受内存带宽限制,以及像vLLM和PagedAttention这样的系统如何提高内存利用率。

跨异构任务的自演化LLM记忆抽取

Hugging Face Daily Papers

研究者推出BEHEMOTH基准与CluE聚类提示优化,使LLM能从多样化任务中抽取并保留异构记忆,相比既往自演化框架提升9%。