QV-PIC:面向高效RAG服务的查询感知视觉位置无关缓存

arXiv cs.CL 论文

摘要

本文介绍了QV-PIC,一种查询感知的双分辨率位置无关缓存框架,用于高效的RAG服务,相比朴素渲染图像PIC,F1值提升21.6个点,同时相对于完整预填充将首令牌时间降低83.8%。

arXiv:2608.12121v1 公告类型:新 摘要:检索增强生成(RAG)在多次查询中重复预填充相同的文本块,导致冗余计算。位置无关缓存(PIC)通过跨位置重用预计算的键值(KV)来缓解这一问题,但其效率受限于大量文本令牌。将文本块渲染为图像可以将文本压缩为更少的视觉令牌,但渲染图像PIC比文本PIC遭受更严重的质量下降。这种表示特定的差距主要源于独立编译缓存之间的上下文不匹配,以及视觉压缩过程中细粒度文本证据的丢失。现有的PIC修复方法主要通过选择性重计算来解决前者,但它们引入了在线计算开销,且无法恢复丢失的文本细节。我们提出QV-PIC,一种由模型原生模板引导的查询感知双分辨率PIC重用框架。离线阶段,QV-PIC在模型原生的聊天模板前缀下编译视觉缓存,无需在线重计算即可提高PIC质量。在线阶段,它通过低分辨率保留全局上下文,并在高分辨率预算内通过累积查询相关性分数恢复细粒度文本证据,从而保留视觉压缩的效率优势。在六个任务上,QV-PIC相比朴素渲染图像PIC将平均F1提升21.6个点,缩小了与朴素文本PIC的差距,并以比优化文本PIC高2.58的F1超越后者,同时将TTFT降低17.2\%。相对于完整预填充,它将TTFT降低了83.8%。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:29

# QV-PIC:面向高效 RAG 服务的查询感知视觉位置无关缓存

Rui MengWangze NiJianxin YanHeng CaoLibin ZhengPeng ChengJinfei Liu

###### 摘要

检索增强生成(RAG)会在不同查询间重复预填充相同的文本块,导致冗余计算。位置无关缓存(PIC)通过跨位置复用预计算的关键值(KV)来缓解这一问题,但其效率受限于大量文本 token。将文本块渲染为图像可将文本压缩为更少的视觉 token,但渲染图像 PIC 相比文本 PIC 会遭受更严重的质量下降。这种表示相关的差距主要源于独立编译缓存之间的上下文不匹配,以及视觉压缩过程中细粒度文本证据的丢失。现有 PIC 修复方法主要通过选择性重计算来处理前者,但这会在在线路径引入计算开销,且无法恢复丢失的文本细节。我们提出 QV-PIC,一种由模型原生模板引导的查询感知双分辨率 PIC 复用框架。离线阶段,QV-PIC 在模型原生聊天模板前缀下编译视觉缓存,无需在线重计算即可提升 PIC 质量。在线阶段,它通过累计查询相关性分数,以低分辨率保留全局上下文,并在高分辨率预算内恢复细粒度文本证据,从而保留视觉压缩的效率优势。在六个任务上,QV-PIC 相比基础渲染图像 PIC 平均 F1 提升 21.6 分,弥补了与基础文本 PIC 之间的差距,并超越优化后的文本 PIC 2.58 F1,同时将 TTFT 降低 17.2%。相对于完整预填充,它减少了 83.8% 的 TTFT。

1footnotetext:通讯作者。

## 引言

检索增强生成(RAG)通过检索到的外部文档增强大语言模型(LLMs)的用户查询,以支持知识密集型任务(15 (https://arxiv.org/html/2608.12121#bib.bib13);10 (https://arxiv.org/html/2608.12121#bib.bib27);13 (https://arxiv.org/html/2608.12121#bib.bib28);4 (https://arxiv.org/html/2608.12121#bib.bib10))。在长文档 RAG 中,相同的文档块会在不同查询间被重复预填充,造成冗余的预填充计算。动态检索会以不同的上下文位置重新排列检索到的块,这阻碍了对依赖精确前缀匹配或预定义结构的缓存进行高效复用(8 (https://arxiv.org/html/2608.12121#bib.bib14);12 (https://arxiv.org/html/2608.12121#bib.bib15);30 (https://arxiv.org/html/2608.12121#bib.bib6))。位置无关缓存(PIC)通过独立编译可复用的块,并在服务时组合其键值(KV)缓存来解决这一限制,从而实现对重复内容的跨位置复用。现有的面向 RAG 的 PIC 方法(27 (https://arxiv.org/html/2608.12121#bib.bib16);11 (https://arxiv.org/html/2608.12121#bib.bib17))主要基于文本。尽管消除了重复预填充,但与 KV 缓存相关的传输和计算成本仍随上下文长度扩展(14 (https://arxiv.org/html/2608.12121#bib.bib8);17 (https://arxiv.org/html/2608.12121#bib.bib7);19 (https://arxiv.org/html/2608.12121#bib.bib9))。

视觉文本压缩为缩短可复用的上下文表示提供了补充性的机会。通过将文本块渲染为紧凑图像,视觉语言模型(VLMs)可以将多个文本单元编码为一个视觉 token,从而提高每个 token 的信息密度(16 (https://arxiv.org/html/2608.12121#bib.bib18);26 (https://arxiv.org/html/2608.12121#bib.bib19);24 (https://arxiv.org/html/2608.12121#bib.bib21))。我们将基于渲染图像的 PIC 称为*渲染图像 PIC*,与之相对的是基于原始文本块的*文本 PIC*。例如,Glyph(6 (https://arxiv.org/html/2608.12121#bib.bib20)) 实现了 3-4× 的 token 压缩,同时保持了与同等规模纯文本 LLM 相当的长上下文性能。这一结果表明,渲染图像可以大幅缩短可复用的 KV 序列,同时在完整预填充下保留有用的文档信息,这促使在高效 RAG 服务中跨查询复用渲染图像 PIC。

参见图 1 的说明:渲染图像 PIC 使用的 KV token 更少,但在 Glyph 的六个 LongBench QA 任务(72 DPI)上,其从完整预填充到 PIC 的质量下降比文本 PIC 更大。

这一机会引出了高效 RAG 服务的核心问题:渲染图像 PIC 能否达到文本 PIC 的复用质量?在相同条件下,我们使用 Glyph 在六个 LongBench 问答(QA)任务上比较文本 PIC 和渲染图像 PIC。如图 1 (https://arxiv.org/html/2608.12121#Sx1.F1) 所示,尽管渲染大幅减少了 token 数量,但渲染图像 PIC 从完整预填充到 PIC 的退化比文本 PIC 更严重。这表明渲染图像无法直接继承文本的 PIC 复用能力。这种与表示相关的差距反映了两种耦合的失败模式。首先,独立编译的缓存缺乏完整预填充时可用的上下文条件,导致组合后的缓存状态不匹配。其次,文本 token 化将字符和单词保留为离散符号,而视觉编码将字符、数字、标点和局部布局压缩为更少的视觉 token,每个 token 聚合了多个文本单元。因此,携带答案的细粒度证据可能在渲染图像 KV 缓存构建之前就被模糊、混淆或省略。渲染图像 PIC 因此必须同时处理*编译上下文不匹配*和*细粒度证据丢失*。

现有的 PIC 修复方法主要通过选择性重计算或块边界修正来处理第一种失败模式(27 (https://arxiv.org/html/2608.12121#bib.bib16);11 (https://arxiv.org/html/2608.12121#bib.bib17);29 (https://arxiv.org/html/2608.12121#bib.bib22);20 (https://arxiv.org/html/2608.12121#bib.bib23))。此类方法可以在缓存组合后刷新上下文相关的状态,但它们在在线路径引入了额外的计算,并且作用于已经固定的视觉表示。它们无法重建在视觉编码过程中未被保留的字符、数字、标点或布局线索。这一限制对渲染图像尤为重要,因为渲染图像中携带答案的信息通常存在于细粒度的文本细节中,而非足以理解自然图像的粗略视觉语义。因此,高效的渲染图像 PIC 面临两个关键挑战:

挑战 1:高效且稳定地修复编译上下文不匹配。在编译时前置一次性前缀并在之后剥离,可以吸收块起始处的注意力汇聚现象,而无需在线重计算。但任意虚拟前缀会引发依赖于前缀的缓存状态,这使得修复对 token 身份和长度敏感。

挑战 2:高效恢复视觉文本细节。渲染分辨率不仅控制文本可读性,还控制视觉 token 数量。统一的低分辨率效率较高,但有丢失细粒度证据的风险。高分辨率保留了更丰富的文本细节,但会急剧增加 token 数量,从而侵蚀视觉文本压缩的效率优势。

针对这些挑战,我们提出 QV-PIC,一种用于渲染图像 PIC 的模型原生模板条件化、查询感知的双分辨率框架,它将固定的文本块转化为可控的细粒度单元。对于挑战 1,QV-PIC 在模型原生聊天模板前缀下编译每个渲染图像,并在存储前剥离共享前缀的 KV 条目。该原生模板提供了完整预填充期间存在的、与请求无关的提示格式条件,从而减少系统性的编译上下文不匹配,且无需在线重计算。对于挑战 2,QV-PIC 为每个渲染图像预编译低分辨率和高分辨率两种缓存版本。在服务时,它首先提供完整的低分辨率上下文覆盖,仅根据累计查询相关性将一组有界的目标渲染图像提升到高分辨率。这两个组成部分是互补的:模板条件化编译首先夯实渲染图像 PIC 的质量基础,查询感知的双分辨率分配随后恢复与查询相关的特定文本细节。在线路径不需要生成渲染图像、进行视觉编码或对上下文侧进行完整预填充。我们的贡献总结如下:

- •我们揭示了文本与渲染图像表示对 PIC 复用的显著影响。对于相同的文本内容,渲染图像 PIC 比文本 PIC 退化更严重,但前者在质量-延迟性能方面具有更大的潜力。
- •我们提出了 QV-PIC,一个用于渲染图像 PIC 的模板条件化、查询感知双分辨率框架。它高效地减少了渲染图像 PIC 的编译上下文不匹配,并提高了其细粒度文本证据的保真度。
- •我们证明了 QV-PIC 能带来一致的质量-延迟改进。QV-PIC 相比基础渲染图像 PIC 平均 F1 提升 21.6 分,消除了其与基础文本 PIC 之间 12.2 分的差距,并超越优化后的文本 PIC 2.58 分,同时将 TTFT 降低 17.2%。与完整预填充相比,它将在线预填充时间减少了 83.8%。

## 背景

### 面向文本的位置无关缓存

在 RAG 服务中,相同的文本块可能被不同查询以不同的前缀、顺序和上下文位置检索。传统前缀缓存仅在请求共享固定前缀或预定义布局时复用 KV 缓存。例如,Prompt Cache(8 (https://arxiv.org/html/2608.12121#bib.bib14)) 预定义了带位置的可缓存模块,而 RAGCache(12 (https://arxiv.org/html/2608.12121#bib.bib15)) 则应用基于树的 KV 检索,并跨 GPU 和内存复用前缀路径。这种依赖前缀的复用在动态检索中难以实现,因为同一块可能出现在不同的周围上下文中。文本 PIC 通过独立编译文本块为可复用的 KV 缓存,并在在线服务时链接检索到的缓存来解决这一限制。Cache-Craft(1 (https://arxiv.org/html/2608.12121#bib.bib29)) 识别可复用的块缓存,并选择性地重计算上下文敏感的状态;EPIC(11 (https://arxiv.org/html/2608.12121#bib.bib17)) 将 PIC 形式化为编译-链接框架,仅重计算前导 token 以缓解注意力汇聚;TurboRAG(18 (https://arxiv.org/html/2608.12121#bib.bib30)) 使用独立注意力掩码和重新排序的 RoPE 位置拼接预计算的 KV 缓存。然而,这些文本 PIC 方法仍会在 token 选择、重计算或调度中产生在线开销。尽管静态离线链接可以降低延迟,但它受限于预编译前缀的形式和语义。更重要的是,它们无法缩短文本块表示。因此,即使没有完整预填充,长文档 RAG 仍需要加载和传输大型文本 KV 缓存,这限制了 PIC 的复用效率(17 (https://arxiv.org/html/2608.12121#bib.bib7);19 (https://arxiv.org/html/2608.12121#bib.bib9))。

### 面向图像的位置无关缓存

视觉文本压缩将文本渲染为图像,从而提高视觉 token 的信息密度。已有工作包括 Text or Pixels(16 (https://arxiv.org/html/2608.12121#bib.bib18))、VIST(26 (https://arxiv.org/html/2608.12121#bib.bib19))、Glyph(6 (https://arxiv.org/html/2608.12121#bib.bib20))、DeepSeek-OCR(24 (https://arxiv.org/html/2608.12121#bib.bib21)) 和 DeepSeek-OCR 2(25 (https://arxiv.org/html/2608.12121#bib.bib1)),它们展示了该方法在长上下文建模和 token 压缩方面的有效性。然而,压缩后的视觉文本仍然对渲染分辨率和视觉编码敏感,仅凭 OCR 可读性无法反映长程检索和推理质量(28 (https://arxiv.org/html/2608.12121#bib.bib24))。近期工作使视觉处理适应任务需求:AgentOCR(7 (https://arxiv.org/html/2608.12121#bib.bib2)) 使用分段光学缓存来复用渲染的交互历史片段,而 AgenticOCR(23 (https://arxiv.org/html/2608.12121#bib.bib3)) 识别与查询相关的区域并按需执行 OCR。这些方法减少了不相关的视觉输入,但并未复用可跨请求位置无关组装的页面级 KV 缓存。多模态缓存方法如 MPIC(29 (https://arxiv.org/html/2608.12121#bib.bib22)) 和 VLCache(20 (https://arxiv.org/html/2608.12121#bib.bib23)) 进一步通过选择性重计算复用视觉中间状态或语言模型 KV 缓存。然而,它们固定的普通分辨率可能会丢弃后续 KV 修复无法恢复的细粒度文本证据,而重计算仍会产生在线开销。

## 方法

QV-PIC 解决了渲染图像 PIC 中两个退化来源:缓存状态不匹配和细粒度文本证据丢失。离线阶段,模型原生模板条件化编译提高了独立编译 KV 的质量,并建立了可靠的复用基础。在线阶段,查询感知的双分辨率分配无需重新渲染或重新编码图像,即可选择性地恢复查询相关的视觉细节。

图 2:QV-PIC 概述。离线阶段,模型原生模板条件化编译构建低分辨率和高分辨率的渲染图像缓存以及源文本嵌入。在线阶段,查询感知的双分辨率分配为每个渲染图像选择一个缓存版本,在当前的上下文顺序下组装所选缓存,重新锚定 M-RoPE 位置,并且仅预填充查询。

### 框架概述

给定查询 q,令 C(q)=(c_1,…,c_n) 表示当前上下文顺序下检索到的块。每个块 c_i 在分辨率 r 下被渲染为 x_i^r = Render(c_i;r)。如图 2 (https://arxiv.org/html/2608.12121#Sx3.F2) 所示,QV-PIC 遵循两阶段工作流程。

阶段 I:模板条件化缓存准备。对于每个可复用块 c_i,QV-PIC 渲染低分辨率和高分辨率图像,并在模型原生聊天模板前缀下独立编译每个分辨率的一个缓存。它在存储前剥离前缀 KV 条目,但保留由此产生的模板条件化渲染图像 KV 条目。缓存库存储两种分辨率变体、token 数量元数据、源顺序元数据以及用于后续路由的源文本嵌入。

阶段 II:查询感知缓存组装。在服务时,QV-PIC 对检索到的块与查询进行相关性评分,并将至多 B 个查询相关的渲染图像提升为高分辨率。所有检索到的块都保留在上下文中,每个渲染图像恰好激活一个缓存版本。相关性排序仅用于分辨率分配;缓存组装遵循 RAG 请求的当前上下文顺序。在 M-RoPE 重新锚定后,组装好的缓存作为过去的 KV 提供,因此 VLM 仅在线计算查询预填充和答案生成。

### 模型原生模板条件化编译

在完整预填充中,渲染图像上下文是在模型原生聊天模板前缀下处理的,该前缀提供了 VLM 多模态服务接口中与请求不变的提示格式条件。无前缀编译会移除该条件,而虚拟前缀则用任意 token 替代它,其效果随 token 身份和长度而变化。QV-PIC 而是将聊天模板前缀作为编译时条件,并且仅剥离

相似文章

RAGOCR:基于视觉表示的检索增强文本光学压缩

arXiv cs.CL

RAGOCR 是一种新颖框架,根据输入查询将检索到的文档压缩为紧凑的视觉表示,并利用查询感知的动态分辨率来平衡压缩率与信息保真度。实验表明,其在仅使用八分之一输入 token 的情况下,准确率比朴素 RAG 高出 15% 以上。

RAG-Stack:协同优化RAG服务性能与质量

arXiv cs.AI

本文介绍了RAG-Stack,一个通过高效探索算法-系统联合配置空间来协同优化RAG服务性能与答案质量的框架。它找到的Pareto前沿比现有配置搜索方法覆盖了显著更广的质量-性能空间。