IterCOMP:面向多跳问答的推理感知自适应提示压缩
摘要
IterCOMP 是一个无需训练的提示压缩框架,通过迭代整合关键证据来提高多跳问答的效率和准确性。
arXiv:2608.13588v1 公告类型:新
摘要:多跳问答需要跨多个证据段进行复杂推理,这常常使检索增强生成系统因冗长和嘈杂的上下文而不堪重负,从而损害效率和准确性。虽然现有的提示压缩方法试图解决这个问题,但它们通常针对单轮查询设计,未能捕捉相互依赖的推理步骤。我们提出 IterCOMP,一个统一的、无需训练的提示压缩框架,将多跳推理融入迭代压缩循环中。IterCOMP 将文档分解为证据段,评估问题的可回答性,并生成有针对性的后续问题以迭代整合关键证据,从而生成紧凑的、面向推理的提示。在 MusiQue、2WikiMultiHopQA 和 HotpotQA 上的实验表明,IterCOMP 在精确匹配和 F1 分数上取得了显著提升,同时减少了令牌预算,优于现有基线,并在推理复杂性增加时表现出鲁棒性。
查看缓存全文
缓存时间: 2026/08/17 09:40
# 面向多跳问答的推理感知自适应提示压缩
来源: https://arxiv.org/html/2608.13588
Jungmin Yun¹ 与 Youngbin Kim¹, ²
¹ 中央大学人工智能系 ² 中央大学高级影像科学、多媒体与电影研究生院
\{cocoro357, ybkim85\}@cau\.ac\.kr
###### 摘要
多跳问答需要在多个证据段之间进行复杂推理,这常常使检索增强生成系统因冗长且噪声的上下文而过载,从而损害效率与准确性。尽管现有的提示压缩方法试图解决此问题,但它们通常为单轮查询设计,无法捕捉相互依赖的推理步骤。我们提出IterCOMP,一个统一的、无需训练的提示压缩框架,它通过迭代压缩循环融入多跳推理。IterCOMP将文档分解为证据段,评估问题可回答性,并生成针对性的后续问题,以迭代方式整合关键证据,从而产出一个紧凑、面向推理的提示。在MusiQue、2WikiMultiHopQA和HotpotQA上的实验表明,IterCOMP在降低令牌预算的同时,在精确匹配和F1分数上实现了显著提升,超越了现有基线方法,并且随着推理复杂度的增加表现出稳健性。
IterCOMP: 面向多跳问答的推理感知自适应提示压缩
Jungmin Yun¹ 与 Youngbin Kim¹, ²
¹ 中央大学人工智能系 ² 中央大学高级影像科学、多媒体与电影研究生院
\{cocoro357, ybkim85\}@cau\.ac\.kr
## 1 引言
多跳问答(QA)需要基于多段证据进行推理以得出正确答案。大型语言模型(LLMs)通过增强对复杂查询的理解和信息整合能力,显著提升了问答性能。然而,其对静态预训练数据的依赖给知识覆盖带来了固有限制。检索增强生成(RAG)[Lewis et al\. (2020)](https://arxiv.org/html/2608.13588#bib.bib24) 通过从外部来源引入动态、最新的信息来缓解此问题,从而使LLMs能够生成更多样化、准确且基于上下文的响应 [Gao et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib11)。
参考说明 图1:多跳推理示例,回答该问题需要通过初始问题中未出现的隐含中间线索,整合来自多个文档的证据。然而,由于检索文档引起的长输入序列,RAG系统在效率和有效性方面都面临挑战。随着输入长度随检索文档数量线性增长,效率下降,导致更高的推理延迟和更大的计算开销 [Li et al\. (2025a)](https://arxiv.org/html/2608.13588#bib.bib25);[Xu et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib45)。对于基于API的商业LLMs,更长的输入也会导致运营成本增加 [Choi et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib8)。有效性同样受到限制,因为冗长的输入通常包含无关内容,会分散模型注意力并阻碍准确推理 [Shi et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib35)。此外,LLMs表现出位置偏差,例如“中间丢失”现象 [Liu et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib29)。这些挑战在多跳问答中尤为突出,因为该任务需要通过顺序且相互依赖的推理步骤链接多个证据,以推导出最终答案 [Tang and Yang (2024)](https://arxiv.org/html/2608.13588#bib.bib37)。
最近,人们提出了各种提示压缩技术,通过消除较不显著的内容或将信息凝缩成紧凑表示来减少上下文开销 [Pan et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib31);[Jiang et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib19);[Mu et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib30)。然而,有效的压缩不仅仅是减少输入长度;它根本上取决于有选择地保留查询相关信息,同时移除无关或令人分心的内容 [Cao et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib4)。
在此背景下,查询感知的压缩方法通过凝缩提示以保留与给定查询相关的内容来增强上下文相关性 [Choi et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib8);[Liskavets et al\. (2025)](https://arxiv.org/html/2608.13588#bib.bib28);[Hwang et al\. (2025)](https://arxiv.org/html/2608.13588#bib.bib16)。然而,它们主要依赖于单查询范式,该范式主要利用表层查询-文档相关性,这在多跳问答等复杂场景中限制了其有效性 [Trivedi et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib40);[Press et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib32);[Shao et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib34)。如图1所示(https://arxiv.org/html/2608.13588#S1.F1),这些任务需要跨多个文档进行顺序、相互依赖的推理,并且常常依赖于初始查询中未出现的隐含中间线索 [Schnitzler et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib33);[Geva et al\. (2021)](https://arxiv.org/html/2608.13588#bib.bib13);[Trivedi et al\. (2022)](https://arxiv.org/html/2608.13588#bib.bib39);[Ho et al\. (2020b)](https://arxiv.org/html/2608.13588#bib.bib15)。当查询包含多个子组件,且其支持证据分散在不同文档中时,这些局限性变得更加明显 [Levy et al\. (2025)](https://arxiv.org/html/2608.13588#bib.bib23)。因此,单查询方法通常无法捕捉文档间依赖关系,也无法对链接信息进行有效推理,从而导致信息丢失和不完整的上下文理解,不足以综合多源答案。
为此,我们提出IterCOMP,一个基于迭代优化的统一提示压缩框架,它明确地将多跳推理融入压缩循环中。IterCOMP将LLMs的推理能力战略性地整合到压缩过程中,以直接解决复杂查询的细微证据需求。具体而言,该框架过滤相关的证据段,并使用LLM评估它们是否足以回答问题。当证据不足时,LLM识别信息缺口并制定一个针对性的后续问题来弥合缺口。这启动了一个循环,其中新证据根据不断发展的推理路径进行评估,仅保留关键段,丢弃无关内容。通过逐步积累和提炼,IterCOMP增量地构建一个简洁而全面的提示,使得原始多跳问题能够使用集中的、关键的信息来回答。大量实验证明,IterCOMP显著提升了问答性能和效率,凸显了将深度推理整合到提示压缩中的有效性。
## 2 相关工作
### 2.1 提示压缩
#### 2.1.1 软提示压缩
软提示压缩将原始提示编码为连续向量表示 [Ge et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib12);[Cheng et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib6)。AutoCompressor [Chevalier et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib7) 将长提示分成多个部分,将每个部分压缩成软提示表示,然后将它们连接起来形成最终提示。GIST [Mu et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib30) 为指令输入生成前缀风格的软提示。这些方法能够对预训练模型进行参数高效的适配,同时保留原始输入的高层语义。然而,软提示通常针对特定LLMs进行优化,这限制了它们在不同模型间的可迁移性 [Li et al\. (2025b)](https://arxiv.org/html/2608.13588#bib.bib27)。这一限制在基于API的环境中构成了重大挑战,因为该环境中对模型内部的直接访问受限。因此,底层LLM的任何更新都需要重新训练软提示,降低了其在动态或跨模型部署场景中的实用性。
#### 2.1.2 硬提示压缩
硬提示压缩通过提取式或生成式方法保留关键信息来减少提示长度 [Li et al\. (2025b)](https://arxiv.org/html/2608.13588#bib.bib27);[Chuang et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib9);[Jung and Kim (2024)](https://arxiv.org/html/2608.13588#bib.bib21)。这种方法通过消除冗余或无信息内容,提高了计算效率并提升了生成输出的质量。
查询无关压缩。查询无关方法独立于查询操作,利用提示的统计或结构特性。Selective-Context [Li et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib26) 基于自信息度量丢弃低信息量的词元。LLMLingua [Jiang et al\. (2023b)](https://arxiv.org/html/2608.13588#bib.bib18) 移除困惑度低的词元,而LLMLingua-2 [Pan et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib31) 将压缩表述为一个使用知识蒸馏的词元分类任务。尽管具有广泛的适用性,但这些方法忽略了查询特定的上下文。因此,压缩后的提示可能保留无关内容或遗漏关键信息,从而降低检索有效性和响应相关性 [Cao et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib4)。
查询感知压缩。将查询信息纳入压缩过程对于保留推理相关和关键内容至关重要。LongLLMLingua [Jiang et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib19) 采用由粗到细的策略,首先通过查询条件困惑度估计文档级重要性,然后细化词元选择。COMPACT [Yoon et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib48) 通过联合分析先前选定的内容和新引入的片段来压缩上下文。RECOMP [Xu et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib45) 通过测量查询与句子嵌入之间的相似性来执行句子级压缩,以识别关键内容。R2C [Choi et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib8) 将查询与每个上下文块一起编码,使解码器能够动态保留相关信息。
尽管具有优势,现有的查询感知方法通常通过将单个查询与单独的文档或句子进行匹配来评估相关性。这种一对一范式对于复杂的多跳问答来说是不够的,因为在后者中,查询通常包含多个子组件,必须使用分散在不同文档中的证据联合解决 [Tang and Yang (2024)](https://arxiv.org/html/2608.13588#bib.bib37)。此类任务需要捕捉文档间依赖关系并对链接的信息片段进行推理 [Trivedi et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib40)。然而,当前方法难以建模这些多跳关系,从而限制了它们在综合多源信息方面的有效性 [Zhu et al\. (2025)](https://arxiv.org/html/2608.13588#bib.bib50)。
### 2.2 LLMs中的自问机制
最近的研究强调了LLMs生成和回答后续问题的潜力,从而增强了各种任务的表现。后续提问提高了文档生成的连贯性和信息量 [Tix (2024)](https://arxiv.org/html/2608.13588#bib.bib38),并通过支持更深入的探索提高了对话搜索中的用户满意度 [Kim et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib22)。一个突出的方法是自问方法,即LLMs生成并回答子问题以分解复杂查询,从而在组合推理上取得显著收益 [Press et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib32)。这项工作已扩展到交错推理、检索和自我反思,允许LLMs在解决问题过程中动态控制查询 [Jiang et al\. (2023c)](https://arxiv.org/html/2608.13588#bib.bib20);[Yao et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib47);[Asai et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib2)。特定领域的适应表明,迭代RAG可以有效解决复杂的临床场景 [Xiong et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib44)。在更广泛的背景下,其他工作探索了在信息搜索中预测后续问题 [Wilcock (2024)](https://arxiv.org/html/2608.13588#bib.bib43)、通过针对性提问优化输出 [Shridhar et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib36),以及通过搜索引擎增强LLMs以提高事实性 [Vu et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib41)。
## 3 初步分析
我们提出的方法基于两个关键假设:(1)LLMs能够可靠地判断给定一组证据时一个问题是否可回答;(2)如果问题不可回答,LLMs能够识别推导出正确答案所需的附加信息。为了通过实证验证这些假设,我们进行了两项初步分析,以下研究问题作为指导:RQ1:LLMs能否确定提供的证据是否足以回答给定问题?RQ2:如果证据不足,LLMs能否识别推导出正确答案所需缺失的信息?
### 3.1 设置
为解决这些问题,我们使用MuSiQue数据集 [Trivedi et al\. (2022)](https://arxiv.org/html/2608.13588#bib.bib39),该数据集包含需要两到四个推理步骤的多跳问答对。对于每个跳数长度,我们随机抽取400个问答对。按照先前的工作 [Wang et al\. (2025)](https://arxiv.org/html/2608.13588#bib.bib42),我们使用GPT-4o基于数据集中提供的分解注释生成子问题和子答案对。表7(https://arxiv.org/html/2608.13588#A1.T7)展示了提示和生成数据的示例。
使用原始问题以及生成的子问答对,我们对几种LLMs进行了实验,包括LLaMA-3.1-8B-Instruct [Dubey et al\. (2024)](https://arxiv.org/html/2608.13588#bib.bib10)、Mistral-7B-Instruct [Jiang et al\. (2023a)](https://arxiv.org/html/2608.13588#bib.bib17)、GPT-3.5-Turbo [Brown et al\. (2020)](https://arxiv.org/html/2608.13588#bib.bib3) 和GPT-4o [Achiam et al\. (2023)](https://arxiv.org/html/2608.13588#bib.bib1)。每个模型在两个任务上进行评估:(1)确定仅凭提供的证据是否足以回答原始问题;(2)当证据被认为不足时,识别所需的附加信息。
#### 3.1.1 可回答性判断
为评估可回答性判断,我们根据提供证据的完整性定义了两个实验条件:
- • 完整:证据包含子相似文章
AGORA: 基于适配器的观测-动作保留——用于LLM代理的无推理提示压缩
AGORA 引入了一种用于LLM代理的无推理步骤级提示压缩器,避免了令牌级压缩器的'动作语法破坏'失效模式。它通过结构解析器、始终保留底限以及学习的相关性评分器,在9个环境中的8个(跨骨干网络)保留了≥75%的未压缩性能。
相关但不完整:指称悬空作为硬提示压缩中的范式级失败模式
本文识别了硬提示压缩中的一种结构性失败,称为“指称悬空”,即独立评分会拆散相互依赖的证据对,移除了解释保留答案所需的上下文。实验表明,这种现象影响多种压缩器和数据集,而自动恢复缺失的指称可提高问答准确率。
Hi-Q: 用于多跳问答的层次证据引导查询精炼
Hi-Q 是一个证据条件框架,基于语料库支持信号动态将多跳查询精炼为层次树,从而提高多跳问答的检索和答案准确性。
对比反思用于迭代提示优化
提出了一种对比反思(Contrastive Reflection)迭代提示优化框架,用于智能体信息检索工作流。该框架利用结构化轨迹识别错误锚定的行为切片,并通过教师LLM进行对比修复,在HotpotQA上实现了显著改进。
RECAP:面向提示持续适应性的回归评估基准
介绍了RECAP,一个用于在主动适应场景下评估提示持续学习能力的基准。结果表明,现有提示优化方法在该场景下表现不佳,亟需新方法。