RICE-PO:将检索交互转化为推理代理的信用信号
摘要
RICE-PO 是一个无需评判器的策略优化框架,它将检索交互转化为局部化信用信号,用于训练推理代理。在相同检索器设置下,该框架在 BRIGHT 和 BEIR 基准测试中持续优于基于提示的代理和基于组的强化学习基线。
arXiv:2605.26352v1 公告类型:新
摘要:检索正从一次匹配逐渐转向交互式推理,其中语言代理迭代地检查证据、重新表述查询并再次搜索。训练此类代理带来了信用分配挑战:诸如查询或摘要等可执行操作可直接由检索器评估,而潜在推理步骤不可直接观察,仅影响未来的可执行操作。这种不对称性使得基于结果的奖励分配不可靠,因为同样的最终奖励可能奖励给那些实际上并未促成检索成功的推理步骤。我们提出 RICE-PO,这是一种无需评判器的策略优化框架,可将检索交互转化为局部化学习信号。RICE-PO 选择高不确定性的可执行操作作为锚点,使用检索指标评估局部反事实分支,并且仅在推理到操作的影响力强且未来残差效应稳定时,才将信用传播到潜在推理步骤。在 BRIGHT 和 BEIR 上,在相同检索器设置下,RICE-PO 持续优于基于提示的代理和基于组的强化学习基线。这些结果表明,代理与环境的交互结构本身可以为训练基于推理的检索代理提供有用的监督。
查看缓存全文
缓存时间: 2026/05/27 09:03
# RICE-PO:将检索交互转化为推理代理的信用信号
来源:https://arxiv.org/html/2605.26352
李明晨¹,曾涵西¹¹⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰⁰¹¹脚注标记:1
¹马萨诸塞大学阿默斯特分校
²德克萨斯理工大学
³康涅狄格大学
###### 摘要
检索正从一次性匹配向交互式推理发展,其中语言代理迭代地检查证据、重构查询并再次搜索。训练此类代理带来了一个信用分配挑战:可执行动作(如查询或摘要)可以直接由检索器评估,而潜在推理步骤无法直接观察,仅影响未来的可执行动作。这种不对称性使得结果级奖励分配不可靠,因为相同的最终奖励可能会奖励那些并未实际促成检索成功的推理步骤。我们提出RICE-PO,一个无需批判者的策略优化框架,可将检索交互转化为局部学习信号。RICE-PO选择高不确定性的可执行动作作为锚点,使用检索指标评估局部反事实分支,并仅在推理到动作的影响强且未来残差效应稳定时,将信用传播给潜在推理步骤。在BRIGHT和BEIR上,RICE-PO在相同的检索器设置下,持续优于基于提示的代理和基于组的RL基线。这些结果表明,代理-环境交互本身的结构可以为训练基于推理的检索代理提供有用的监督。
## 1 引言
随着信息需求的规模和复杂性不断增长,检索正从一次性匹配问题日益转向交互式推理过程(Long et al., 2025 (https://arxiv.org/html/2605.26352#bib.bib55); Jin et al., 2025 (https://arxiv.org/html/2605.26352#bib.bib54); Li et al., 2025 (https://arxiv.org/html/2605.26352#bib.bib42))。推理代理不再依赖单一的查询-文档比较,而是可能需要与外部检索器进行多轮交互。在每一轮中,代理根据检索到的证据进行推理,以识别缺失的约束,然后相应地重构查询,并将精炼后的查询发送回检索器,由检索器在文档集合中执行搜索。这种交互循环在推理密集型检索中尤为重要,因为相关证据通常无法通过表面词汇重叠或浅层语义相似性与原始查询关联起来。
因此,近期方法开始将检索交互纳入推理密集型检索。例如,ThinkQE(Lei et al., 2025 (https://arxiv.org/html/2605.26352#bib.bib21))和Diver(Long et al., 2025 (https://arxiv.org/html/2605.26352#bib.bib55))使用基于提示的交互与检索工具来迭代优化搜索输入,但它们并未从交互过程本身学习。相反,它们依赖于推理时的固定提示策略和工具反馈。最近,基于RL的方法直接使用检索反馈优化查询生成(Li et al., 2026 (https://arxiv.org/html/2605.26352#bib.bib134); Jiang et al., 2025 (https://arxiv.org/html/2605.26352#bib.bib36))。虽然这些方法改进了面向检索的生成,但它们仍然留下一个关键问题未解决:当检索轨迹包含具有不同可观察性的动作且奖励信号稀疏时,应如何分配信用?
我们的关键观察是,检索交互不仅包含最终结果奖励,还包含可用于信用分配的中间信号。可执行动作,如生成的查询或摘要,可以直接提交给检索器,并使用检索指标进行评估。相比之下,潜在推理动作不能直接执行或测量;它们只有在从相同历史出发的替代推理延续导致有意义的不同的可执行摘要和检索奖励时,才应获得信用。这一观察激发了一个将交互转化为学习信号的两阶段过程。首先,代理应识别哪些中间决策值得检查,因为并非每个推理步骤都会显著改变后续的可执行摘要或其检索分数。其次,一旦可执行摘要收到检索反馈,代理应决定此反馈能否可靠地归因于前面的潜在推理片段。
基于此观点,我们提出了一个无需批判者的框架,将检索交互转化为动作级学习信号。首先,它使用三种分支诊断方法选择关键决策点:策略不确定性,用于识别高熵的可执行摘要;推理到摘要的影响,用于衡量替代推理延续是否导致不同的摘要奖励;以及未来残差稳定性,用于检查后续检索轮次是保留还是推翻局部奖励差异。其次,对于选定的点,它从相同的交互历史构建局部反事实分支,并使用检索指标评估生成的摘要,产生步骤特定的摘要奖励。第三,仅当未来残差效应稳定且推理到摘要的影响足够强时,它才将这些摘要奖励传播给潜在推理片段,从而防止当前摘要奖励被后续交互步骤主导或推翻时局部奖励被错误地向后复制。这种设计保留了基于组的策略优化的效率,同时引入了细粒度的监督,而无需学习的批判者、过程奖励模型或穷举的每步 rollout。
我们的贡献总结如下:
- •我们引入了一个关注可观察性的信用分配视角,用于基于推理的检索,表明可执行摘要可以提供直接的检索反馈,而潜在推理片段需要选择性地向后传播信用。
- •我们提出了一个无需批判者的信用分配框架,利用了检索代理的可执行-潜在动作不对称性:可执行摘要提供步骤特定的检索奖励,而潜在推理片段通过不确定性触发的反事实评估和残差稳定性门控获得信用。
- •我们在BRIGHT和BEIR检索任务上进行了实验,展示了在相同检索器设置下,相对于基于提示的代理和基于组的RL基线的持续提升,同时分析了不确定性选择、局部反馈质量、信用传播可靠性和分支成本。
## 2 相关工作
##### 面向推理密集型任务的交互式检索
推理密集型检索长期以来一直是信息检索(IR)领域的核心问题(Singhal and others, 2001 (https://arxiv.org/html/2605.26352#bib.bib44)),广泛应用于搜索、推荐(Ko et al., 2022 (https://arxiv.org/html/2605.26352#bib.bib46); Huang et al., 2026a (https://arxiv.org/html/2605.26352#bib.bib45); Wen et al., 2026 (https://arxiv.org/html/2605.26352#bib.bib43))和问答(Li and Ji, 2022 (https://arxiv.org/html/2605.26352#bib.bib48); Huang et al., 2026b (https://arxiv.org/html/2605.26352#bib.bib47))等领域。与传统的基于关键字的检索不同,这些任务通常要求系统解释隐式约束、推断缺失上下文,并将复杂信息需求转化为有效的搜索查询。
为了改善与检索器的交互,监督方法对LLM或序列到序列模型进行微调,以生成更清晰、更具体的查询(Wu et al., 2021 (https://arxiv.org/html/2605.26352#bib.bib2); Liu et al., 2021 (https://arxiv.org/html/2605.26352#bib.bib30); Mo et al., 2023 (https://arxiv.org/html/2605.26352#bib.bib29))。与此同时,基于提示的方法使用LLM生成伪文档、推理轨迹或扩展查询,无需额外训练,包括Query2Doc(Wang et al., 2023 (https://arxiv.org/html/2605.26352#bib.bib23))、ThinkQE(Lei et al., 2025 (https://arxiv.org/html/2605.26352#bib.bib21))、Diver(Long et al., 2025 (https://arxiv.org/html/2605.26352#bib.bib55))和TongSearch(Qin et al., 2025 (https://arxiv.org/html/2605.26352#bib.bib38))。尽管这些方法有效,但它们要么依赖于昂贵的重写注释,要么依赖于固定的提示策略,因此对于代理应如何从检索交互本身学习提供的指导有限。最近,基于RL的方法被引入,利用检索器的反馈优化面向检索的生成,从而超越了固定提示和监督重写对。
##### 用于交互式检索的基于RL的代理
基于RL的交互式检索具有吸引力,因为检索指标可以直接作为生成查询的奖励。在这种设置中,LLM充当生成扩展查询的策略,下游检索器通过NDCG或召回率等指标提供反馈。尽管PPO(Schulman et al., 2017 (https://arxiv.org/html/2605.26352#bib.bib53))通常用于基于RL的LLM优化,但其学习的批判者训练成本高昂。无价值的基于组的方法,如GRPO(Shao et al., 2024 (https://arxiv.org/html/2605.26352#bib.bib132)),通过从同一查询采样的多个候选扩展来估计优势,从而降低了成本。然而,现有的基于RL的方法主要优化检索交互的最终结果,在推理密集型IR中的研究有限。由于此类任务要求代理与检索器进行多步交互以揭示隐式约束和缺失证据,结果级奖励无法提供关于交互中哪些内部动作实际有用的指导。
##### 奖励塑造与过程监督
为了解决奖励稀疏性问题,最近的研究提出了针对LLM基于RL的信用分配方法(Feng et al., 2025 (https://arxiv.org/html/2605.26352#bib.bib131); He et al., 2026 (https://arxiv.org/html/2605.26352#bib.bib130); Ji et al., 2026 (https://arxiv.org/html/2605.26352#bib.bib128))。例如,GIGPO(Feng et al., 2025 (https://arxiv.org/html/2605.26352#bib.bib131))使用锚点状态对轨迹进行分组并改进优势估计。HGPO(He et al., 2026 (https://arxiv.org/html/2605.26352#bib.bib130))通过层次化地分组具有相似状态和历史上下文的动作,并自适应地加权这些组以减少方差和偏差,进一步估计逐步优势。Tree-GRPO(Ji et al., 2026 (https://arxiv.org/html/2605.26352#bib.bib128))构建树状结构的代理轨迹,从结果奖励中推导步骤级监督,在树内和树间级别估计相对优势,从而实现比基于链的RL更好的信用分配。与这些方法不同,我们的方法将检索视为潜在推理动作和可执行检索动作之间的结构化交互。它完全无需批判者,不需要辅助价值模型、外部裁判或人工标注,同时从交互本身可用的检索器反馈中推导出更细粒度的信用信号。
## 3 预备知识
##### 问题设置
我们考虑一个用于基于推理的检索的查询端推理设置,其中LLM代理与固定检索器在多个检索轮次中交互。给定一个初始用户查询 \(q_0\) 和一个初始检索文档集 \(D_0\),输入记为 \(x = (q_0, D_0)\)。在离散步骤 \(t = 1, 2, \ldots, T\) 中,代理观察原始查询 \(q_0\)、最新检索到的文档集 \(D_{t-1}\) 以及交互历史 \(h_{t-1}\)。然后它生成两个文本片段:推理片段 \(z_t \in \mathcal{V}^{n_z}\) 和摘要片段 \(s_t \in \mathcal{V}^{n_s}\),其中 \(\mathcal{V}\) 表示词表。摘要 \(s_t\) 直接用作下一检索轮次的查询,固定检索器返回新的文档集 \(D_t = \mathcal{R}(s_t)\)。
一个完整的回合由轨迹 \(\tau = \{(z_1, s_1, D_1), (z_2, s_2, D_2), \ldots, (z_T, s_T, D_T)\}\) 组成。代理的行为由LLM策略 \(\pi_\theta(z_t, s_t \mid q_0, D_{t-1}, h_{t-1})\) 控制,参数化为 \(\theta\),它定义了在给定当前检索上下文条件下生成推理和摘要片段的分布。在最终轮次之后,环境返回一个标量检索奖励 \(R(\tau) \in \mathbb{R}\),例如基于最终检索文档或最终摘要的NDCG@10。
摘要可以直接获得检索奖励,因为它被用作下一检索轮次的查询。相比之下,推理片段是内部的:它仅通过随后的摘要和后续轮次间接影响检索。因此,直接将摘要奖励分配给推理令牌可能导致信用错误分配。
## 4 方法
参考图注
图1:RICE-PO概述。代理在多个检索轮次中生成潜在推理片段和可执行摘要。RICE-PO选择高熵摘要锚点,通过反事实分支估计局部影响和残差稳定性,并仅在信号可靠时将摘要级信用传播给推理令牌。
### 4.1 推理信用模糊性问题
组相对优势估计通常比较从同一查询采样的轨迹,并在轨迹级分配优势。然而,多轮检索代理在交互中产生异质动作。可执行的检索动作,如摘要或查询,可以直接提交给检索器,并通过NDCG@10等指标进行评估。相比之下,潜在推理动作不能直接执行;它们仅通过塑造后续可执行动作和下游交互步骤来影响检索。因此,将最终轨迹奖励广播给所有推理令牌可能会引入有偏的信用,因为成功的最终检索结果可能是由后续恢复而非当前推理动作导致的。
我们不依赖步骤级标注或外部过程奖励模型,而是使用可执行的检索动作作为中间信用锚点。由于摘要可以直接被检索器评估,它们为周围的交互提供了局部检索反馈。剩下的问题是,这种局部反馈能否可靠地归因于前面的潜在推理片段。为了回答这个问题,我们估计三个源自交互的信号:策略熵、推理到摘要的影响以及残差稳定性。策略熵识别值得检查的不确定决策点;推理到摘要的影响衡量潜在推理动作是否实际塑造了邻近的可执行摘要;残差稳定性测试局部反馈在后续交互步骤后是否仍然可靠。
受此观点启发,我们提出RICE-PO,一个检索交互信用估计策略优化框架,将轨迹级优势细化为可执行检索动作和潜在推理动作的局部优势。
### 4.2 用于策略优化的检索交互信用估计
在本小节中,我们介绍RICE-PO,如图1 (https://arxiv.org/html/2605.26352#S4.F1) 所示。给定一个输入查询和初始检索...相似文章
@Ankur_Samanta_: 在多步推理强化学习后训练中关于信用分配的新工作 介绍自重置策略优化 (SRPO…
自重置策略优化 (SRPO) 通过在多步推理强化学习后训练中定位第一个错误的推理步骤并从中学习反事实延续,而无需外部监督,来解决信用分配问题。
通过反事实推理路径减少信用分配方差
提出隐式行为策略优化(IBPO),一种基于反事实比较的信用分配框架,通过将稀疏的终端奖励转化为对步骤敏感的学习信号,提升了大型语言模型在多步推理任务中的训练稳定性和性能。
CEPO:基于对比证据策略优化的RLVR自我蒸馏
CEPO通过使用来自拒绝轨迹的对比信号来区分关键推理步骤和填充令牌,从而改进了基于可验证奖励的强化学习,在多模态数学推理基准上相比GRPO获得了更高的准确率。
Contrastive Branch Policy Optimization
CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。
SocraticPO:通过交互式指导的策略优化
SocraticPO通过苏格拉底式自然语言指导和奖励衰减增强强化学习(RL)的展开过程,以提升大语言模型(LLM)的科学推理能力,在SciKnowEval基准测试中超越强基线。