超越置信度:基于检索基础的多轮搜索代理测试时扩展

arXiv cs.AI 论文

摘要

本文介绍了检索基础投票(RGV),通过使用与检索文档的词汇重叠来解决多轮搜索代理中基于置信度投票的局限性,实现了高达5.4%的准确率提升。

arXiv:2608.24024v1 公告类型:新 摘要:基于置信度的投票通过使用内部信号(如令牌对数概率)为每个并行LLM生成加权聚合,已在单轮推理中得到积极研究。然而,现代LLM越来越多地作为多轮搜索代理,检索并依赖外部文档。在本文中,我们表明基于置信度的投票在这一多轮设置中转移效果不佳,并将根本原因识别为复制膨胀:当检索的文档被附加到代理的上下文中时,从这些文档复制的令牌会系统性地获得膨胀的对数概率。这使得每个问题的置信度得分平坦化,并削弱了所得加权投票。为了解决这个问题,我们提出了检索基础投票(RGV),它通过每个生成的最终答案与其检索的文档之间的词汇重叠来评分。通过在被污染的上下文之外计算信号,RGV避开了令牌对数概率和额外的LLM调用。在四个搜索代理基准和五个LLM上,RGV始终优于基于置信度的投票,准确率提升高达+5.4%,在少数正确问题上提升+35%,这些问题中正确答案仅出现在8个生成中的1-2个。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:19

# 超越置信度:基于检索锚定实现多轮搜索智能体的测试时缩放
来源:https://arxiv.org/html/2608.24024  
Junhyuk So  
机构:浦项科技大学 (POSTECH)  
邮箱:[[email protected]](mailto:[email protected])  
Tianyu Fu  
机构:清华大学  
Haizhong Zheng  
机构:卡内基梅隆大学  
[email protected]  
[email protected]  
[email protected]  
Beidi Chen  
机构:卡内基梅隆大学  
[email protected]  
[email protected]  
[email protected]  

###### 摘要  
基于置信度的投票通过token对数概率等内部信号对并行的LLM生成过程进行加权聚合,在单轮推理中已被广泛研究。然而,现代LLM越来越多地扮演多轮搜索智能体的角色,检索并基于外部文档进行条件生成。本文表明,基于置信度的投票在这种多轮设置中效果不佳,并指出其根本失败原因是复制膨胀:当检索到的文档被附加到智能体的上下文中时,从这些文档复制的token会系统性地接收到膨胀的对数概率。这导致每个问题内的置信度分数趋平,削弱了加权投票的效果。为解决此问题,我们提出了检索锚定投票(RGV),它通过最终答案与其检索到的文档之间的词汇重叠度来对每次生成过程进行评分。通过在被污染的上下文之外计算信号,RGV同时规避了token对数概率和额外的LLM调用。在四个搜索智能体基准测试和五个LLM上,RGV持续优于基于置信度的投票,最高可提升+5.4%的准确率,并在少数正确问题(正确答案仅出现在8次生成中的1-2次)上提升+35%。详见图注  
图1:概述。  
(a) 每次生成都是ReAct风格搜索智能体的一个轨迹,循环进行工具调用(搜索、访问页面)并输出预测答案;N次并行生成可能不同。  
(b) 加权投票对每次生成的权重按预测答案求和;最大值获胜。  
(c) 基于置信度的投票按token对数概率对每次生成加权,当模型复述上下文时此概率会膨胀。RGV(本文方法)按答案文本与检索文档之间的词汇重叠度对每次生成加权——此信号是在被污染的上下文之外读取的。  

## 1 引言  
基于置信度的投票,即通过聚合token对数概率对并行生成过程进行加权,已被广泛用于单轮LLM推理的测试时缩放(Fu et al., 2025; Taubenfeld et al., 2025),并在非检索式交互智能体任务上能超越多数投票(Wang et al., 2024)。但随着LLM被部署为基于检索文档的多轮搜索智能体(Yao et al., 2023; Nakano et al., 2021; Chen et al., 2025),这种基于对数概率的信号传递效果不佳。为何置信投票在此场景下失效,以及如何在投票层解决此问题,在很大程度上尚未得到充分研究。现有工作从三个角度着手解决,但均未完全解决问题。  
*基于置信度的投票器*(Fu et al., 2025; Taubenfeld et al., 2025; Wang et al., 2024)为单轮LLM场景设计,未为搜索智能体提供诊断方案。*轨迹感知聚合器*(Lee et al., 2026; Li et al., 2025)通过每个问题额外调用一次LLM(在并行生成之上的聚合器)来规避置信信号,增加了推理成本。*基于强化学习的重新校准*(Xuan et al., 2026)通过强化学习微调调整置信度,但未充分解释搜索智能体中校准失准的根源。理想的解决方案应首先*诊断*为何置信信号在搜索智能体中退化,然后利用该诊断设计一个高效、广泛适用的投票层解决方案。为填补这一空白,我们做出两项贡献。  
*第一*,我们识别并量化了一种称为*复制膨胀*的机制:一旦检索到的文档被附加到智能体的上下文中,复制的token会接收到膨胀的对数概率,压缩了问题内的置信度分数,导致加权多数投票退化为简单多数(§3)。  
*第二*,该诊断指向了一个解决方案:从*被污染的上下文之外*读取投票信号。我们提出检索锚定投票(RGV):通过每次生成的答案文本与其检索到的文档之间的词汇重叠度来对其加权(§4)。由于检索日志源自环境,该信号独立于模型的隐状态,无需对数概率、无需微调、也无需额外的LLM调用。我们公开发布代码¹和数据²:完整的生成轨迹、每token的对数概率以及判断输出。  
在四个搜索智能体基准测试和五个LLM上,RGV在准确率上击败了基于对数概率的置信投票(DeepConf; Fu et al., 2025),最高提升达+5.4%,并在少数正确问题上提升+35%。仅用四次生成的RGV在准确率上已匹配八次生成的DeepConf,在相同准确率下将生成预算减半。其增益对重叠度量的选择具有鲁棒性,且额外的CPU开销可忽略不计。  

## 2 背景  
#### 多轮搜索智能体。我们研究ReAct风格智能体(Yao et al., 2023; Schick et al., 2023),其工具检索文本文档,最终答案源自检索到的内容。我们称这些为*多轮搜索智能体*,或简称*搜索智能体*。此类智能体在T轮的预算内交错进行推理和工具调用。上下文c₀=q,在第k轮,策略π_θ采样(uₖ, xₖ) ~ π_θ(·|cₖ₋₁),其中uₖ是模型在第k轮的思考跨度,xₖ是工具调用(例如使用`search`查询搜索引擎,或`visit`获取网页)或最终答案。工具调用时,环境返回观察oₖ,上下文增长为cₖ = cₖ₋₁ || uₖ || xₖ || oₖ。因此,检索到的片段被附加到模型后续轮次所依赖的相同上下文中。  
#### 生成过程。一次*生成*tᵢ是该循环的一条轨迹,以最终答案或预算耗尽终止。我们从问题q并行采样N次生成{t₁, ..., t_N}。生成的记录包含每次工具调用及其响应、模型发出的每个思考跨度,以及一个最终的*答案轮*,其输出是最后一个思考跨度,后跟预测的答案字符串。此记录中的三个名称将在下文重复出现:预测的答案âᵢ、*答案文本*Pᵢ(模型在答案轮产生的最终答案,不包括其内部思维链)、以及检索日志Dᵢ = {d₁, ..., dₘᵢ}(智能体获取的文档)。  
#### 加权多数投票。N次生成可能给出不同的答案,因此投票规则返回一个单一的最终答案。每次生成通过一个非负权重wᵢ评分,所选答案是具有最大总权重的生成所对应的答案:  
V(a) = Σ_{i=1}^{N} wᵢ · 𝟙(âᵢ = a), â = arg max_a V(a)  
不同的wᵢ选择对应不同的方法。*简单多数* (wᵢ ≡ 1) 仅统计每个答案的生成次数。*DeepConf*(Fu et al., 2025),我们的置信度基线,将模型在生成过程中产生的每token置信度 Cₜ = -1/k Σ_{j=1}^{k} log pⱼ(top-k平均对数概率的负值;越高表示分布越集中)通过滑动窗口聚合缩减为单一的wᵢ。我们使用*最低组*缩减(滑动窗口最小值)在窗口大小W=1024时作为主要方法;完整的缩减方式和窗口大小扫描见附录F。我们的方法(§4)用答案文本Pᵢ与检索文档Dᵢ之间的直接锚定检查替换wᵢ。  

## 3 动机  
当唯一输入是问题时,DeepConf(Fu et al., 2025),一种基于对数概率的置信投票器(§2)是合理的:尖峰的next-token后验概率与正确性相关(Kadavath et al., 2022; Tian et al., 2023)。然而,在搜索智能体中,这种相关性因DeepConf读取的token被附加到上下文的检索文档系统性地膨胀而失效。我们通过Tongyi-DeepResearch在BrowseComp-Plus生成过程上的三个观察记录了这一点(图...),并在生成层面追溯了其后果(图...)。  
#### 上下文中的工具输出膨胀对数概率。搜索智能体将每个检索到的片段和访问的页面附加到其上下文窗口;当它后续生成文本时,任何从这些附加文档复制的token都具有非常高的p(tₖ | context),因为文档就在那里。token的对数概率说明*复制步骤*是良好校准的;它并不说明*复制的token*是正确答案。基于置信度的投票无法区分一个复制了正确实体的生成和一个复制了无关实体的生成。  
*(i) 复制token携带膨胀的置信度*(图...)。回顾(§2),DeepConf读取模型在生成过程中产生的token。对于每个这样的token,我们检查其表面形式是否为该生成过程中智能体获取的任何检索文档的子字符串;复制token的平均对数概率比非复制token高+0.50 nats(从子集中重新收集了每token对数概率的生成过程中的730k token)。因此,DeepConf读取的信号被附加的工具输出污染,无论这些工具返回了什么。该差距对复制token定义的选择具有鲁棒性(附录G)。  
*(ii) 在生成层面,复制膨胀使DeepConf分数在问题内趋平*(图...)。我们测量DeepConf的*问题内份额*占总分数方差的比例,即分数的多大程度来自*同一问题的不同生成*之间的差异,而非不同问题之间。加权多数投票需要这种问题内分布来偏好某次生成而非另一次;如果它消失,投票退化为简单的多数制。随着复制比例增加,DeepConf的问题内份额从0.39缩小至0.20:同一问题的生成获得几乎相同的DeepConf分数,权重决胜条件消失,而这恰好发生在复制密集型问题上,此时生成分歧最大。  
*(iii) 这并非边缘情况;复制率非常高*。在我们的生成过程中,中位数从其检索的文档中复制了93%的内容token,81%至少复制了90%,85%的问题平均复制分数≥0.90(图,x轴)。因此,上述两种失败模式适用于几乎整个基准测试,而非少数情况。虽然复制膨胀原则上在工具输出进入智能体上下文时都可能发生;但多轮搜索智能体是主要场景。两项干预措施证实了因果关系而非仅仅是相关性:掩盖复制token恢复了DeepConf的问题内分布,但未恢复其区分能力;从上下文中移除文档使复制token的对数概率下降幅度约为非复制token的两倍(附录I)。  
#### 后果:加权投票不再追踪正确性。图...具体化了生成层面的后果。*(a)* 按预言难度(其N次生成中结果正确的比例)对问题分层,DeepConf的平均每问题分数在*所有*生成都错误的问题上仍保持其峰值的87%:DeepConf无法区分不可能的问题和可解决的问题,因此聚类加权投票在投票层继承了这种校准失准;该模式在我们测试的每个基准和模型上都得到复现(附录D)。*(b)* 同样的模式在生成层面成立:DeepConf对正确与错误生成的分数分布高度重叠(重叠=54.2%),因为复制膨胀将错误生成提升至与正确生成相同的高置信度区域,使置信权重失去区分能力。  
#### 原理。失败模式的共同原因是投票信号在*被污染的上下文内部*计算,而非外部。因此,稳健的投票需要一个测量目标独立于模型隐状态的信号;某种源自模型外部的东西。下一节将这一原理转化为方法。  

## 4 从原理到方法:检索锚定投票  
为解决§3中识别的复制膨胀问题,我们提出从*被污染的上下文之外*读取投票信号,具体而言,从检索日志中读取。关键直觉与摘要和RAG中的忠实度评估(Maynez et al., 2020; Min et al., 2023; Es et al., 2024)共享,即当生成过程的最终答案在词汇上锚定于其检索到的文档时,该生成更可信。  
#### RGV分数。对于给定问题上的每次生成i,我们有其答案文本Pᵢ(定义于§2:答案轮的输出文本)和*集合*Dᵢ = {d₁, ..., dₘᵢ}(智能体在该次生成过程中检索到的文档,每次`search`或`visit`调用对应一个dⱼ)。我们使用固定的分词/规范化规则(附录A)将文本片段X映射为token集合𝒯(X)。生成过程的RGV权重是最大的*文本召回率*,即锚定在某个检索文档中的答案文本token的比例:  
wᵢ^{RGV} = max_{d ∈ Dᵢ} |𝒯(Pᵢ) ∩ 𝒯(d)| / |𝒯(Pᵢ)|  
这是忠实度文献中的标准锚定原语(§7),通过两个设计选择实例化:max-over-docs和answer-side normalization,我们接下来说明其动机。附录E表明这些选择仅在t

相似文章

密集检索的检索锚定潜在推理

arXiv cs.AI

提出检索锚定潜在推理(RGLR),一种面向密集检索的潜在推理框架,它显式地将中间潜在转移与检索改进联系起来,在推理密集型任务上优于基线方法。

多轮推理中信息分片段到达时的处理:可扩展分片与记忆增强强化学习

arXiv cs.CL

本文针对大语言模型在多轮对话中因信息分散而表现不佳的“迷失在对话”问题,提出了一种可扩展的分片流水线,将单轮问答数据集转化为多轮训练数据,并利用基于可验证奖励的强化学习训练一个维持紧凑滚动记忆的记忆增强策略,从而提高了多轮推理准确性,并零样本泛化到更困难的任务。