CAS:基于自适应检索与策略加权的保形智能搜索
摘要
本文介绍了保形智能搜索(CAS),这是一个利用保形预测来增强搜索代理可靠性的框架,通过在强化学习过程中自适应检索文档和加权策略,从而提高准确性并减少冗余工具调用。
arXiv:2608.20771v1 公告类型:新
摘要:搜索代理在强化学习(RL)微调期间面临严重的可靠性危机。启发式Top-K检索常常导致关键证据丢失或噪声引入,而渐进式RL引起的过度自信会导致幻觉答案和冗余搜索。
为构建高度可靠的代理,我们引入保形预测(CP)并提出保形智能搜索(CAS)。该框架在检索和训练两侧都建立了可靠性保证:在检索侧,自适应预测集(APS),一种特定的CP实现,将统计覆盖度转化为动态文档截断,以构建大小自适应的预测集;在训练侧,自适应保形推断(ACI),一种动态CP算法,动态构建具有可控覆盖度的预测集以量化答案置信度,然后在组相对策略优化(GRPO)目标中用于惩罚低置信度轨迹,确保模型仅从可靠数据中学习。
在单跳和多跳问答数据集上的实验表明,我们的框架显著提高了推理准确性,同时大幅减少了冗余工具调用,建立了一个高度可靠且高效的代理范式。我们的代码可在 https://github.com/S1llyBird/CAS 获取。
查看缓存全文
缓存时间: 2026/08/24 04:23
# 基于自适应检索与策略加权的共形智能体搜索
来源:https://arxiv.org/html/2608.20771
苏佳源 affiliation:浙江大学CAD&CG国家重点实验室
张剑 affiliation:浙江大学‑伊利诺伊大学厄巴纳香槟分校联合学院 affiliation:腾讯
\{zixizhu, 12221038, hongweiwang\}@[email protected]@gmail.com
林宇 王鸿伟
###### 摘要
搜索智能体在强化学习微调过程中面临严峻的可靠性危机。启发式Top‑K检索常导致关键证据丢失或噪声引入,而强化学习引发的过度自信会导致幻觉回答与冗余搜索。为构建高度可靠的智能体,我们引入共形预测并提出共形化智能体搜索框架。该框架在检索与训练两侧建立可靠性保证:检索侧采用自适应预测集,将统计覆盖度转化为动态文档截断,构建大小自适应的预测集;训练侧采用自适应共形推理,动态构建具有可控覆盖度的预测集以量化回答置信度,并在组相对策略优化目标中惩罚低置信度轨迹,确保模型仅从可靠样本学习。在单跳与多跳问答数据集上的实验表明,该框架显著提升推理准确性同时大幅减少冗余工具调用,建立了高度可靠高效的智能体范式。代码已发布于 https://github.com/S1llyBird/CAS。
22脚注文本:通讯作者。
参见图示
图1:CAS框架示意图。\((A)\)APS根据局部查询难度动态调整检索文档集规模。\((B)\)ACI通过惩罚低置信度轨迹(\(\mathrm{NLL} > q_{1-\alpha_t}\))调节GRPO策略损失,实现可靠策略优化。
## 1 引言
大语言模型通过整合外部知识显著提升了复杂问题解决能力[34][26]。传统检索增强生成采用静态"检索‑生成"范式[24],而近期兴起的智能体搜索提供了更动态自主的方案[17][14][51]。该范式在连续生成过程中交替进行内部推理与外部信息收集,智能体自主规划检索时机并整合新获取知识[48]。然而,通过强化学习微调这些智能体存在固有风险:检索侧启发式Top‑K截断本身不可靠,面对不同查询难度,固定K值必然导致关键事实遗漏或干扰噪声引入[27];训练侧大语言模型常在强化学习进程中表现出过度自信[23],导致模型生成幻觉响应。缺乏有效置信度约束时,搜索智能体易陷入低效冗余的工具调用循环[49]。
为应对这些风险,我们采用共形预测,这是一个具有严格理论保证的统计框架,用于量化模型不确定性。与启发式方法不同,CP提供强有限样本覆盖保证:给定用户指定误差率\(\alpha\),它能构建满足至少\(1-\alpha\)目标覆盖水平的预测集。这些特性使CP成为在自主系统中建立可靠性的理论基础。基于此,我们提出共形化智能体搜索框架,在检索与训练两侧同时应用CP以提供严格统计保证[20][37]。检索侧通过自适应预测集方法实现CP[33]。APS在保证严格边际覆盖的同时,根据模型对当前输入的"不确定性"动态调整检索项集合大小[4]。训练侧为缓解标准强化学习固有的严重校准退化与过度自信,我们采用自适应共形推理动态CP算法[11]。ACI动态构建具有可控覆盖度的预测集,在训练期间量化回答可靠性。我们通过惩罚低置信度轨迹优化GRPO过程[35],确保模型仅从高度可靠的推理路径学习。
综上,我们的核心贡献包括三点:
- •可靠理论框架:提出CAS框架,首次将CP引入搜索智能体的强化学习微调,为推理与检索可靠性提供严格统计保证
- •双侧CP约束:检索侧实现APS构建自适应规模预测集,确保包含正确证据;训练侧应用ACI优化GRPO过程,缓解低置信度输出
- •卓越准确性与效率:多跳问答数据集实验证明,该框架显著提升推理准确性与训练稳定性,同时大幅减少冗余工具调用,实现高度可靠高效的智能体范式
## 2 共形预测
CP[3]是具有严格覆盖保证的统计框架,无论底层模型或数据分布如何,都能量化不确定性。CP核心是非一致性得分函数\(s(x,y)\),衡量给定输入\(x\)时候选输出\(y\)的"异常程度"。设\((X,Y)\)为样本,其中\(X\)表示输入,\(Y\)表示输出。假设有\(n\)个校准样本\(\{(X_i,Y_i)\}_{i=1}^{n}\)和独立同分布的测试样本\((X_{test},Y_{test})\)。给定用户指定目标误差率\(\alpha \in (0,1)\),CP计算校准得分的经验分位数阈值\(\hat{q}\),对应\(\frac{\lceil(n+1)(1-\alpha)\rceil}{n}\)分位点,构建预测集:
\[
\mathcal{C}_{1-\alpha}(X_{test}) = \{ y \in \mathcal{Y} : s(X_{test},y) \leq \hat{q} \}
\]
在独立同分布假设下,该过程正式保证边际覆盖:
\[
\mathbb{P}(Y_{test} \in \mathcal{C}_{1-\alpha}(X_{test})) \geq 1-\alpha
\]
形式化证明见附录B.1。
### 2.1 自适应预测集
APS[33]作为CP框架在分类与生成任务中的具体实现,通过定义特殊非一致性得分构建预测集。给定排序预测概率\(\pi_{(1)}(x) \geq \cdots \geq \pi_{(n)}(x)\),APS将非一致性得分定义为至真实标签\(y\)的累积质量:
\[
s = \sum_{j=1}^{L(y)} \pi_{(j)}(x)
\]
其中\(L(y)\)表示\(y\)的秩。推理阶段APS识别最小索引\(k\)使累积概率超过校准阈值\(\hat{q}\):
\[
\sum_{i=1}^{k} \pi_{(i)}(x) \geq \hat{q}
\]
该机制为置信输入生成紧凑集,为模糊输入扩展集,在渐近逼近条件覆盖的同时严格保持\(1-\alpha\) CP覆盖保证。形式化证明与条件覆盖讨论见附录B.2。
### 2.2 自适应共形推理
标准CP基于独立同分布假设,ACI[11]作为动态扩展处理数据分布可能随时间变化的数据流。ACI引入时变误差参数\(\alpha_t\)替代静态目标误差率。每时间步\(t\)观察测试点\((X_t,Y_t)\),其中\(X_t\)为输入,\(Y_t\)为真实响应。算法通过经验失覆盖指标评估:
\[
\text{err}_t :=
\begin{cases}
1, & \text{若 } Y_t \notin \mathcal{C}_t(\alpha_t) \\
0, & \text{否则}
\end{cases}
\]
其中\(\mathcal{C}_t(\alpha_t) := \{ y \in \mathcal{Y} : s(X_t,y) \leq \hat{Q}_t(1-\alpha_t) \}\)为动态预测集,\(\hat{Q}_t(\cdot)\)为经验分位数函数。给定长期目标误差率\(\rho\)与步长\(\gamma>0\),ACI通过在线规则更新:
\[
\alpha_{t+1} = \alpha_t + \gamma (\rho - \text{err}_t)
\]
该递归机制形成反馈循环:失覆盖(\(\text{err}_t=1\))降低\(\alpha_t\),扩展后续预测集使其更保守;反之成功覆盖(\(\text{err}_t=0\))提高\(\alpha_t\),紧缩集合。通过持续调整\(\alpha_t\),ACI即使在数据分布变化时仍保持有效不确定性量化。动态保证的形式化证明见附录B.3。
## 3 方法论
我们提出CAS框架(图1),可靠连接大语言模型内部推理与外部检索。引入两个协同模块实现统计可靠性:APS约束动态检索不确定性,ACI惩罚策略优化中的低置信度轨迹。
### 3.1 智能体搜索概述
策略模型\(\pi_\theta(y|x)\)采用严格生成语法交替进行内部推理与外部动作。给定输入\(x\),模型在\(<reasoning>\)标签内启动推理,当达到知识边界时发出查询\(q\)(包裹于\(<query>\)标签),暂停生成并调用外部搜索引擎\(\mathcal{S}\)。关键创新在于不采用固定top‑\(k\),而是通过APS将原始检索证据\(D=\mathcal{S}(q)\)动态截断为可靠子集\(D_{APS}\)。该子集包裹于\(<result>\)标签并追加到上下文。此生成‑检索循环持续直到模型在\(<answer>\)标签内输出最终预测\(a_{pred}\)。完整提示模板见表5。
### 3.2 基于APS的检索侧
传统工具使用框架通常将固定数量top‑\(k\)结果追加到上下文,常引入冗余噪声或截断关键信息。我们通过通用CP框架(式1)严格约束外部证据不确定性。然而标准CP方法仅保证数据分布的边际覆盖,无法保证条件覆盖——难以适应特定输入难度。为启发式逼近条件覆盖,我们指定\(\alpha_{APS}\)并通过实施2.1节详述的APS构建可靠文档子集,获得校准阈值\(\hat{q}_{APS}\)。给定查询\(q\),搜索引擎\(\mathcal{S}\)返回初始候选集\(D=\{d_1,d_2,...,d_n\}\)及其原始检索分数。通过softmax归一化获得每个文档的相关性概率\(p(d_i|q)\)。遵循严谨APS推理流程,系统通过累积概率直至首次超过校准阈值\(\hat{q}_{APS}\)来识别截断索引\(k\)。通过动态调整适应\(q\)的条件概率分布,该过程获得统计保证的子集\(D_{APS}=\{d_1,...,d_k\}\)。关键是,在适应\(q\)难度的同时,提供\(1-\alpha_{APS}\)覆盖保证的统计保障。
### 3.3 奖励设计
在强化学习框架中,我们使用规则奖励\(r(x,y)=r_{acc}+r_{fmt}\)训练策略\(\pi_\theta\)。定义\(r_{acc}=\mathbb{EM}(a_{pred},a_{gold}) \in \{0,1\}\)为精确匹配指标。为强制结构完整性,\(r_{fmt}(y)\)包含两个布尔指示符:\(\mathbb{I}_{\text{valid}}\)与\(\mathbb{I}_{\text{ans}}\),分别表示严格语法正确性与成功生成边界标签。缩放因子\(\gamma=0.2\),格式奖励公式为:
\[
r_{fmt}(y) = \gamma \cdot \Big[ -r_{acc}(1-\mathbb{I}_{\text{valid}}) + (1-r_{acc})\left(\mathbb{I}_{\text{valid}} + \frac{1}{2}\mathbb{I}_{\text{ans}}(1-\mathbb{I}_{\text{valid}})\right) \Big]
\]
该公式奖励正确格式:答案正确时(\(r_{acc}=1\))对格式违规施加\(-\gamma\)惩罚以防止奖励作弊;答案错误时(\(r_{acc}=0\))提供稠密中间信号(完全有效得\(\gamma\),部分结构努力得\(\frac{1}{2}\gamma\)),引导模型使用正确格式。
### 3.4 基于ACI的训练侧
标准CP依赖严格独立同分布假设。但强化学习过程中策略\(\pi_\theta\)持续演进,二元奖励的普遍使用常导致模型过度自信。为缓解由此产生的冗余调用与幻觉输出,我们采用ACI。在框架中,每次强化学习迭代\(t\),对第\(i\)个相似文章
SAAS:面向智能体搜索中过度搜索缓解的自我感知强化学习
SAAS 提出了一种强化学习框架,通过增强智能体的自我感知能力,减少基于 LLM 的问答系统中的不必要搜索,从而平衡准确性与计算成本。
GRASP:面向代理型RAG的粒度感知搜索策略
介绍GRASP,一种强化学习框架,训练智能体在多步推理中自适应地协调语义搜索、关键词搜索和段落读取,提高了多跳基准上的检索召回率和问答性能。
CAFE:自我改进的搜索智能体需要协同进化的反馈
CAFE是一个通过共享参数将搜索智能体和评价器耦合起来的框架,以学习轨迹内的纠正反馈,从而提升搜索性能并减少在各基准测试中的幻觉现象。
COMPASS:面向安全搜索智能体的认知MCTS引导过程对齐
提出了COMPASS,一种认知MCTS引导的过程对齐框架,通过合成攻击轨迹并隔离风险动作来增强LLM驱动的搜索智能体的安全性,在更少的训练数据下实现了良好的安全-效用权衡。
学习适应:基于认知感知探索的自我改进网络智能体
提出了SCALE框架,用于自我改进的网络智能体,采用认知感知探索,包含三个对抗角色和图探索策略。同时介绍了从真实网站收集的大规模数据集SCALE-20k,显著提升了基于MLLM的网络智能体的性能。