EverydayGPT:面向高效安全混合GPT-RAG对话问答的置信门控路由
摘要
EverydayGPT 引入置信门控路由(CGR)机制,该机制针对每个查询决定使用RAG、直接GPT生成还是拒绝,在85%的查询上实现120倍延迟降低,同时保持答案质量,这在500问题基准测试中得到验证。
arXiv:2606.11212v1 Announce Type: new
摘要:标准检索增强生成(RAG)管道无条件地将每个查询路由到检索和生成,导致不必要的计算并将低质量上下文传播给生成器。我们提出EverydayGPT,一个围绕置信门控路由(CGR)机制构建的轻量级对话问答系统,该机制将路由决策形式化为关于检索距离和提取充分性的联合策略。其主干是一个从零开始在10B令牌的FineWeb-Edu上训练的205M参数GPT模型。CGR通过快速RAG提取(约45毫秒)解决85%的查询,避免调用昂贵的GPT路径(约5.9秒),从而在大多数查询上实现超过120倍的延迟降低,同时保持答案质量。在500问题的领域内基准测试中,系统实现了F1=0.226±0.004,而仅用GPT为0.171,无条件RAG为0.210。与强基线的提升虽然不大但一致,而效率提升显著(平均延迟降低6.3倍)。一项结构化事实依据审计发现样本集中没有无依据的主张,并明确说明了范围限制。我们将这项工作定位为资源约束下路由策略的研究,而非对最先进性能的宣称。
查看缓存全文
缓存时间: 2026/06/11 13:35
# 1. 引言
来源:https://arxiv.org/html/2606.11212
###### 摘要
标准的检索增强生成(RAG)管道无条件地对每个查询执行检索和生成,导致不必要的计算,并将低质量的上下文传递给生成器。我们引入了 EverydayGPT,一个轻量级的对话式问答系统,其核心是置信门控路由(cgr)机制,该机制将路由决策形式化为一个关于检索距离和提取充分性的联合策略:π: Q×D → {rag, gpt, refuse}。这与在完整前向传播*之后*才进行延迟的输出级弃权方法,以及仅考虑距离而忽略答案响应性的 RAG 过滤方法有严格区别。模型主干是一个从头开始在 100 亿个 FineWeb-Edu 令牌上训练的 2.05 亿参数 GPT(预训练损失从 4.21 降至 2.84),避免了对专有权重的依赖。本工作的主要贡献在于路由架构本身:cgr 通过快速 RAG 提取(约 45 毫秒)解决了 85% 的查询,避免调用昂贵的 GPT 路径(约 5.9 秒),在保持答案质量的同时,在该多数查询上实现了超过 **120 倍** 的延迟降低。在一个 500 个问题的领域内基准测试中,cgr 达到了 F1=0.226±0.004,而纯 GPT 为 F1=0.171,无条件的密集 RAG 为 F1=0.198。与纯 GPT 相比,增益大且显著(+0.055,p<0.001,Wilcoxon 符号秩检验)。与最强的可比基线 LangChain 无条件 RAG(F1=0.210)相比,增益适中但一致(+0.016)。对 300 个领域内样本进行的结构化基础审计发现,在五类标注协议(κ=0.81)下,没有包含检索上下文中不支持的声明的响应;本文明确讨论了此结果的范围限制。整个系统在消费级 CPU 上运行时,平均延迟低于 6 秒,内存占用低于 2 GB。所有代码和评估脚本均已公开发布。我们将此工作定位为资源约束下路由策略的研究,而非对最先进性能的宣称。
检索增强生成(RAG)[9 (https://arxiv.org/html/2606.11212#bib.bib9)] 已成为将生成式语言模型锚定于外部知识的主导范式,与纯参数化生成相比,显著减少了幻觉 [7 (https://arxiv.org/html/2606.11212#bib.bib7),15 (https://arxiv.org/html/2606.11212#bib.bib15)]。尽管取得了成功,标准的 RAG 部署存在一个关键的架构假设:对于每个查询,无论检索到的上下文是否包含信息,或者提取的答案是否充分,都*无条件地*应用检索和生成。这个假设有两个实际后果:
- • **计算浪费**。对于简单提取步骤就能正确回答的查询,调用生成模型成本高昂,尤其是在 CPU 推理约束下。
- • **质量下降**。在没有质量门控的情况下,将低质量的检索上下文传递给生成器,可能会产生比拒绝或不同路由更差的输出。
我们通过引入置信门控路由(cgr)来解决这两个问题,这是一种路由策略,在推理时——在投入昂贵的生成之前——基于检索和提取的联合质量做出明确决策。我们的系统 EverydayGPT 在一个自定义训练的 2.05 亿参数 GPT 和一个基于 FAISS 的密集检索索引上实现了 cgr。
#### 核心主张。
本工作的主要贡献*并非*在强大的大模型基线上获得巨大的准确率提升——我们不声称超越参数数量高出数个数量级的系统。相反,贡献在于一个**效率-安全架构**:一种正式定义的路由策略,在避免对 85% 的查询进行 GPT 推理成本(在这些查询上实现 **120 倍** 延迟降低)的同时,达到与无条件 RAG 相当或更好的答案质量,为领域外输入提供明确的**安全拒绝**路径,并且完全在消费级 CPU 硬件上运行。我们相信,这对于 NLP 社区尚未完全解决的资源受限部署场景来说,是一项具有实际用途的贡献。
#### 贡献。
- C1 一个正式定义的三路由策略 π: Q×D → {rag, gpt, refuse},条件基于*联合*检索距离和提取置信度,区别于输出级弃权和仅距离过滤。
- C2 一个从头开始端到端训练的 2.05 亿参数 GPT,无需预训练权重,预训练损失曲线确认了稳定收敛。基础模型在 WikiText-103 和 PTB 上与 GPT-2 Small 进行了对比评估。
- C3 对八个基线进行的实证评估,包括自举置信区间、Wilcoxon 显著性检验、阈值敏感性分析、结构化基础审计以及在 Natural Questions 和 TriviaQA 上的域外评估。
- C4 一个完全部署的、可在 CPU 上运行的系统(低于 2 GB,延迟低于 6 秒),所有代码和评估基础设施均已公开发布。
## 2. 相关工作
#### 检索增强生成。
RAG [9 (https://arxiv.org/html/2606.11212#bib.bib9)] 在知识密集型任务上显著减少了幻觉 [15 (https://arxiv.org/html/2606.11212#bib.bib15)]。密集段落检索 [8 (https://arxiv.org/html/2606.11212#bib.bib8)] 通过双编码器检索提高了召回率;混合稀疏-密集管道进一步提高了覆盖率。解码器中的融合(FiD)[6 (https://arxiv.org/html/2606.11212#bib.bib6)] 在编码器级别联合编码段落。REALM [4 (https://arxiv.org/html/2606.11212#bib.bib4)] 联合训练检索和生成。诸如 LangChain 和 Haystack 之类的生产框架提供 RAG 管道,但无条件地应用检索。cgr 在架构上区别于所有这些方法:它将路由决策视为一个基于联合不确定性的一等操作,且*在*调用生成*之前*进行。
#### 置信度、弃权与选择性预测。
校准研究 [3 (https://arxiv.org/html/2606.11212#bib.bib3)] 促使模型表达可靠的 Uncertainty。SQuAD 2.0 [13 (https://arxiv.org/html/2606.11212#bib.bib13)] 引入了不可回答的问题,推动了输出级弃权。选择性预测 [2 (https://arxiv.org/html/2606.11212#bib.bib2)] 在模型输出置信度低时进行延迟。这些方法将弃权决策的条件建立在 P(y|x) 上——需要进行一次完整的前向传播——并且仅在输出级别操作。cgr 将这一原则*向上游*扩展:在生成之前做出路由决策,条件基于检索质量,并避免将计算投入到不可靠的生成路径。这是关键的架构区别。
#### 自回归语言模型。
Transformer 架构 [16 (https://arxiv.org/html/2606.11212#bib.bib16)] 和 GPT 系列模型 [11 (https://arxiv.org/html/2606.11212#bib.bib11),1 (https://arxiv.org/html/2606.11212#bib.bib1)] 确立了自回归范式。我们的主干模型与 GPT-2(117–345 M)处于相同的参数规模,但在 FineWeb-Edu [10 (https://arxiv.org/html/2606.11212#bib.bib10)] 上训练,这是一个精选的教育语料库,比网页抓取数据更符合我们的目标领域。我们直接在标准基准测试上与 GPT-2 Small 进行比较,以将基础模型的质量置于具体背景下。
#### 相对于大型模型的范围。
我们不与 GPT-4、Llama 2/3 或 Mistral 进行比较,因为它们需要与我们 CPU 部署约束不兼容的 GPU 推理基础设施。这是一个明确的局限性,而非疏忽。我们的系统专为无法使用大型模型的资源受限环境设计,这是一个实际重要但研究不足的场景。比较集特意与我们自身的规模和部署环境相匹配。
## 3. 系统架构
EverydayGPT 将三个模块——GPT 主干、FAISS 检索管道和 cgr——集成到一个统一的推理栈中。图 1 (https://arxiv.org/html/2606.11212#S3.F1) 展示了带有每个模块延迟注释的路由流程。
(图1 描述:EverydayGPT 推理管道。每个菱形处的 cgr 门控在*提交生成之前*做出明确的路由决策。在 85% 的查询上,RAG 路径以约 45 毫秒的速度解决查询,完全避免了约 5.9 秒的 GPT 前向传播。)
## 4. GPT 模型
### 4.1 架构
主干是一个标准的因果 GPT,具有 Pre-LN 层归一化 [17 (https://arxiv.org/html/2606.11212#bib.bib17)]、GELU 激活函数和 4× FFN 扩展。配置见表 1 (https://arxiv.org/html/2606.11212#S4.T1)。
表 1:GPT 模型配置。
### 4.2 训练
该模型在 FineWeb-Edu [10 (https://arxiv.org/html/2606.11212#bib.bib10)] 上使用 AdamW(学习率=10⁻⁴,余弦衰减,500 步预热)进行预训练,批量大小为 32,梯度累积(×4),在 NVIDIA Tesla P4 GPU(8 GB 显存)上跨越 Kaggle 会话训练 48-72 小时。在指令微调期间,选择性的损失掩码仅计算响应令牌上的梯度,防止模板记忆。
#### 损失收敛。
图 2 (https://arxiv.org/html/2606.11212#S4.F2) 显示预训练损失在 100 亿个令牌内从 4.21 下降到 2.84,没有出现发散,确认了尽管采用基于会话的检查点,训练依然稳定。
(图2 描述:预训练损失从 4.21 收敛到 2.84,覆盖 100 亿个令牌,确认了在消费级 GPU 硬件上训练的稳定性。)
#### 基础模型质量。
表 2 (https://arxiv.org/html/2606.11212#S4.T2) 将困惑度与 GPT-2 Small(117 M)进行了比较。我们的模型在两个基准测试上都取得了更低的困惑度,这与其更大的规模和领域特化的预训练语料库一致。
表 2:与 GPT-2 Small 的困惑度对比。数值越低越好。
### 4.3 推理
生成使用 top-k 采样(k=50,τ=0.4)和一个滑动窗口三元组重复检测器 [5 (https://arxiv.org/html/2606.11212#bib.bib5)]。
## 5. 检索管道
文档使用 all-MiniLM-L6-v2 [14 (https://arxiv.org/html/2606.11212#bib.bib14)] 离线编码为 384 维嵌入,并在 FAISS IndexFlatL2(O(Nd) 检索)中建立索引。推理时,检索前 k=10 个邻居(约 12 毫秒),根据距离和令牌数量过滤,通过 120 字符前缀指纹去重,并截断为 800 个令牌。一个规则引导的句子排序器对问题类型进行分类(事实型、定义型、时间型、因果型、是非型),并根据关键词重叠和类型特定信号对候选句子评分,运行时间为 O(S·|q|)。
## 6. 置信门控路由
### 6.1 正式路由策略
###### 定义 1(路由策略)。
令 Q 为查询空间,D 为检索到的文档空间。cgr 策略为:
π: Q × D → {rag, gpt, refuse}
参数化参数为检索距离 d_min = min_i d_i 和提取置信度 c ∈ [0, 1]。
###### 定义 2(决策规则)。
给定距离上限 δ 和置信度下限 τ:
π(q, D) =
case d_min > δ: refuse
case d_min ≤ δ ∧ c ≥ τ: rag
case d_min ≤ 1.0 ∧ c < τ: gpt
otherwise: refuse
#### cgr 的创新之处。
我们将路由形式化为一个*关于检索和答案充分性的联合决策*,而不是像所有先前的 RAG 系统那样独立处理检索和生成。输出级弃权 [13 (https://arxiv.org/html/2606.11212#bib.bib13),2 (https://arxiv.org/html/2606.11212#bib.bib2)] 的条件基于完整前向传播后的 P(y|x)。仅距离的 RAG 过滤 [9 (https://arxiv.org/html/2606.11212#bib.bib9)] 单独使用 d_min,忽略了提取的答案是否响应查询。据我们所知,cgr 是最早将路由决策的条件建立在*联合信号* (d_min, c) 上的方法之一,这使得在生成之前实现早期终止,并且能够更细粒度地区分领域外查询(d_min 高)、充分提取(c 高)和提取不充分(c 低,回退到 GPT)的情况。实际效果是,仅在真正需要时才承担生成成本。
### 6.2 置信度分数
c = min(1.0, (|w|/25)·0.3 + ovlp(q,a)·0.4 + η·0.3) (1)
其中 |w| 是答案词数,ovlp(q,a) 是关键词重叠度,η ∈ {0.3, 1.0, 1.5} 是类型正确性奖励。特征权重通过在保持的 50 个问题开发集上对 τ ∈ {0.1, 0.3, 0.5, 0.7, 0.9} 进行网格搜索选定。
我们承认公式 1 (https://arxiv.org/html/2606.11212#S6.E1) 是一个加权启发式方法,而非概率校准的分数 [3 (https://arxiv.org/html/2606.11212#bib.bib3)]。这是在路由决策必须运行在远低于 1 毫秒(RAG 路径的延迟预算)的约束下的有意设计选择。学习型置信度估计器会更合理,并被确定为未来工作最重要的方向。
### 6.3 效率分析
路由带来的效率提升是 cgr 的核心实际优势。对于一个包含 Q 个查询的批次:
Cost_cgr = Q·T_RAG + αQ·T_GPT (2)
其中 T_RAG ≈ 45 毫秒,T_GPT ≈ 5900 毫秒,α = 0.15 是路由到 GPT 的查询比例。这给出:
Cost_cgr ≈ Q·(45 + 0.15×5900) = Q·930 毫秒
相比之下,无条件生成的成本为 Q·5900 毫秒,实现了 **6.3 倍** 的平均延迟降低,同时在需要时保持 GPT 生成的质量上限。
### 6.4 路由算法
算法 1 置信门控路由 (cgr)
输入:查询 q, 阈值 τ, 上限 δ=1.5
1: D ← FaissSearch(q, k=10) {O(Nd), ~12 毫秒}
2: 如果 min_i d_i > δ 则
3: 返回 Refuse {领域外}
4: 结束条件
5: ctx ← Assemble(D)
6: a ← Extract(q, ctx) {O(S|q|), ~20 毫秒}
7: c ← Confidence(a, q) {公式 1}
8: 如果 a ≠ ∅ 且 c ≥ τ 则
9: 返回 a {RAG 路径,总计 ~45 毫秒}
10: 否则如果 min_i d_i ≤ 1.0 则
11: 返回 GPTGenerate(q) {GPT 路径,~5.9 秒}
12: 否则
13: 返回 Refuse {不安全/低置信度}
14: 结束条件相似文章
面向Agentic RAG管道的贝叶斯不确定性传播:关于多跳问答的概念验证研究
本文提出了一种面向Agentic RAG系统的贝叶斯不确定性传播框架,并在使用GPT模型的多跳问答基准上进行了评估,显示出在工业决策支持中监控可靠性的潜力。
答案存在性驱动RAG重写增益
本文研究在RAG问答流程中,重写检索段落所带来的性能提升是否因果性地由重写上下文中出现黄金答案字符串所驱动,并通过跨多个模型和数据集的受控干预审计进行验证。
HyCE-RAG: 基于超图证据链的检索增强生成用于可解释的多跳问答
HyCE-RAG 是一种新颖的基于超图的检索增强生成框架,专为多跳问答设计,通过置信度感知的启发式搜索构建显式证据链,在准确性、相关性和忠实度方面优于标准 RAG 和基于图的 RAG 方法。
模型路由可能成为隐形的AI安全策略
OpenAI的GPT-5.6引入了模型路由功能,当良性工作被阻止时,会将用户重定向到能力较低的模型,这引发了透明度问题:用户是否应该知道哪个模型产生了他们的答案。
ChatGPT 介绍
OpenAI 推出 ChatGPT,这是一个基于 GPT-3.5 的对话型 AI 模型,通过人类反馈强化学习(RLHF)进行微调。该模型旨在回答后续问题、承认错误和拒绝不当请求,在研究预览期间提供免费访问。