OThink-SRR1:用强化学习为大模型实现搜索、精炼与推理

arXiv cs.CL 论文

摘要

OThink-SRR1 提出迭代式“搜索-精炼-推理”框架,通过 GRPO-IR 强化学习降低检索噪声与 token 开销,同时提升多跳问答准确率。

arXiv:2604.19766v1 公告类型:新增 摘要:检索增强生成(RAG)可扩展大语言模型(LLM)的知识,但现有静态检索方法在复杂多跳问题上表现不佳。近期动态检索策略虽有改进,却面临两大挑战:1)无关检索噪声易误导推理;2)处理整篇文档带来高昂的算力与延迟成本。为此,我们提出 OThink-SRR1,该框架通过强化学习训练大模型执行迭代“搜索-精炼-推理”流程。其核心精炼阶段将检索到的文档蒸馏为简洁、相关的事实,再进行推理。我们设计端到端强化学习算法 GRPO-IR,对准确证据识别给予奖励,对过度检索予以惩罚,从而训练模型既专注又高效。在四个多跳问答基准上的实验表明,本方法在减少检索步数与 token 用量的同时,准确率优于强基线,使 OThink-SRR1 成为信息检索智能体的强大基础模型。
查看原文
查看缓存全文

缓存时间: 2026/04/23 10:02

# OThink-SRR1:面向大语言模型的强化学习搜索-精炼-推理框架  
来源:https://arxiv.org/html/2604.19766  
作者:梁海健¹、牛增浩¹、吴俊杰²、张昌旺²、周王春树²、王军²,¹深圳大学、²OPPO研究院  
[email protected]  

###### 摘要  
检索增强生成(RAG)扩展了大语言模型(LLM)的知识边界,但现有静态检索方法在多跳复杂问题上表现乏力。近期动态检索策略虽有改进,却面临两大挑战:1)无关噪声易误导推理;2)整篇文档输入带来高昂计算与延迟成本。为此,我们提出 OThink-SRR1,一种通过强化学习训练、使大模型具备“搜索-精炼-推理”迭代能力的新框架。其核心“精炼”阶段将检索文档蒸馏为简洁事实,再进入推理。我们设计端到端强化学习算法 GRPO-IR,对准确证据给予奖励,对过度检索施加惩罚,使模型既聚焦又高效。在四个多跳问答基准上的实验表明,OThink-SRR1 以更少检索步数和 token 数取得超越强基线的准确率,成为面向信息检索智能体的强大基座模型。  

## 1 引言  
大语言模型通过大规模预训练在理解与生成任务上取得显著成果(Matarazzo & Torlone, 2025)。然而,仅靠内部知识易产生幻觉、过时事实与知识盲区。检索增强生成(RAG)通过引入外部搜索引擎或知识库,将生成结果锚定于真实证据(Lewis et al., 2020)。多数 RAG 系统采用单步“检索-推理”或固定计划的“规划-检索-推理”范式(Lee et al., 2024),无法根据中间发现动态调整,导致检索冗余、文档利用欠佳。  

近期面向推理的 LLM,如 DeepSeek-R1(Guo et al., 2025)、OpenAI-o1(OpenAI, 2024)、Qwen-QwQ(Qwen Team, 2025),显著提升了思维链规划与工具调用能力,使模型能精准分解复杂查询、依据局部证据动态调整后续搜索,并在多文档间进行有效综合与冲突消解。由此涌现出一批动态检索-推理框架,如 R1-Searcher(Song et al., 2025)、Search-R1(Jin et al., 2025)、ReSearch(Chen et al., 2025),它们将推理与搜索动作交错执行,信息收集更灵活。  

然而,现有动态方法仍面临两大难题:  
1. 未过滤的检索结果常含大量无关内容,易误导推理——超过 60% 的检索引入错误(Wu et al., 2024),且随着 prompt 变长,新增上下文效用递减(Tian et al., 2025),小模型尤甚(Fang et al., 2024b)。  
2. 把全文文档拼入 prompt 使 token 用量与计算成本激增,拖慢推理速度(Zhang et al., 2024)。  

抑制噪声与提升效率对真正有效的动态检索推理至关重要。  

为此,我们提出 OThink-SRR1,一种通过强化学习增强大模型“搜索-精炼-推理”迭代能力的新框架。具体地,模型在获得检索结果后立即精炼,提取与当前上下文最相关的关键信息,随后丢弃原文,仅基于精炼内容继续推理,为后续步骤奠定稳健基础。我们设计奖励函数:当最终答案、最近检索文档及其精炼摘要均命中真实证据时给予奖励,同时对过度检索施加惩罚,鼓励模型生成更精准的查询、提升检索效率并滤除噪声,从而实现更聚焦、更准确的推理。  

我们在 Qwen2.5-7B-Instruct 与 Qwen2.5-3B-Instruct 上训练 OThink-SRR1,并在四个标准多跳问答基准上评估。实验表明,OThink-SRR1 在答案准确率与检索效率上均优于基线,且多轮场景下生成成本更低。  

贡献总结:  
- 提出 OThink-SRR1,通过强化学习增强大模型迭代“搜索-精炼-推理”能力,打造具备信息检索功能的智能体基座模型。据我们所知,OThink-SRR1 是首个通过端到端训练内生化“精炼检索内容”能力的大模型。  
- 提出强化学习算法 GRPO-IR,对最近检索文档、精炼摘要及最终答案中的真实证据给予奖励,同时惩罚过度检索,驱使模型生成更精准查询、提升效率并聚焦精炼信息。  
- 在多跳问答基准上系统评估 OThink-SRR1,其 EM/F1 指标优于最新基线,平均检索次数与总 token 用量更少。  

## 2 相关工作  
### 2.1 检索增强生成  
RAG 自提出以来持续发展。早期工作聚焦零样本问答的端到端框架(Du & Ji, 2022)。伴随多模态需求,MuRAG 首次实现跨模态知识融合(Chen et al., 2022)。近期突破集中在动态检索(Su et al., 2024)、长尾知识增强(Li et al., 2024)及抗噪训练(Fang et al., 2024a)。其中,LongRAGE 通过双视角注意力蒸馏将长文本问答准确率提升 17%(Zhao et al., 2024),Provenance 框架创新地结合自然语言推理模型对生成结果进行事实验证(Sankararaman et al., 2024)。  

随着 RAG 框架需应对更复杂的信息需求,多跳检索成为跨越多条证据推理的关键扩展。早期研究关注知识图谱上的约束查询处理,如 Mitra et al. (2022) 的 KG 嵌入方法;GMR(Lee et al., 2022)通过文本序列生成优化资源使用;Dense-ATOMIC(Shen et al., 2023)通过构建稠密知识图谱增强多跳路径覆盖。尽管 RAG 显著扩展了 LLM 的知识边界,现有方法仍主要依赖单次静态检索,限制了其在多跳推理等复杂任务上的能力。  

### 2.2 面向大语言模型的检索推理  
近期研究探索多种策略,通过结合 RAG 增强 LLM 推理能力。RAT(Wang et al., 2024)利用相关检索信息迭代修正推理步骤以减少幻觉;ReARTeRS(Sun et al., 2025)与 AutoRAG(Yu et al., 2024)引入事实性评分、过程解释或自主多轮检索规划,进一步提升外部信息整合与推理可靠性。  

更近的工作采用强化学习(RL)帮助 LLM 在多步推理中主动学习何时、如何与搜索引擎交互。Search-R1(Jin et al., 2025)、R1-Searcher(Song et al., 2025)与 ReSearch(Chen et al., 2025)等 RL 框架让 LLM 自主生成并精炼查询、选择相关信息、在推理链中逐步决策。这些方法表明,基于结果的奖励及将检索动作融入推理过程,可显著提升复杂问答与知识密集型任务表现。然而,现有检索-推理模型仍面临检索噪声过多与推理阶段计算成本高昂的问题。  

## 3 方法  
### 3.1 动机  
现有 RAG 系统受噪声检索与效率低下困扰。无关或错误文档会干扰生成:超过 60% 的检索引入错误(Wu et al., 2024),且上下文越长相关性效用越差(Tian et al., 2025)。冗余内容还会分散 LLM 注意力、浪费计算,降低性能(Zhang et al., 2024)。为此,我们引入检索-推理模型的分步奖励机制(Chen et al., 2025;Jin et al., 2025;Song et al., 2025):每次检索后,LLM 过滤并仅保留最相关文档,缩短上下文、提升准确率并增强鲁棒性。  

![图1:OThink-SRR1 框架概览。每步模型 (1) 生成推理提示“Think”,(2) 发出检索查询“Query”,(3) 将检索内容浓缩为简洁答案“Refine”,提取与当前场景最相关的关键信息。该过程迭代执行,直至获得足够信息得出最终答案。训练由参考模型与分步奖励函数指导。](#)  

### 3.2 基于强化学习的搜索、精炼与推理  
本文提出 OThink-SRR1,一个面向多跳检索任务的“搜索-精炼-推理”多步集成框架。图1 给出框架概览。给定复杂问题 q,模型自主制定搜索策略,执行多轮查询并随之精炼信息,逐步积累必要知识直至得出最终答案。  

与其他检索-推理方法(Song et al., 2025;Chen et al., 2025;Jin et al., 2025)相比,OThink-SRR1 的两大特色:  
1. 推理过程中动态生成高质量检索查询;  
2. 专用精炼步骤系统过滤检索信息,最大化相关性,显著提升信噪比。  

OThink-SRR1 要求模型具备四项核心能力:问题分解、检索策略规划、信息过滤与证据综合。为此,我们将任务建模为序列决策问题,基于 Group Relative Policy Optimization(GRPO)的强化学习框架优化。与原始 GRPO 不同,我们针对任务特点修改奖励机制:不依赖奖励模型,而使用更易控制与度量的显式奖励函数,既减少对逐步人工标注或外部奖励模型的依赖,又可根据任务需求灵活调整奖励策略,高效驱动模型发现最优解法。  

#### 3.2.1 训练系统提示  
系统提示(指令微调版)  
你是一名乐于助手的智能体,使用维基百科搜索工具逐步解决问题。每一步必须仅基于当前已知信息,并导向新的搜索查询或最终答案。持续该顺序过程,直至获得足够信息作答。  

必须严格遵循以下输出格式:  
1. 所有推理、思考、解释与过程语言置于 <think>…</think> 标签内。  
2. 搜索查询置于 <query>…</query> 标签内。  
3. 收到搜索结果(置于<result>…</result>)后,基于当前已知信息,将与用户问题及当前查询最相关的信息提取至 <refine>…</refine> 标签内。  
4. 最终直接、简洁的答案仅置于 <answer>…</answer> 标签,并用 \\boxed{} 包裹直接、简洁的结果。  
5. 除上述标签外不输出任何文本。  

示例:  
<think>这是你的思考过程。</think>  
<query>这是用于检索的搜索查询。</query>  
<result>这是搜索结果。</result>  
<refine>这是从与查询最相关、足以推进下一步的文档中提取的精炼信息。</refine>  
<think>进一步推理、解释或搜索。</think>  
<answer>最终答案是 \\boxed{确切答案}</answer>

相似文章

Search-on-Graph-R1:使用强化学习训练大型语言模型搜索知识图谱

arXiv cs.CL

本文提出了Search-on-Graph-R1(SoG-R1),该模型通过首先使用黄金SPARQL查询搭建前沿教师模型以生成有依据的轨迹,然后应用监督微调和强化学习,训练一个8B参数的大型语言模型在知识图谱中导航。这个紧凑的模型在WebQSP、CWQ和GrailQA上超越了冻结的前沿系统,尤其是在CWQ上取得了所有对比方法中的最佳结果。

通过分层推理和话语级目标奖励增强LLMs的社交智能

arXiv cs.CL

本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。

多轮推理中信息分片段到达时的处理:可扩展分片与记忆增强强化学习

arXiv cs.CL

本文针对大语言模型在多轮对话中因信息分散而表现不佳的“迷失在对话”问题,提出了一种可扩展的分片流水线,将单轮问答数据集转化为多轮训练数据,并利用基于可验证奖励的强化学习训练一个维持紧凑滚动记忆的记忆增强策略,从而提高了多轮推理准确性,并零样本泛化到更困难的任务。