基于主动信息搜索的上下文训练
摘要
本文介绍了一种上下文优化方法,该方法通过维基百科搜索和浏览器工具进行主动信息搜索,并结合基于搜索的训练流程,在无需更新模型权重的情况下,在多个领域实现了稳健的性能提升。
查看缓存全文
缓存时间: 2026/05/14 04:17
Paper page - Context Training with Active Information Seeking
Source: https://huggingface.co/papers/2605.13050
摘要
通过搜索和浏览器工具实现主动信息获取的上下文优化方法,在保持数据效率和鲁棒性的同时,在多个领域取得了卓越性能。
大多数现有的largue language models (https://huggingface.co/papers?q=large%20language%20models)(LLMs)在部署后调整成本高昂,尤其是在任务需要最新信息或特定领域知识时。近期研究表明,通过操控和优化上下文,可以在不更新权重的情况下将LLMs适配到downstream tasks (https://huggingface.co/papers?q=downstream%20tasks)。然而,现有方法大多为闭环系统,仅依赖模型的内在知识。本文中,我们为这些上下文优化器配备了Wikipedia搜索和浏览器工具,用于active information seeking (https://huggingface.co/papers?q=active%20information%20seeking)。我们发现,将这些工具直接添加到标准的sequential context optimization (https://huggingface.co/papers?q=sequential%20context%20optimization)流程中,实际上可能使性能低于基线。然而,当与一种维护并剪枝多个candidate contexts (https://huggingface.co/papers?q=candidate%20contexts)的search-based training (https://huggingface.co/papers?q=search-based%20training)流程结合时,active information seeking (https://huggingface.co/papers?q=active%20information%20seeking)能够带来持续且显著的提升。我们在多个领域验证了这些改进,包括低资源翻译(Flores+)、健康场景(HealthBench)以及推理密集型任务(LiveCodeBench和Humanity’s Last Exam)。此外,我们的方法具有数据高效性、对不同超参数的鲁棒性,并能生成有效且可在不同模型间良好泛化的文本上下文。
View arXiv page (https://arxiv.org/abs/2605.13050)View PDF (https://arxiv.org/pdf/2605.13050)Add to collection (https://huggingface.co/login?next=%2Fpapers%2F2605.13050)
在您的代理中获取此论文:
hf papers read 2605.13050
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
请在模型README.md中引用arxiv.org/abs/2605.13050以从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
请在数据集README.md中引用arxiv.org/abs/2605.13050以从此页面链接。
引用此论文的Space0
没有Space关联此论文
请在Space README.md中引用arxiv.org/abs/2605.13050以从此页面链接。
包含此论文的合集0
没有合集包含此论文
请将此论文添加到一个collection (https://huggingface.co/new-collection)以从此页面链接。
相似文章
主动推理作为AI代理的上下文获取机制
本文提出将主动推理作为一种框架,使AI代理能够通过平衡信息增益与成本来高效获取上下文,并在语言模型上建立基准测试,应用于问题提出和提示优化。
MemTrain:自监督上下文记忆训练
MemTrain 提出了一种自监督训练框架,通过在维基百科语料上使用掩码重建和中间记忆召回代理任务,增强 LLM 智能体的上下文记忆能力,在下游记忆密集型 QA 基准上取得了高达 17.67 个百分点的提升。
SlimSearcher:通过自适应奖励门控训练效率感知的网络代理
SlimSearcher 是一个框架,通过结合帕累托高效轨迹过滤和自适应奖励塑形,提升深度研究代理的效率,在 GAIA、BrowseComp 和 XBenchDeepSearch 等基准测试中,将工具调用轮次减少 17%-58%,同时保持准确率。
缓解上下文干扰以实现可靠高效的搜索智能体
本文系统研究了基于多轮LLM的搜索智能体中的上下文干扰问题,发现干扰主要来自最新检索到的文档,并提出了一种基于蒸馏的上下文精炼器来缓解该问题。将上下文精炼纳入RL训练流程可显著提升可靠性和效率。
理解环境感知信息检索的行为
本文首次系统分析了大型语言模型如何通过强化学习学习适应不同检索器的查询制定策略,揭示了不同的最优查询风格,并引入了一种基于分支的展开技术以提高多检索步训练稳定性。