基于主动信息搜索的上下文训练

Hugging Face Daily Papers 论文

摘要

本文介绍了一种上下文优化方法,该方法通过维基百科搜索和浏览器工具进行主动信息搜索,并结合基于搜索的训练流程,在无需更新模型权重的情况下,在多个领域实现了稳健的性能提升。

现有的大语言模型(LLMs)在部署后进行适配通常成本高昂,尤其是当任务需要最新产生的信息或特定领域的专业知识时。近期研究表明,通过操控和优化上下文,大语言模型可以在不更新权重的情况下适应下游任务。然而,现有的大多数方法仍是闭环的,完全依赖模型的内在知识。在本文中,我们为这些上下文优化器配备了维基百科搜索和浏览器工具,用于主动信息搜索。我们表明,简单地将这些工具添加到标准的顺序上下文优化流程中,实际上会导致性能相对于基线下降。然而,当与一种维护和剪枝多个候选上下文的基于搜索的训练流程相结合时,主动信息搜索能带来一致且显著的收益。我们在多个领域展示了这些改进,包括低资源翻译(Flores+)、健康场景(HealthBench)以及高推理任务(LiveCodeBench 和 Humanity's Last Exam)。此外,我们的方法被证明是数据高效的,对不同超参数具有鲁棒性,并且能够生成有效的文本上下文,这些上下文在不同模型上具有良好的泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/05/14 04:17

Paper page - Context Training with Active Information Seeking

Source: https://huggingface.co/papers/2605.13050

摘要

通过搜索和浏览器工具实现主动信息获取的上下文优化方法,在保持数据效率和鲁棒性的同时,在多个领域取得了卓越性能。

大多数现有的largue language models (https://huggingface.co/papers?q=large%20language%20models)(LLMs)在部署后调整成本高昂,尤其是在任务需要最新信息或特定领域知识时。近期研究表明,通过操控和优化上下文,可以在不更新权重的情况下将LLMs适配到downstream tasks (https://huggingface.co/papers?q=downstream%20tasks)。然而,现有方法大多为闭环系统,仅依赖模型的内在知识。本文中,我们为这些上下文优化器配备了Wikipedia搜索和浏览器工具,用于active information seeking (https://huggingface.co/papers?q=active%20information%20seeking)。我们发现,将这些工具直接添加到标准的sequential context optimization (https://huggingface.co/papers?q=sequential%20context%20optimization)流程中,实际上可能使性能低于基线。然而,当与一种维护并剪枝多个candidate contexts (https://huggingface.co/papers?q=candidate%20contexts)的search-based training (https://huggingface.co/papers?q=search-based%20training)流程结合时,active information seeking (https://huggingface.co/papers?q=active%20information%20seeking)能够带来持续且显著的提升。我们在多个领域验证了这些改进,包括低资源翻译(Flores+)、健康场景(HealthBench)以及推理密集型任务(LiveCodeBench和Humanity’s Last Exam)。此外,我们的方法具有数据高效性、对不同超参数的鲁棒性,并能生成有效且可在不同模型间良好泛化的文本上下文。

View arXiv page (https://arxiv.org/abs/2605.13050)View PDF (https://arxiv.org/pdf/2605.13050)Add to collection (https://huggingface.co/login?next=%2Fpapers%2F2605.13050)

在您的代理中获取此论文:

hf papers read 2605.13050

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

请在模型README.md中引用arxiv.org/abs/2605.13050以从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

请在数据集README.md中引用arxiv.org/abs/2605.13050以从此页面链接。

引用此论文的Space0

没有Space关联此论文

请在Space README.md中引用arxiv.org/abs/2605.13050以从此页面链接。

包含此论文的合集0

没有合集包含此论文

请将此论文添加到一个collection (https://huggingface.co/new-collection)以从此页面链接。

相似文章

主动推理作为AI代理的上下文获取机制

arXiv cs.AI

本文提出将主动推理作为一种框架,使AI代理能够通过平衡信息增益与成本来高效获取上下文,并在语言模型上建立基准测试,应用于问题提出和提示优化。

MemTrain:自监督上下文记忆训练

arXiv cs.CL

MemTrain 提出了一种自监督训练框架,通过在维基百科语料上使用掩码重建和中间记忆召回代理任务,增强 LLM 智能体的上下文记忆能力,在下游记忆密集型 QA 基准上取得了高达 17.67 个百分点的提升。

缓解上下文干扰以实现可靠高效的搜索智能体

arXiv cs.CL

本文系统研究了基于多轮LLM的搜索智能体中的上下文干扰问题,发现干扰主要来自最新检索到的文档,并提出了一种基于蒸馏的上下文精炼器来缓解该问题。将上下文精炼纳入RL训练流程可显著提升可靠性和效率。

理解环境感知信息检索的行为

Hugging Face Daily Papers

本文首次系统分析了大型语言模型如何通过强化学习学习适应不同检索器的查询制定策略,揭示了不同的最优查询风格,并引入了一种基于分支的展开技术以提高多检索步训练稳定性。