ContextPilot: 通过细粒度强化学习训练智能体进行主动上下文管理

Papers with Code Trending 论文

摘要

ContextPilot引入了一个用于长期智能体推理的主动上下文管理框架,通过细粒度强化学习结合分支采样来提升在维持紧凑工作上下文方面的性能和效率。

长期智能体任务需要大型语言模型在多轮交互中迭代地检索、整合和维护分散的信息,但保存所有交互历史会导致工作上下文持续增长。近期的主动上下文管理方法允许模型使用专用工具编辑自己的工作上下文,但它们仍面临三个关键限制:(1) 工具集有限,仅限于搜索、删除和摘要,不支持全局规划、长期记忆和自适应压缩;(2) 低效的探索,尽管上下文管理行为对最终结果的影响是异质的,却一视同仁;(3) 粗粒度的信用分配,在强化学习中将最终轨迹级奖励分配给所有中间上下文编辑行为。为了弥合这些差距,我们引入了ContextPilot,一个用于长期智能体推理的主动上下文管理框架。我们的方法系统地扩展了工具集,包括规划、长期记忆和软上下文卸载工具。我们进一步提出了一种针对上下文管理定制的强化学习方法,该方法使用上下文和熵变化来识别分支采样的关键编辑决策,并从通过相应上下文编辑行为的所有分支轨迹中估计行为级优势。在长上下文问答和深度搜索任务上的实验表明,ContextPilot在更紧凑的工作上下文中实现了更强的性能,在不同基础模型和基准测试中持续优于现有基线。代码可在 https://github.com/Tencent/ContextPilot 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:48

论文页面 - ContextPilot:通过细粒度强化学习训练智能体实现主动式上下文管理

来源:https://huggingface.co/papers/2608.28476

摘要

ContextPilot 通过扩展上下文编辑工具,并利用带有分支采样的强化学习来识别关键上下文决策,从而提升长期智能体推理能力。

长期智能体任务需要大语言模型(LLM)在多轮交互中迭代地检索、整合和维护分散的信息,但保留所有交互历史会导致工作上下文持续增长。近期的主动式上下文管理(https://huggingface.co/papers?q=proactive%20context%20management)方法允许模型使用专用工具编辑自身的工作上下文,但它们仍面临三个主要局限:(1)工具集有限,仅限于搜索、删除和摘要,不支持全局规划(https://huggingface.co/papers?q=planning)、长期记忆(https://huggingface.co/papers?q=long-term%20memory)和自适应压缩;(2)探索效率低下,尽管上下文管理动作对最终结果的影响存在异质性,却被一视同仁地处理;(3)在强化学习(RL)中进行粗粒度的信用分配,将最终轨迹层面的奖励分配给所有中间的上下文编辑动作。为弥合这些差距,我们提出了 ContextPilot,一个用于长期智能体推理(https://huggingface.co/papers?q=long-horizon%20agentic%20reasoning)的主动式上下文管理(https://huggingface.co/papers?q=proactive%20context%20management)框架。我们的方法系统地扩展了工具集,加入了规划(https://huggingface.co/papers?q=planning)、长期记忆(https://huggingface.co/papers?q=long-term%20memory)和软上下文卸载(https://huggingface.co/papers?q=soft%20context%20offloading)工具。我们进一步提出了一种为上下文管理量身定制的强化学习方法,该方法使用上下文和熵变化(https://huggingface.co/papers?q=entropy%20variation)来识别用于分支采样(https://huggingface.co/papers?q=branch%20sampling)的关键编辑决策,并从通过相应上下文编辑动作的所有分支轨迹中估计动作层面的优势(https://huggingface.co/papers?q=action-level%20advantages)。在长上下文问答和深度搜索任务上的实验表明,ContextPilot 以更紧凑的工作上下文实现了更强的性能,在各种基础模型和基准测试中均持续优于现有基线。代码可在 https://github.com/Tencent/ContextPilot 获取。

查看arXiv页面 (https://arxiv.org/abs/2608.28476) 查看PDF (https://arxiv.org/pdf/2608.28476) 项目页面 (https://tencent.github.io/ContextPilot) GitHub57 (https://github.com/Tencent/ContextPilot) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.28476)

引用此论文的模型3

tencent/ContextPilot-14B 文本生成 • 15B • 更新于1天前 • 407 • 11 (https://huggingface.co/tencent/ContextPilot-14B)

tencent/ContextPilot-8B 文本生成 • 8B • 更新于1天前 • 403 • 6 (https://huggingface.co/tencent/ContextPilot-8B)

tencent/ContextPilot-E4B 文本生成 • 8B • 更新于1天前 • 404 • 5 (https://huggingface.co/tencent/ContextPilot-E4B)

引用此论文的数据集0

暂无关联此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2608.28476,即可从本页链接过去。

引用此论文的空间0

暂无关联此论文的空间

在空间的 README.md 中引用 arxiv.org/abs/2608.28476,即可从本页链接过去。

包含此论文的收藏集2

相似文章

ContextPilot-14B(Hugging Face 仓库)

TLDR AI

ContextPilot-14B 是一个 Qwen3-14B 检查点,它通过细粒度强化学习教授语言模型智能体主动上下文管理,以应对长期任务。

TokenPilot:面向LLM代理的缓存高效上下文管理

Hugging Face Daily Papers

TokenPilot是一个双粒度上下文管理框架,通过稳定提示前缀和保守管理上下文片段,降低长时程LLM会话中的推理成本。在基准测试中实现了61-87%的成本降低,同时保持竞争性性能。

面向长周期任务的智能体兼容上下文管理

arXiv cs.AI

介绍AdaCoM,一种基于外部LLM的上下文管理器,适用于冻结的智能体。通过保留任务约束和修剪过时内容,利用强化学习提升长周期任务性能,并在网络搜索和深度研究基准上进行了实验。