ContextPilot-14B(Hugging Face 仓库)
摘要
ContextPilot-14B 是一个 Qwen3-14B 检查点,它通过细粒度强化学习教授语言模型智能体主动上下文管理,以应对长期任务。
查看缓存全文
缓存时间: 2026/09/01 11:45
tencent/ContextPilot-14B · Hugging Face
来源:https://huggingface.co/tencent/ContextPilot-14B ContextPilot:通过细粒度强化学习训练智能体进行主动上下文管理
GitHub 仓库 (https://github.com/Tencent/ContextPilot) ContextPilot 在线演示 (https://tencent.github.io/ContextPilot/) 论文 (https://arxiv.org/abs/2608.28476) Hugging Face 模型 (https://huggingface.co/collections/panzs19/contextpilot)
ContextPilot-14B 是 ContextPilot 的 Qwen3-14B 检查点,这是一个面向长周期语言模型智能体的主动上下文管理框架。它能够教会智能体在持续推理和使用工具的同时进行规划、维护长期记忆,并卸载价值较低的上下文。更多详细信息,请参阅我们的论文 (https://arxiv.org/abs/2608.28476) 和代码仓库 (https://github.com/Tencent/ContextPilot)。
ContextPilot 概览图 (https://huggingface.co/tencent/ContextPilot-14B/blob/main/assets/contextpilot_overview.png)
https://huggingface.co/tencent/ContextPilot-14B#overview概览
ContextPilot 结合了三个主要组件:
- 一个扩展的上下文管理工具集,支持规划、结构化记忆、检索和软性上下文卸载;
- 上下文感知的部分展开,将探索聚焦于敏感的上下文编辑决策;
- 细粒度的信用分配,使用下游分支的结果来训练中间快照。
生成的智能体在长上下文问答和深度搜索任务上进行了评估;详情请参见评估说明 (https://github.com/Tencent/ContextPilot/tree/main/infer#evaluation)。
https://huggingface.co/tencent/ContextPilot-14B#loading加载
`` from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = “tencent/ContextPilot-14B” tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype=“auto”, device_map=“auto”, ) ``
请注意,仅加载检查点并不会执行上下文管理工具;工具定义、智能体运行时和评估流程均在 ContextPilot 仓库 (https://github.com/Tencent/ContextPilot) 中提供。完整设置请参阅推理指南 (https://github.com/Tencent/ContextPilot/blob/main/infer/README.md)。
https://huggingface.co/tencent/ContextPilot-14B#intended-use预期用途
本检查点旨在用于主动上下文管理、长周期智能体、长上下文问答和深度搜索等方面的研究。
https://huggingface.co/tencent/ContextPilot-14B#license许可证
许可证 (https://huggingface.co/tencent/ContextPilot-14B/blob/main/LICENSE)。
https://huggingface.co/tencent/ContextPilot-14B#citation引用
@inproceedings{pan-etal-2026-contextpilot, title = "ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL", author = "Pan, Zhuoshi and Pei, Qizhi and Lu, Junru and Lin, Honglin and Zhao, H. Vicky and Yin, Di and Sun, Xing", booktitle = "Proceedings of the 2026 Conference on Empirical Methods in Natural Language Processing", month = nov, year = "2026", address = "Budapest, Hungary", publisher = "Association for Computational Linguistics", abstract = "长周期智能体任务要求大语言模型在多轮交互中迭代地检索、整合和维护分散的信息,但保留所有交互历史会导致工作上下文持续膨胀。近期的主动上下文管理方法允许模型使用专用工具编辑自身的工作上下文,但它们仍面临三个关键局限:(1) 工具集有限,仅限于搜索、删除和摘要,不支持全局规划、长期记忆和自适应压缩;(2) 探索效率低下,尽管上下文管理动作对最终结果的影响各异,但探索时却一视同仁;(3) 粗粒度的信用分配,在强化学习中将最终轨迹级奖励分配给所有中间上下文编辑动作。为解决这些问题,我们提出了 ContextPilot,一个面向长周期智能体推理的主动上下文管理框架。我们的方法系统地通过规划、长期记忆和软性上下文卸载工具增强了工具集。我们进一步提出了一种针对上下文管理的强化学习方法,该方法利用上下文和熵变化来识别关键编辑决策进行分支采样,并从所有经过相应上下文编辑动作的分支轨迹中估计动作级优势。在长上下文问答和深度搜索任务上的实验表明,ContextPilot 在更紧凑的工作上下文下实现了更强的性能,持续在各种基础模型和基准测试中超越现有基线。代码已发布:\url{https://github.com/Tencent/ContextPilot}。" }
相似文章
ContextPilot: 通过细粒度强化学习训练智能体进行主动上下文管理
ContextPilot引入了一个用于长期智能体推理的主动上下文管理框架,通过细粒度强化学习结合分支采样来提升在维持紧凑工作上下文方面的性能和效率。
TokenPilot:面向LLM代理的缓存高效上下文管理
TokenPilot是一个双粒度上下文管理框架,通过稳定提示前缀和保守管理上下文片段,降低长时程LLM会话中的推理成本。在基准测试中实现了61-87%的成本降低,同时保持竞争性性能。
@rohanpaul_ai:长期运行的智能体并不只是需要更大的上下文窗口。关键在于它们需要学会判断哪些信息值得保留在上下文中……
ContextPilot通过细粒度强化学习,教会AI代理主动管理上下文,通过专注于需要保留的信息,提升了长上下文基准测试的表现。
在关键时刻记住:面向长周期代理的前瞻性记忆代理
本文介绍了一种前瞻性记忆代理,它与动作代理并行运行,以防止长周期任务中的行为状态衰减,在Terminal-Bench2.0和τ^2-Bench上取得了显著提升。作者还使用SFT和GRPO训练了Qwen3.5-27B,作为迈向开放权重记忆策略的初步步骤。
面向长周期任务的智能体兼容上下文管理
介绍AdaCoM,一种基于外部LLM的上下文管理器,适用于冻结的智能体。通过保留任务约束和修剪过时内容,利用强化学习提升长周期任务性能,并在网络搜索和深度研究基准上进行了实验。