@rohanpaul_ai:长期运行的智能体并不只是需要更大的上下文窗口。关键在于它们需要学会判断哪些信息值得保留在上下文中……
摘要
ContextPilot通过细粒度强化学习,教会AI代理主动管理上下文,通过专注于需要保留的信息,提升了长上下文基准测试的表现。
查看缓存全文
缓存时间: 2026/09/04 04:20
长期运行的智能体不仅仅需要更大的上下文窗口。它们需要学习哪些内容值得保留在上下文中。
长时程智能体在将上下文管理作为一项学习策略时表现更佳。
长期运行的智能体会不断向提示词中添加搜索结果、工具输出和推理过程。最终,模型会花费更多算力来从陈旧信息中筛选有用事实。
ContextPilot 让智能体能够自主控制这一过程。它能规划、将重要信息保存至长期记忆,并对旧上下文进行总结、压缩或删除。
其强化学习训练会进一步教会智能体哪些上下文管理决策确实有益。
在 Qwen3-8B 模型上,ContextPilot-8B-RL 在四项长上下文基准测试中平均得分为 69.40,而使用 128K 窗口但不配备上下文工具的同类模型仅得 45.93。
在 BrowseComp 测试中,其每轮上下文始终维持在约 8K–10K token,而 WebExplorer-8B 则增长到接近 30K。
论文核心建议:停止将整个对话历史视为记忆。为智能体提供一个更小、可主动管理的工作上下文,并训练它们保留关键内容。
– arxiv.org/abs/2608.28476
论文标题:“ContextPilot:通过细粒度强化学习教导智能体主动管理上下文”
相似文章
ContextPilot: 通过细粒度强化学习训练智能体进行主动上下文管理
ContextPilot引入了一个用于长期智能体推理的主动上下文管理框架,通过细粒度强化学习结合分支采样来提升在维持紧凑工作上下文方面的性能和效率。
@GergelyOrosz: 试图弄清楚,在上下文窗口中使用更多上下文(我称之为上下文深度),在更长的运行中,错误会如何累积/代理会如何漂移……
Gergely Orosz 指出,在AI代理的上下文窗口中使用更多上下文进行更长的运行会增加错误和漂移,建议使用更短的运行和更少的上下文以提高可靠性。
@ZhihuFrontier: Long-Horizon Agents Need More Than Bigger Context Windows AI Agents are moving from short conversations into software e…
A new survey from Renmin University reviews nearly 1,000 studies on long-horizon AI agents, arguing that reliable long-horizon intelligence depends on the whole model-harness system, not just larger context windows or stronger models.
连续运行六小时后,你的上下文窗口究竟会发生什么
一位实践者分享了AI代理连续运行6小时以上时,上下文窗口管理策略(摘要、RAG、截断)的真实失败模式,指出每种方法都会以仅在长时间运行时才会显现的方式降低决策质量。
更大的上下文窗口对智能体来说其实是错误的方向吗?
作者质疑将注意力集中在扩大AI智能体的上下文窗口上是否适得其反,认为积累的垃圾信息会拖慢长时间会话,并建议保持工作上下文小巧、使用外部记忆。