@rohanpaul_ai:长期运行的智能体并不只是需要更大的上下文窗口。关键在于它们需要学会判断哪些信息值得保留在上下文中……

X AI KOLs Timeline 论文

摘要

ContextPilot通过细粒度强化学习,教会AI代理主动管理上下文,通过专注于需要保留的信息,提升了长上下文基准测试的表现。

长期运行的智能体不仅仅需要更大的上下文窗口,更需要学会判断哪些信息值得保留在上下文中。 通过强化学习训练上下文管理策略,能够显著提升长期智能体的工作效果。 随着运行时间延长,智能体不断在提示词中添加搜索结果、工具输出和推理记录。最终模型需要消耗大量算力从冗余信息中筛选有效内容。 ContextPilot 让智能体能够自主解决这个问题:它可以通过规划将重要信息保存至长期记忆,并能对旧上下文进行总结、压缩或删除。 其强化学习训练机制会指导智能体学习哪些上下文决策真正具有价值。 在使用 Qwen3-8B 模型时,ContextPilot-8B-RL 在四项长上下文基准测试中平均得分达到 69.40,而采用 128K 上下文窗口但无上下文管理工具的相同模型仅获得 45.93 分。 在 BrowseComp 测试中,ContextPilot 每轮对话的上下文始终保持在 8K-10K 令牌,而 WebExplorer-8B 则增长到约 30K。 论文核心建议:不要把整个对话历史都当作记忆。应该为智能体提供可主动管理的精简工作上下文,并通过训练使其保留关键信息。 – arxiv.org/abs/2608.28476 《ContextPilot:通过细粒度强化学习训练智能体进行主动上下文管理》
查看原文
查看缓存全文

缓存时间: 2026/09/04 04:20

长期运行的智能体不仅仅需要更大的上下文窗口。它们需要学习哪些内容值得保留在上下文中。

长时程智能体在将上下文管理作为一项学习策略时表现更佳。

长期运行的智能体会不断向提示词中添加搜索结果、工具输出和推理过程。最终,模型会花费更多算力来从陈旧信息中筛选有用事实。

ContextPilot 让智能体能够自主控制这一过程。它能规划、将重要信息保存至长期记忆,并对旧上下文进行总结、压缩或删除。

其强化学习训练会进一步教会智能体哪些上下文管理决策确实有益。

在 Qwen3-8B 模型上,ContextPilot-8B-RL 在四项长上下文基准测试中平均得分为 69.40,而使用 128K 窗口但不配备上下文工具的同类模型仅得 45.93。

在 BrowseComp 测试中,其每轮上下文始终维持在约 8K–10K token,而 WebExplorer-8B 则增长到接近 30K。

论文核心建议:停止将整个对话历史视为记忆。为智能体提供一个更小、可主动管理的工作上下文,并训练它们保留关键内容。

– arxiv.org/abs/2608.28476

论文标题:“ContextPilot:通过细粒度强化学习教导智能体主动管理上下文”

相似文章