面向智能体与多模态大语言模型的上下文感知强化学习
摘要
介绍了ContextRL,一种强化学习方法,教会大语言模型识别哪些上下文支持答案,在智能体和多模态基准上取得了性能提升。
查看缓存全文
缓存时间: 2026/06/20 14:26
论文页面 - Context-Aware RL for Agentic and Multimodal LLMs
Source: https://huggingface.co/papers/2606.17053 Context-Aware RL for Agentic and Multimodal LLMs
👉 LLMs 经常失败,不是因为答案不可能,而是因为它们错过了隐藏在长文本或图像中的关键线索。
🔥 我们提出 ContextRL:一种强化学习方法,训练模型识别哪些上下文真正支持答案。
✅ 在 5 个智能体基准测试上提高 +2.2% ✅ 在 12 个 VQA 基准测试上提高 +1.8% ✅ 适用于编码智能体和多模态推理 ✅ 相同的对比数据,但目标更优——不是数据增强
🧠 核心理念:不要只奖励最终答案,还要奖励模型将答案建立在正确证据上的行为。
相似文章
ContextPilot: 通过细粒度强化学习训练智能体进行主动上下文管理
ContextPilot引入了一个用于长期智能体推理的主动上下文管理框架,通过细粒度强化学习结合分支采样来提升在维持紧凑工作上下文方面的性能和效率。
面向长周期任务的智能体兼容上下文管理
介绍AdaCoM,一种基于外部LLM的上下文管理器,适用于冻结的智能体。通过保留任务约束和修剪过时内容,利用强化学习提升长周期任务性能,并在网络搜索和深度研究基准上进行了实验。
MCite-RL:通过引用增强的智能体强化学习实现可靠的多模态RAG
MCite-RL 是一种引用增强的智能体强化学习框架,专为可靠的多模态RAG设计,引入了用于视觉引用的迭代检索和推理,以及一种奖励机制来联合优化答案准确性和来源可追溯性。
@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。
GoLongRL:面向能力的长上下文强化学习与多任务对齐
GoLongRL 提出了一种开源方法,通过面向能力的数据构建和 TMN-Reweight 方法,实现具有多样化奖励优化的长上下文强化学习。