实时智能:环境驱动的动态策略助力持续LLM改进

arXiv cs.CL 论文

摘要

本文提出动态检索策略生成(DRPG)框架,该框架利用记忆检索和环境反馈动态生成策略,以在多种任务中实现大型语言模型的持续改进。

arXiv:2609.16800v1 公告类型:新 摘要:大型语言模型(LLMs)在多个领域取得了显著进展,但持续适应不断演变的任务和环境仍是一个关键挑战。现有的记忆增强方法检索单个过去的示例作为直接参考,但并未从中明确合成可操作的策略,导致相同类型的错误反复出现。我们提出动态检索策略生成(DRPG)框架,该框架将基于记忆的检索与动态策略生成器相结合,利用历史数据和环境反馈生成任务特定策略,以实现LLM的持续改进。我们使用来自专有和开放权重家族的七种LLMs,在涵盖文本到SQL、问答、医疗诊断和Python编程的六个基准上评估DRPG。DRPG在大多数数据集和模型上优于强基线。进一步分析表明,DRPG的策略生成对检索策略具有鲁棒性,无需先前策略连续性即可有效运行,并且可以利用较小或跨家族的模型作为成本效益高的策略生成器。我们还发现,策略级指导的益处取决于任务特征,为该机制何时以及在何种条件下最有效提供了实用见解。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:53

The request was rejected because it was considered high risk

相似文章

动态潜路由

Hugging Face Daily Papers

动态潜路由(DLR)让LLM通过搜索组合子策略来学习自己的内心独白,其灵感来源于语言的组合性。在低数据微调场景中,DLR达到或优于标准的监督微调。

PolicyBank:为LLM智能体演进策略理解

arXiv cs.CL

PolicyBank提出了一种记忆机制,使LLM智能体能够通过迭代交互和纠正反馈自主改进对组织策略的理解,弥补导致系统性行为偏离真实需求的规范差距。该工作引入了一个系统化测试平台,并展示PolicyBank能够解决高达82%的策略差距对齐失败,显著超越现有记忆机制。