实时智能:环境驱动的动态策略助力持续LLM改进
摘要
本文提出动态检索策略生成(DRPG)框架,该框架利用记忆检索和环境反馈动态生成策略,以在多种任务中实现大型语言模型的持续改进。
arXiv:2609.16800v1 公告类型:新
摘要:大型语言模型(LLMs)在多个领域取得了显著进展,但持续适应不断演变的任务和环境仍是一个关键挑战。现有的记忆增强方法检索单个过去的示例作为直接参考,但并未从中明确合成可操作的策略,导致相同类型的错误反复出现。我们提出动态检索策略生成(DRPG)框架,该框架将基于记忆的检索与动态策略生成器相结合,利用历史数据和环境反馈生成任务特定策略,以实现LLM的持续改进。我们使用来自专有和开放权重家族的七种LLMs,在涵盖文本到SQL、问答、医疗诊断和Python编程的六个基准上评估DRPG。DRPG在大多数数据集和模型上优于强基线。进一步分析表明,DRPG的策略生成对检索策略具有鲁棒性,无需先前策略连续性即可有效运行,并且可以利用较小或跨家族的模型作为成本效益高的策略生成器。我们还发现,策略级指导的益处取决于任务特征,为该机制何时以及在何种条件下最有效提供了实用见解。
查看缓存全文
缓存时间: 2026/09/16 08:53
The request was rejected because it was considered high risk
相似文章
动态潜路由
动态潜路由(DLR)让LLM通过搜索组合子策略来学习自己的内心独白,其灵感来源于语言的组合性。在低数据微调场景中,DLR达到或优于标准的监督微调。
PolicyBank:为LLM智能体演进策略理解
PolicyBank提出了一种记忆机制,使LLM智能体能够通过迭代交互和纠正反馈自主改进对组织策略的理解,弥补导致系统性行为偏离真实需求的规范差距。该工作引入了一个系统化测试平台,并展示PolicyBank能够解决高达82%的策略差距对齐失败,显著超越现有记忆机制。
从受训者到训练者:面向多智能体推理的强化学习的LLM设计训练环境
本文提出了LLM-as-Environment-Engineer框架,其中策略模型通过分析失败案例自动重新设计强化学习训练环境,并引入MAPF-FrozenLake作为可控测试平台。该框架使用Qwen3-4B模型,性能优于GPT和Gemini等更大规模模型,表明策略学习提升了模型诊断自身弱点的能力。
迈向可靠且鲁棒的LLM规划:符号反馈驱动的迭代自我改进框架
本文提出了一种符号反馈驱动的迭代自我改进框架,以提高大语言模型在长周期规划任务中的鲁棒性和可靠性。该方法利用自然语言提示、符号验证器和计划识别器来增强可行性与正确性。
@dair_ai: 新论文:让LLM智能体获得经验,同时改进权重并保持可读性。智能体经验…
JERP 提出了一种方法,让LLM智能体从相同的交互轨迹中联合学习可解释的自然语言规则并更新策略参数,在AlfWorld和WebShop上提升了性能,同时保持了可检查性。