从受训者到训练者:LLM为多智能体推理强化学习设计的训练环境
摘要
本文介绍了LLM-as-Environment-Engineer框架,该框架使LLM能够为多智能体推理任务中的强化学习设计自己的训练环境,实现自我改进训练,其性能超越更大的专有模型。
查看缓存全文
缓存时间: 2026/06/18 11:57
论文页面 - 从学员到教练:面向多智能体推理的LLM设计训练环境
来源:https://huggingface.co/papers/2606.17682 🚀 从学员到教练。
无需手动重新设计环境。无需猜测模型仍在何处挣扎。🤔
让模型自行诊断失败原因,并自行设计下一个训练环境。🧠
就像一个逐渐成为自己老师的学习者,策略会审视自己的失败,理解学习中仍存在的障碍,并为下一阶段重塑RL环境。🔁
我们提出LLM作为环境工程师(LLM-as-Environment-Engineer)这一新框架,其中LLM不仅能在环境中学习,还能学会设计出能更好地教授自己的环境。🌍✨
在多智能体推理任务上,使用我们框架训练的Qwen3-4B模型超越了更强的基线,包括更大的专有LLM。
学员变成了教练。训练变成了自我提升。🚀
图片(https://cdn-uploads.huggingface.co/production/uploads/670529944bc4b760533b1198/M2zGlP-2f_909Sx42Wjuz.png)
相似文章
从受训者到训练者:面向多智能体推理的强化学习的LLM设计训练环境
本文提出了LLM-as-Environment-Engineer框架,其中策略模型通过分析失败案例自动重新设计强化学习训练环境,并引入MAPF-FrozenLake作为可控测试平台。该框架使用Qwen3-4B模型,性能优于GPT和Gemini等更大规模模型,表明策略学习提升了模型诊断自身弱点的能力。
@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。
EvoTrainer:面向自主智能体强化学习的LLM策略与训练框架协同进化
EvoTrainer提出了一种自主训练框架,通过经验反馈协同进化LLM策略与训练框架,在数学推理、代码生成以及长期软件工程任务上超越了人工设计的强化学习基线。
多智能体RL何时能提升LLM工作流?工作流、规模与策略共享的权衡
本文研究了端到端强化学习训练何时能改善多智能体LLM工作流,比较了不同工作流、任务和模型规模下的共享策略与隔离策略训练,揭示了条件性权衡。
LLMZero:通过LLM智能体发现强化学习后训练的自适应训练策略
LLMZero利用LLM智能体通过树搜索在训练轨迹中进行搜索,发现用于强化学习后训练的自适应多参数过渡策略,该策略在多种任务中优于固定调度和网格搜索。