从受训者到训练者:LLM为多智能体推理强化学习设计的训练环境

Hugging Face Daily Papers 论文

摘要

本文介绍了LLM-as-Environment-Engineer框架,该框架使LLM能够为多智能体推理任务中的强化学习设计自己的训练环境,实现自我改进训练,其性能超越更大的专有模型。

用于大型语言模型(LLM)训练的强化学习流程通常依赖于阶段之间手动重新设计的环境,要求从业者启发式地推断哪种配置能最好地改进当前策略。为了自动化这一过程,我们提出了LLM-as-Environment-Engineer框架,其中当前策略模型分析失败轨迹以及上下文信息,并提出对下一阶段训练环境配置的修改。我们还引入了MAPF-FrozenLake,一个可控测试平台,其生成器暴露了多维环境配置,使其适合研究和评估环境重新设计。在此测试平台上,我们让环境工程师基于策略行为、失败案例和环境统计的结构化摘要,并由此生成下一训练阶段的配置。以Qwen3-4B为骨干模型,我们的框架在基准测试中取得了最强的综合性能,超越了更大的专有LLM(例如GPT、Gemini)和固定环境训练基线。我们进一步分析了哪种形式的上下文最有效,发现成功的环境更新依赖于失败证据,并保留已经有效的配置。有趣的是,当前的RL检查点比原始基础模型更适合作为环境工程师,这表明策略学习提升了模型诊断其剩余弱点的能力。
查看原文
查看缓存全文

缓存时间: 2026/06/18 11:57

论文页面 - 从学员到教练:面向多智能体推理的LLM设计训练环境

来源:https://huggingface.co/papers/2606.17682 🚀 从学员到教练。

无需手动重新设计环境。无需猜测模型仍在何处挣扎。🤔

让模型自行诊断失败原因,并自行设计下一个训练环境。🧠

就像一个逐渐成为自己老师的学习者,策略会审视自己的失败,理解学习中仍存在的障碍,并为下一阶段重塑RL环境。🔁

我们提出LLM作为环境工程师(LLM-as-Environment-Engineer)这一新框架,其中LLM不仅能在环境中学习,还能学会设计出能更好地教授自己的环境。🌍✨

在多智能体推理任务上,使用我们框架训练的Qwen3-4B模型超越了更强的基线,包括更大的专有LLM。

学员变成了教练。训练变成了自我提升。🚀

图片(https://cdn-uploads.huggingface.co/production/uploads/670529944bc4b760533b1198/M2zGlP-2f_909Sx42Wjuz.png)

相似文章