语言代理的策略与世界模型协同训练
摘要
本文介绍PaW,一种协同训练框架,在在线策略强化学习(on-policy RL)轨迹中向策略学习添加辅助世界模型监督,无需额外计算开销即可改进语言代理的训练。
查看缓存全文
缓存时间: 2026/06/02 15:34
论文页面 - 策略与世界建模联合训练用于语言智能体
来源:https://huggingface.co/papers/2606.02388
作者:
,
,
,
,
,
,
,
,
,
,
摘要
PaW 是一个联合训练框架,通过利用基于策略的强化学习采样数据,结合策略学习与世界建模,在不增加额外计算开销的情况下提升语言智能体训练效果。
强化学习 (https://huggingface.co/papers?q=Reinforcement%20learning) (RL) 通过教导大型语言模型 (LLM) 智能体哪些行动能获得高奖励来提升其性能,但很少监督这些行动对环境造成的影响。世界建模 (https://huggingface.co/papers?q=World%20modeling) (WM) 可以弥补这一不足,然而现有方法通常需要单独的模拟器、额外的训练阶段或额外的推理时计算。我们观察到,基于策略的 RL (https://huggingface.co/papers?q=on-policy%20RL) 采样数据已经包含了所需信号:每一次转移都将一个行动与其产生的下一个观测结果配对。基于此观察,我们提出了 PaW,一个策略与世界建模 (https://huggingface.co/papers?q=World%20modeling) 联合训练框架,在 RL 过程中为同一策略添加辅助的 WM 监督,且不改变推理范式。为了使辅助 WM 监督更具信息性和稳定性,PaW 引入了三个组件:基于行动熵的 WM 数据选择、噪声容忍的 WM 损失函数,以及奖励自适应的损失平衡 (https://huggingface.co/papers?q=reward-adaptive%20loss%20balancing)。在三个智能体任务基准上的实验表明,该方法在多种模型和 RL 算法上均优于强 RL 基线。这些结果表明,标准的 RL 采样数据是语言智能体训练中实用的 WM 监督来源。
查看 arXiv 页面 (https://arxiv.org/abs/2606.02388)查看 PDF (https://arxiv.org/pdf/2606.02388)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.02388)
在您的智能体中获取此论文:
hf papers read 2606\.02388
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.02388 以从此页面链接。
引用该论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.02388 以从此页面链接。
引用该论文的空间0
没有空间链接此论文
请在空间 README.md 中引用 arxiv.org/abs/2606.02388 以从此页面链接。
包含该论文的合集0
没有合集包含此论文
请将论文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
通过世界模型从人类偏好和理由中学习安全智能体行为
本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。
UP-NRPA:基于用户画像的嵌套展开策略自适应方法,用于面向目标对话系统中大语言模型的规划
本文提出UP-NRPA,一种在线框架,将用户画像与基于大语言模型的嵌套展开策略自适应相结合,无需离线训练即可动态定制对话策略,在多个对话任务上实现了100%的成功率。
从受训者到训练者:面向多智能体推理的强化学习的LLM设计训练环境
本文提出了LLM-as-Environment-Engineer框架,其中策略模型通过分析失败案例自动重新设计强化学习训练环境,并引入MAPF-FrozenLake作为可控测试平台。该框架使用Qwen3-4B模型,性能优于GPT和Gemini等更大规模模型,表明策略学习提升了模型诊断自身弱点的能力。
超越下一观测预测:面向顺序决策的智能体自主世界建模
本文提出了一种名为“智能体自主世界建模”(AAWM)的训练流程,该流程基于策略自身的决策需求构建世界模型监督,而非依赖下一观测预测,从而使学习目标与有效决策所需的动态特性对齐。
PolicyAlign: 基于直接策略的大型语言模型安全对齐
PolicyAlign 提出了一种框架,通过合成指令生成和在线策略自蒸馏,直接将大型语言模型与自然语言安全策略对齐,在不依赖昂贵监督数据的情况下提升安全性。