SPADE:自适应合成可执行环境中的自我博弈

Hugging Face Daily Papers 论文

摘要

SPADE 引入了一种针对语言模型的自我博弈强化学习框架,该框架生成自适应的可执行训练环境,以增强推理和工具使用能力,并在多个基准测试中展示了显著的性能提升。

持续自我改进需要不断扩大的、由自身生成的、多样化的、自适应的目标池。对于语言代理而言,现有的训练环境池(手动策划、静态合成或冻结验证器)在学习者规模扩展时保持目标分布固定。我们引入了 SPADE(自适应合成可执行环境中的自我博弈),这是一个自我博弈 RL 框架,其中单个 LLM 扮演两个角色:一个环境设计器,它编写完整的、长期训练环境作为可执行代码,具有类似 OpenAI Gym 的 reset()/step() 接口;以及一个推理代理,学习在其中行动。每个都是有状态的、多轮环境(状态转换、奖励函数和验证代码),因此一个接口涵盖了推理问题和多步代理工具使用。推理代理的遗憾是通过其有特权提示和无特权提示的奖励之间的差距来估计的;在优化这个遗憾信号时,环境设计器学习针对代理能力边缘的环境,同时保持它们可行。通过广泛的实验,我们发现几个对成功至关重要的组件:将环境设计器基于从大型预训练语料库中采样的文档进行基础化,并给它一个累积的环境记忆。扩展到 30B 参数模型,SPADE 在八个保留的数学、科学、代码和推理基准测试中,平均比最强的固定环境基线提高了 +5.3,并在 BFCL-v4 多轮和 ACEBench-Agent 中分别提升了 +5.7 和 +13.9 的工具使用设置;在游戏设置中,超过最强基线的差距随着模型规模增长而增大。通过使环境设计本身成为一个可学习的组件,SPADE 向开放式自我改进迈出了具体的一步。
查看原文
查看缓存全文

缓存时间: 2026/08/20 04:03

论文页面 - SPADE:自适应合成可执行环境中的自博弈

来源:https://huggingface.co/papers/2608.19197 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

SPADE 是一个自博弈强化学习框架,其中语言模型设计自适应的可执行训练环境,并学习解决这些问题,通过基于遗憾的环境目标设定来提升推理和工具使用性能。

持续的自我提升需要一个不断扩展的、由自身生成的、多样化的、自适应的目标池。对于语言代理,现有的训练环境池(人工策划的、静态合成的,或冻结验证器的)在学习者规模扩大的同时,保持目标分布固定不变。我们引入了SPADE (https://huggingface.co/papers?q=SPADE)(自适应合成可执行环境中的自博弈),这是一个自博弈强化学习 (https://huggingface.co/papers?q=self-play%20RL) 框架,其中单个LLM (https://huggingface.co/papers?q=LLM) 扮演两个角色:一个环境设计者 (https://huggingface.co/papers?q=Environment%20Designer),它编写完整的、长期的训练环境作为可执行代码,带有OpenAI Gym (https://huggingface.co/papers?q=OpenAI%20Gym) 风格的reset()/step() (https://huggingface.co/papers?q=reset()%2Fstep()) 接口;以及一个推理代理 (https://huggingface.co/papers?q=Reasoning%20Agent),它学习在其中行动。每个环境都是一个有状态的、多轮的环境(状态转换、奖励函数 (https://huggingface.co/papers?q=reward%20functions) 和验证代码 (https://huggingface.co/papers?q=verification%20code)),因此一个接口可以涵盖推理问题和多步骤代理工具使用。推理代理 (https://huggingface.co/papers?q=Reasoning%20Agent) 的遗憾 (https://huggingface.co/papers?q=regret) 是通过其在有无特权提示 (https://huggingface.co/papers?q=privileged%20hints) 下的奖励差距来估计的;通过优化这个遗憾 (https://huggingface.co/papers?q=regret) 信号,环境设计者 (https://huggingface.co/papers?q=Environment%20Designer) 学会瞄准代理能力边缘的环境,同时保持其可行性。通过广泛的实验,我们发现了对成功至关重要的几个组成部分:将环境设计者 (https://huggingface.co/papers?q=Environment%20Designer) 基于从大型预训练语料库中采样的文档进行落地,并为其提供累积环境记忆 (https://huggingface.co/papers?q=accumulated%20environment%20memory)。扩展到 300 亿参数模型,SPADE (https://huggingface.co/papers?q=SPADE) 在八个保留的数学、科学、代码和推理基准测试上平均比最强的固定环境基线提高了 +5.3,在 BFCL-v4 多轮工具使用设置上提高了 +5.7,在 ACEBench-Agent 上提高了 +13.9;在游戏设置上,随着模型规模的增长,其相对于最强基线的优势会扩大。通过使环境设计本身成为一个可学习的组件,SPADE (https://huggingface.co/papers?q=SPADE) 朝着开放式自我提升迈出了具体一步。

查看 arXiv 页面 (https://arxiv.org/abs/2608.19197) 查看 PDF (https://arxiv.org/pdf/2608.19197) 项目页面 (https://spade-rl.github.io/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.19197)

在你的代理中获取这篇论文:

hf papers read 2608\.19197

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接到这篇论文

在模型 README.md 中引用 arxiv.org/abs/2608.19197 以将其从本页面链接。

引用本文的数据集 0

没有数据集链接到这篇论文

在数据集 README.md 中引用 arxiv.org/abs/2608.19197 以将其从本页面链接。

引用本文的空间 0

没有空间链接到这篇论文

在空间 README.md 中引用 arxiv.org/abs/2608.19197 以将其从本页面链接。

包含本文的收藏夹 0

没有收藏夹包含这篇论文

将这篇论文添加到收藏夹 (https://huggingface.co/new-collection) 以将其从本页面链接。

相似文章

语言模型代理的自我编程执行

arXiv cs.AI

本文介绍了自我编程执行(SPE),这是一种代理架构,其中语言模型生成其自身的编排程序,而非依赖固定的外部框架。文章提出了“Spell”,一种基于 Lisp 的语言,支持自我编辑和重新求值,并展示了前沿模型能够利用该方法成功执行代理任务。