SPADE:自适应合成可执行环境中的自我博弈
摘要
SPADE 引入了一种针对语言模型的自我博弈强化学习框架,该框架生成自适应的可执行训练环境,以增强推理和工具使用能力,并在多个基准测试中展示了显著的性能提升。
查看缓存全文
缓存时间: 2026/08/20 04:03
论文页面 - SPADE:自适应合成可执行环境中的自博弈
来源:https://huggingface.co/papers/2608.19197 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
SPADE 是一个自博弈强化学习框架,其中语言模型设计自适应的可执行训练环境,并学习解决这些问题,通过基于遗憾的环境目标设定来提升推理和工具使用性能。
持续的自我提升需要一个不断扩展的、由自身生成的、多样化的、自适应的目标池。对于语言代理,现有的训练环境池(人工策划的、静态合成的,或冻结验证器的)在学习者规模扩大的同时,保持目标分布固定不变。我们引入了SPADE (https://huggingface.co/papers?q=SPADE)(自适应合成可执行环境中的自博弈),这是一个自博弈强化学习 (https://huggingface.co/papers?q=self-play%20RL) 框架,其中单个LLM (https://huggingface.co/papers?q=LLM) 扮演两个角色:一个环境设计者 (https://huggingface.co/papers?q=Environment%20Designer),它编写完整的、长期的训练环境作为可执行代码,带有OpenAI Gym (https://huggingface.co/papers?q=OpenAI%20Gym) 风格的reset()/step() (https://huggingface.co/papers?q=reset()%2Fstep()) 接口;以及一个推理代理 (https://huggingface.co/papers?q=Reasoning%20Agent),它学习在其中行动。每个环境都是一个有状态的、多轮的环境(状态转换、奖励函数 (https://huggingface.co/papers?q=reward%20functions) 和验证代码 (https://huggingface.co/papers?q=verification%20code)),因此一个接口可以涵盖推理问题和多步骤代理工具使用。推理代理 (https://huggingface.co/papers?q=Reasoning%20Agent) 的遗憾 (https://huggingface.co/papers?q=regret) 是通过其在有无特权提示 (https://huggingface.co/papers?q=privileged%20hints) 下的奖励差距来估计的;通过优化这个遗憾 (https://huggingface.co/papers?q=regret) 信号,环境设计者 (https://huggingface.co/papers?q=Environment%20Designer) 学会瞄准代理能力边缘的环境,同时保持其可行性。通过广泛的实验,我们发现了对成功至关重要的几个组成部分:将环境设计者 (https://huggingface.co/papers?q=Environment%20Designer) 基于从大型预训练语料库中采样的文档进行落地,并为其提供累积环境记忆 (https://huggingface.co/papers?q=accumulated%20environment%20memory)。扩展到 300 亿参数模型,SPADE (https://huggingface.co/papers?q=SPADE) 在八个保留的数学、科学、代码和推理基准测试上平均比最强的固定环境基线提高了 +5.3,在 BFCL-v4 多轮工具使用设置上提高了 +5.7,在 ACEBench-Agent 上提高了 +13.9;在游戏设置上,随着模型规模的增长,其相对于最强基线的优势会扩大。通过使环境设计本身成为一个可学习的组件,SPADE (https://huggingface.co/papers?q=SPADE) 朝着开放式自我提升迈出了具体一步。
查看 arXiv 页面 (https://arxiv.org/abs/2608.19197) 查看 PDF (https://arxiv.org/pdf/2608.19197) 项目页面 (https://spade-rl.github.io/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.19197)
在你的代理中获取这篇论文:
hf papers read 2608\.19197
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接到这篇论文
在模型 README.md 中引用 arxiv.org/abs/2608.19197 以将其从本页面链接。
引用本文的数据集 0
没有数据集链接到这篇论文
在数据集 README.md 中引用 arxiv.org/abs/2608.19197 以将其从本页面链接。
引用本文的空间 0
没有空间链接到这篇论文
在空间 README.md 中引用 arxiv.org/abs/2608.19197 以将其从本页面链接。
包含本文的收藏夹 0
没有收藏夹包含这篇论文
将这篇论文添加到收藏夹 (https://huggingface.co/new-collection) 以将其从本页面链接。
相似文章
语言模型代理的自我编程执行
本文介绍了自我编程执行(SPE),这是一种代理架构,其中语言模型生成其自身的编排程序,而非依赖固定的外部框架。文章提出了“Spell”,一种基于 Lisp 的语言,支持自我编辑和重新求值,并展示了前沿模型能够利用该方法成功执行代理任务。
SPARK:基于知识图谱的不对称奖励自博弈
本文介绍了 SPARK,这是一种自博弈强化学习框架,利用从科学文献中衍生出的知识图谱来提升视觉-语言模型的关系推理能力。
技能自我对弈(Skill Self-Play):通过协同进化技能推动大语言模型能力前沿
本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。
SCOPE:通过共同进化策略进行开放式任务的自我对弈
SCOPE是一个用于开放式任务的自我对弈框架,它共同进化挑战者(Challenger)和求解器(Solver)策略,在没有外部监督的情况下,在基准测试上取得了高达+10.4分的提升。
自我对弈遇上技能进化:能提问、求解并记忆的自进化搜索代理
本文介绍了 SESA——一种自进化的技能增强搜索代理,它通过工具增强的搜索自我对弈,使任务生成和技能记忆共同进化。它在七个问答基准上相比基线提升了准确率,同时支持无需记忆的部署。