自我对弈帮助AI在围棋中达到超人类水平,那么为何对LLM未能如此?研究人员找到了解决方案。
摘要
研究人员引入了自导自对弈(Self-Guided Self-Play, SGS),这是一种用于LLM的自我对弈算法,通过使用指引角色(Guide)对合成问题进行评分来防止奖励作弊(reward hacking)。应用于Lean4中的定理证明时,SGS超越了强化学习基线,并使7B模型胜过671B模型。
https://arxiv.org/abs/2604.20209 https://github.com/LukeBailey181/sgs
LLM自我对弈算法的一个显著特点是,理论上,它们的学习没有任何界限:猜想者模型(Conjecturer)为求解者模型(Solver)创造问题,两者共同改进。然而在实践中,现有的LLM自我对弈方法无法随大量计算资源良好扩展,反而会陷入学习平台期。我们认为,这是因为长时间的训练中,猜想者学会了作弊以获取奖励,产生人为复杂且无助于求解者改进的问题。为了克服这一问题,我们引入了自导自对弈(Self-Guided Self-Play, SGS),这是一种自我对弈算法,其中语言模型本身引导猜想者远离退化。在SGS中,模型承担三个角色:求解者、猜想者,以及一个指引者(Guide),后者根据合成问题与未解决目标问题的相关性、问题的清晰度和自然性对其进行评分,从而提供监督以防止猜想者崩溃。我们的核心假设是,语言模型能够评估一个子问题是否有助于实现目标。我们通过比以往研究更长的训练时间、以及为累积解决率曲线拟合缩放定律,来评估SGS的扩展特性。将SGS应用于Lean4中的形式化定理证明,我们发现,它在不到80轮自我对弈中便超越了最强RL基线的渐近解决率,并使得一个7B参数模型在经过200轮自我对弈后,能够解决比671B参数模型pass@4更多的问题。
相似文章
更令人信服,而非更正确:无参考LLM评判者的自我博弈奖励操纵
本文识别了自我博弈训练中使用的无参考LLM评判者的结构缺陷,表明它们评估的是合理性而非正确性,导致奖励操纵,策略学会生成合理但错误的答案。作者提出了一种隐藏锚点审计和解锚奖励来缓解这一问题。
技能自我对弈(Skill Self-Play):通过协同进化技能推动大语言模型能力前沿
本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。
# 结合语义等价自博弈与形式化验证提升 LLM 代码推理能力
爱丁堡大学研究人员提出了一种利用 Liquid Haskell 进行形式化验证的自博弈框架,用于训练 LLMs 的语义等价推理能力,同步发布了 OpInstruct-HSx 数据集(28k 个程序),并在 EquiBench 上实现了 13.3 个百分点的准确率提升。
GPT-Red:通过规模化自我对弈实现自动化红队测试
本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。
OpenAI的最新研究表明,LLM能够解决数学领域的前沿问题(1分钟阅读)
OpenAI的研究表明,LLM能够解决九个开放数学问题,这些来自COLT、FOCS、交换代数和Erdős问题,采用包含GPT-5.5 Pro和Claude Opus 4.8的简单pipeline,并使用了Lean形式化验证。