@stanfordnlp:这太酷了!很快我们就能看到成熟的LLMs在摇篮里通过自我对弈来培养幼年的LLMs了!更严肃地说…
摘要
这篇文章介绍了零数据自我对弈预训练,这是一种研究方法,其中两个LLMs从随机初始化开始,通过一个生成器为通用图灵机提议程序来学习,展示了归纳偏置如何能够实现一般性学习。
查看缓存全文
缓存时间: 2026/09/25 22:47
这太酷了!不出多久,我们就能看到成熟的LLM在婴儿床里通过自我对弈来培育LLM宝宝学习了!
更严肃地说,这是一个很好的例证,说明通用的归纳偏置如何能成为更普适的世界学习能力的“通用语法”。
Michael Y. Li (@michaelyli_): 一个语言模型,从随机初始化状态开始,能否学会生成其全部预训练数据?
介绍零数据自博弈预训练。两个模型从随机初始化开始:一个生成器为通用图灵机提出程序,一个学习者在其基础上进行训练。
相似文章
@yoheinakajima:另一件事,稍后阅读,看看能否理解
该推文介绍了一种名为 Self-Play Pretraining with Zero Data 的研究概念,其中两个模型从随机初始化开始,通过在通用图灵机上进行自对弈生成预训练数据。
G-Zero:从零数据开始的无界生成自博弈方法
本文介绍了 G-Zero,这是一个无需验证器的框架,通过基于内在奖励和提示引导的协同进化训练,实现大型语言模型的自主自我改进。旨在通过从内部分布动态中推导监督信号,克服代理 LLM 评判者在无界任务中的局限性。
自我对弈帮助AI在围棋中达到超人类水平,那么为何对LLM未能如此?研究人员找到了解决方案。
研究人员引入了自导自对弈(Self-Guided Self-Play, SGS),这是一种用于LLM的自我对弈算法,通过使用指引角色(Guide)对合成问题进行评分来防止奖励作弊(reward hacking)。应用于Lean4中的定理证明时,SGS超越了强化学习基线,并使7B模型胜过671B模型。
PopuLoRA: 用于推理自我博弈的LLM种群协同进化
PopuLoRA 提出了一种基于种群的非对称自我博弈框架,用于 LLM 的 RLVR 后训练。在该框架中,教师和学生 LoRA 适配器协同进化,生成日益复杂的问题,从而克服了单智能体自我博弈的自我校准限制。
LLMZero:通过LLM智能体发现强化学习后训练的自适应训练策略
LLMZero利用LLM智能体通过树搜索在训练轨迹中进行搜索,发现用于强化学习后训练的自适应多参数过渡策略,该策略在多种任务中优于固定调度和网格搜索。