追逐即课程,捕捉锚定奖励:面向零数据LLM推理的追逐-逃避自我对弈

arXiv cs.CL 论文

摘要

LURE引入了一种用于LLM推理的零数据自我对弈框架,该框架使用追逐-逃避游戏来动态调整任务难度并提供密集奖励,在多种环境中超越基线。

arXiv:2608.21871v1 公告类型:新 摘要:具有可验证奖励的强化学习已成为提升大型语言模型推理的主流方法,但它依赖于大量人工整理的任务集合。零数据自我对弈消除了这一依赖,但现有方法仅通过探测候选任务来评估可学习性并在事后拒绝,从未学习在环境难度轴上放置任务的位置,并且仅给求解器提供稀疏终端奖励。我们将零数据自我对弈重塑为一个追逐-逃避游戏:在LURE中,一个LLM逃避者沿每个环境的难度轴放置任务,以领先于通过可验证交互追捕它的规划-执行追逐者一步。逃避者基于捕捉前沿奖励进行训练,当求解器在其一半的回合中捕捉到它时,该奖励达到峰值,从而将勉强可捕捉转变为一种学习到的定位策略,而非手动调整的拒绝带。追逐者获得捕捉锚定的密集过程奖励,其中单调验证器进展与终端捕捉在回合锚定的KL散度下进行组归一化,以保持共同进化稳定。在三种可验证推理环境和三种骨干网络族中,LURE在统一/专门设置下超越了先进基线,而统一模型在来自三个任务家族的九个保留基准上,获得了比所有训练基线更强的聚合OOD零样本准确率。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:21

The request was rejected because it was considered high risk

相似文章