追逐即课程,捕捉锚定奖励:面向零数据LLM推理的追逐-逃避自我对弈
摘要
LURE引入了一种用于LLM推理的零数据自我对弈框架,该框架使用追逐-逃避游戏来动态调整任务难度并提供密集奖励,在多种环境中超越基线。
arXiv:2608.21871v1 公告类型:新
摘要:具有可验证奖励的强化学习已成为提升大型语言模型推理的主流方法,但它依赖于大量人工整理的任务集合。零数据自我对弈消除了这一依赖,但现有方法仅通过探测候选任务来评估可学习性并在事后拒绝,从未学习在环境难度轴上放置任务的位置,并且仅给求解器提供稀疏终端奖励。我们将零数据自我对弈重塑为一个追逐-逃避游戏:在LURE中,一个LLM逃避者沿每个环境的难度轴放置任务,以领先于通过可验证交互追捕它的规划-执行追逐者一步。逃避者基于捕捉前沿奖励进行训练,当求解器在其一半的回合中捕捉到它时,该奖励达到峰值,从而将勉强可捕捉转变为一种学习到的定位策略,而非手动调整的拒绝带。追逐者获得捕捉锚定的密集过程奖励,其中单调验证器进展与终端捕捉在回合锚定的KL散度下进行组归一化,以保持共同进化稳定。在三种可验证推理环境和三种骨干网络族中,LURE在统一/专门设置下超越了先进基线,而统一模型在来自三个任务家族的九个保留基准上,获得了比所有训练基线更强的聚合OOD零样本准确率。
查看缓存全文
缓存时间: 2026/08/25 04:21
The request was rejected because it was considered high risk
相似文章
更令人信服,而非更正确:无参考LLM评判者的自我博弈奖励操纵
本文识别了自我博弈训练中使用的无参考LLM评判者的结构缺陷,表明它们评估的是合理性而非正确性,导致奖励操纵,策略学会生成合理但错误的答案。作者提出了一种隐藏锚点审计和解锚奖励来缓解这一问题。
重新思考大语言模型推理中的强化学习:关键在于稀疏策略选择,而非能力学习
本文挑战了强化学习(RL)能为大语言模型(LLM)教授新推理能力的假设,论证其作用实则是在高熵决策点进行稀疏策略选择。本文提出了 ReasonMaxxer,这是一种无需强化学习的方法,以显著更低的训练成本实现了与完整强化学习相当的性能。
CHASE:基于强化学习的对抗性红蓝对抗提升大语言模型安全性
CHASE 提出了一种共同进化的红蓝对抗框架,利用强化学习增强大语言模型对自适应黑盒对抗攻击的防御能力,在基准测试中将越狱成功率降低43.2%,同时在对良性提示的误拒率保持为零。
从LLM推理轨迹中提取搜索树揭示了其规划中的短视现象
本研究分析了大语言模型(LLM)在“四子连珠”游戏中的推理轨迹,发现LLM表现出短视规划特征:其表现主要取决于浅层的搜索广度,而非深层的预判能力,这与人类专家的规划方式截然不同。
LLM-as-a-Tutor:面向不可验证强化学习的策略感知提示自适应
LLM-as-a-Tutor提出了一种框架,通过成对比较和添加约束动态调整提示难度,将LLM的角色从评判者扩展为导师,从而提升强化学习中的指令跟随性能。