流形赌博机:基于大语言模型潜在几何的贝叶斯课程学习

Hugging Face Daily Papers 论文

摘要

介绍了一种名为 Bayesian Manifold Curriculum (BMC) 的自适应课程学习方法,用于大语言模型,该方法利用模型的潜在几何结构在不同问题类型之间分配训练资源,相比传统基于难度的课程学习提高了效率。

强化学习(RL)是提升大语言模型(LLM)推理能力的关键方法,训练效率在很大程度上取决于优化过程中如何采样问题。现有的自适应课程学习方法通常优先选择中等难度的提示,将问题选择视为独立的臂上的标准赌博机问题,忽略了任务空间的结构化和异质性。在这项工作中,我们将问题采样建模为一个具有内生非平稳性的流形结构赌博机问题:问题通过模型的潜在表示空间相互关联,采样决策可以引导学习信号在该空间中的演变方式。为了将这一视角付诸实践,我们引入了 Bayesian Manifold Curriculum (BMC),一种结构感知框架,它将问题组织成层次化任务树,并应用贝叶斯学习来指导采样。经验上,我们发现不同的采样策略在生产效率(学习信号)、多样性(任务流形覆盖)和实用性(评估相关性)之间产生了非平凡的权衡。这些结果表明,仅优先考虑难度不足以获得强大的下游性能,凸显了将结构和类型意识引入问题采样中的重要性。
查看原文
查看缓存全文

缓存时间: 2026/06/23 05:41

论文页面 - Manifold Bandits: 基于大型语言模型潜在几何的贝叶斯课程学习

来源:https://huggingface.co/papers/2606.19750

很高兴分享 Manifold Bandits。

在使用强化学习训练大型语言模型时,训练效率不仅取决于策略优化算法的强度,还取决于模型在训练各阶段所看到的问题。许多自适应课程学习方法关注难度:避免那些已经过于简单或仍然不可能的问题,选择模型当前处于“最佳学习区”的问题。

但难度并不是唯一重要的因素。

问题类型同样重要。正如大型语言模型可能不共享我们对难度的概念,它们也可能不共享我们对类型的概念。

任务分解通常根据人类语义手动定义,或者通过将整个数据集/领域视为“一个任务”而完全忽略。在这两种情况下,细粒度的结构可能会丢失:训练数据是异质的、不平衡的,并且由问题类型组成,这些类型的学习动态可能通过策略更新相互影响。

鉴于此,我们引入贝叶斯流形课程 (BMC):一种自适应课程学习方法,不仅迎合策略的能力,还迎合其感知,即:其潜在的任务组织。

BMC 从策略模型的潜在几何中构建潜在任务树,然后利用该几何来协调跨多样且相互交织的问题类型的训练。通过这样做,我们揭示了通常仅在难度或下游评估准确性评估课程时被隐藏的学习动态和权衡。

简而言之:我们不将课程学习仅仅视为寻找合适难度的问题,而是询问训练工作应如何在策略的潜在任务流形上分配。

项目页面 / 视觉导览:https://darrienmckenzie.com/manifold-bandits/

更详细的 X 线程即将推出:@darrienmckenzie (https://huggingface.co/darrienmckenzie)

相似文章

BayesBench: 多轮证据累积下LLM信念轨迹的评估

arXiv cs.AI

BayesBench评估了在多轮证据累积任务中,大语言模型的信念更新与贝叶斯推理的接近程度,发现虽然扩展规模能改善潜在推理,但模型难以将这种理解用于下游预测。

MLUBench: 多模态大语言模型终身遗忘评估基准

arXiv cs.AI

MLUBench 是一个大规模的多模态大语言模型终身遗忘基准,包含9个类别的127个实体。论文指出现有遗忘方法存在累积退化问题,并提出 LUMoE 来缓解此问题,显示出显著改进。