流形赌博机:基于大语言模型潜在几何的贝叶斯课程学习
摘要
介绍了一种名为 Bayesian Manifold Curriculum (BMC) 的自适应课程学习方法,用于大语言模型,该方法利用模型的潜在几何结构在不同问题类型之间分配训练资源,相比传统基于难度的课程学习提高了效率。
查看缓存全文
缓存时间: 2026/06/23 05:41
论文页面 - Manifold Bandits: 基于大型语言模型潜在几何的贝叶斯课程学习
来源:https://huggingface.co/papers/2606.19750
很高兴分享 Manifold Bandits。
在使用强化学习训练大型语言模型时,训练效率不仅取决于策略优化算法的强度,还取决于模型在训练各阶段所看到的问题。许多自适应课程学习方法关注难度:避免那些已经过于简单或仍然不可能的问题,选择模型当前处于“最佳学习区”的问题。
但难度并不是唯一重要的因素。
问题类型同样重要。正如大型语言模型可能不共享我们对难度的概念,它们也可能不共享我们对类型的概念。
任务分解通常根据人类语义手动定义,或者通过将整个数据集/领域视为“一个任务”而完全忽略。在这两种情况下,细粒度的结构可能会丢失:训练数据是异质的、不平衡的,并且由问题类型组成,这些类型的学习动态可能通过策略更新相互影响。
鉴于此,我们引入贝叶斯流形课程 (BMC):一种自适应课程学习方法,不仅迎合策略的能力,还迎合其感知,即:其潜在的任务组织。
BMC 从策略模型的潜在几何中构建潜在任务树,然后利用该几何来协调跨多样且相互交织的问题类型的训练。通过这样做,我们揭示了通常仅在难度或下游评估准确性评估课程时被隐藏的学习动态和权衡。
简而言之:我们不将课程学习仅仅视为寻找合适难度的问题,而是询问训练工作应如何在策略的潜在任务流形上分配。
项目页面 / 视觉导览:https://darrienmckenzie.com/manifold-bandits/
更详细的 X 线程即将推出:@darrienmckenzie (https://huggingface.co/darrienmckenzie)
相似文章
模型何时该改变想法?大语言模型中的情境信念管理
本文介绍了面向大语言模型的情境信念管理(CBM)以处理长期信息,提出了用于评估的BeliefTrack基准,并展示了强化学习和表示层面引导显著减少了信念管理失败。
基于Branched Neural Rough Differential Equations的流形与It\^o动力学学习
本文介绍了一种名为Branched Neural Rough Differential Equations的方法,该方法通过结合粗糙路径理论与神经网络来学习流形和Itô动力学,从而能够对复杂的随机和几何结构进行建模。
缓解流形偏离:面向可信MLLM解码的不确定性感知子空间矫正
本文介绍了MGAP,一种无需训练的解码方法,通过自适应地仅抑制语言先验中的有害部分,同时保留模型的语义流形,从而减少多模态大语言模型中的幻觉。该方法在POPE和CHAIR基准测试上优于先前的基线方法。
BayesBench: 多轮证据累积下LLM信念轨迹的评估
BayesBench评估了在多轮证据累积任务中,大语言模型的信念更新与贝叶斯推理的接近程度,发现虽然扩展规模能改善潜在推理,但模型难以将这种理解用于下游预测。
MLUBench: 多模态大语言模型终身遗忘评估基准
MLUBench 是一个大规模的多模态大语言模型终身遗忘基准,包含9个类别的127个实体。论文指出现有遗忘方法存在累积退化问题,并提出 LUMoE 来缓解此问题,显示出显著改进。