标签
本文提出了GUPO,一种梯度不确定性感知策略优化方法,通过使用贝叶斯方法建模梯度不确定性来处理组间梯度冲突,从而改进大语言模型的后训练。
这篇文章推广了《机器学习之前 第三卷:人工智能的概率与统计》一书,该书通过 Antwerp Diamond Heist 的叙事来教授人工智能的统计概念,如贝叶斯推理和马尔可夫链,并附有实用的代码示例。
CalibratedRubric是一个任务自适应框架,用于为开放式LLM评估构建紧凑且可测量的评分标准库,通过贝叶斯可测量性过滤和基于IRT的选择,在金融、医疗、通用和法律基准上提升人类-金标准一致性和排序保真度。
本文提出BayesPO,一种使用梯度引导离散MCMC与并行回火的贝叶斯提示优化框架,在指令归纳任务上提升了准确率。
介绍了一种名为 Bayesian Manifold Curriculum (BMC) 的自适应课程学习方法,用于大语言模型,该方法利用模型的潜在几何结构在不同问题类型之间分配训练资源,相比传统基于难度的课程学习提高了效率。