标签
本文介绍了一个基准测试,以验证LLMs中激活转向的分布驱动方法能够恢复与Schwartz理论一致的人类价值拓扑结构,这些方法随模型规模提升而改善,但在指令调优后有所下降。
介绍了一种名为 Bayesian Manifold Curriculum (BMC) 的自适应课程学习方法,用于大语言模型,该方法利用模型的潜在几何结构在不同问题类型之间分配训练资源,相比传统基于难度的课程学习提高了效率。
本文提出对齐潜在几何以实现球形流匹配,将潜在变量投影到固定半径的球面上,并使用球形线性插值来提升图像生成质量,在类条件ImageNet上持续改进FID。