标签
本文在大型语言模型的多奖励强化学习中识别出聚合引发的奖励黑客行为,并提出一种自适应投影方法 AMRP,以动态调整权重,实现更好的奖励平衡和性能。
本文提出LA-ReduNet,一种轻量级自适应架构,该架构采用超球面流形学习和自适应步长,以显著减少神经网络中MCR2目标所需的层数,并用更少的参数实现相当的分类准确率。
本文介绍了一种用于量子化学的自适应即时多保真度机器学习算法,该算法能够自主确定不同保真度下的训练数据组成,与单保真度方法相比,数据生成成本降低高达30倍,与标准多保真度方法相比降低高达5倍。