标签
本文将个性化偏好学习形式化为一种几何对齐的优化问题,并提出了一种迭代算法 GAP-DPO,该算法在效用感知的基础上进行梯度对齐的偏好对选择,相比标准 DPO 变体,在风格保真度和偏好对齐方面均表现出提升。
本文介绍了梯度对齐奖励(GAR),一种通过与专家解决方案对齐梯度来增强大语言模型推理强化学习的方法,在数学和一般基准测试中显示出改进。
本文介绍了LoRA-GA$^2$,这是一种微调算法,它利用多步梯度信息来提升大型语言模型的低秩适应性能,在基准测试中取得更好的结果,同时保持效率。
本文研究了长上下文检索中FFN残差写入的符号性质,发现FFN写入根据层和任务的不同起到抑制或放大作用,并提出了一种基于梯度的诊断方法来区分这两种角色。
提出了一种用于随机优化的动量-梯度对齐更新策略MGUP,可实现层内选择性参数更新。该策略能与AdamW、Lion和Muon等优化器无缝集成,在提供理论收敛保证的同时,在大型模型训练任务中展现出卓越性能。
GRASP提出一种多源迁移学习方法,顺序合并源模型到单个目标模型,内存占用恒定O(1),使用基于梯度的参数对齐避免负迁移。实验表明其性能优于集成方法且内存效率更高。
本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。