gradient-alignment

标签

Cards List
#gradient-alignment

面向个性化偏好优化的梯度对齐偏好对选择

arXiv cs.AI ↗ · 18小时前 缓存

本文将个性化偏好学习形式化为一种几何对齐的优化问题,并提出了一种迭代算法 GAP-DPO,该算法在效用感知的基础上进行梯度对齐的偏好对选择,相比标准 DPO 变体,在风格保真度和偏好对齐方面均表现出提升。

0 人收藏 0 人点赞
#gradient-alignment

梯度所知,结果未知:通过梯度对齐奖励解锁大语言模型推理的强化学习

arXiv cs.LG ↗ · 2026-09-04 缓存

本文介绍了梯度对齐奖励(GAR),一种通过与专家解决方案对齐梯度来增强大语言模型推理强化学习的方法,在数学和一般基准测试中显示出改进。

0 人收藏 0 人点赞
#gradient-alignment

强化微调的动态重要样本挖掘

Hugging Face Daily Papers ↗ · 2026-08-29 缓存

DIEM 提出了一种用于强化微调的动态框架,通过自适应选择和重加权训练样本来提升策略改进并稳定优化过程。

0 人收藏 0 人点赞
#gradient-alignment

LoRA-GA$^2$: 低秩适应与多步梯度自适应对齐

arXiv cs.CL ↗ · 2026-08-21 缓存

本文介绍了LoRA-GA$^2$,这是一种微调算法,它利用多步梯度信息来提升大型语言模型的低秩适应性能,在基准测试中取得更好的结果,同时保持效率。

0 人收藏 0 人点赞
#gradient-alignment

超越记忆:长上下文检索中任务条件化的符号化FFN写入

arXiv cs.LG ↗ · 2026-07-21 缓存

本文研究了长上下文检索中FFN残差写入的符号性质,发现FFN写入根据层和任务的不同起到抑制或放大作用,并提出了一种基于梯度的诊断方法来区分这两种角色。

0 人收藏 0 人点赞
#gradient-alignment

MGUP:一种用于随机优化的动量-梯度对齐更新策略

arXiv cs.LG ↗ · 2026-06-17 缓存

提出了一种用于随机优化的动量-梯度对齐更新策略MGUP,可实现层内选择性参数更新。该策略能与AdamW、Lion和Muon等优化器无缝集成,在提供理论收敛保证的同时,在大型模型训练任务中展现出卓越性能。

0 人收藏 0 人点赞
#gradient-alignment

GRASP: 梯度对齐顺序参数迁移——面向内存高效的多源学习

arXiv cs.LG ↗ · 2026-06-16 缓存

GRASP提出一种多源迁移学习方法,顺序合并源模型到单个目标模型,内存占用恒定O(1),使用基于梯度的参数对齐避免负迁移。实验表明其性能优于集成方法且内存效率更高。

0 人收藏 0 人点赞
#gradient-alignment

揭秘同策略蒸馏:其益处、危害及原因

Hugging Face Daily Papers ↗ · 2026-05-11 缓存

本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈