GFT:基于无偏群组优势与动态系数修正,从模仿迈向奖励微调
摘要
# 论文页面 - GFT:基于无偏群组优势与动态系数修正,从模仿迈向奖励微调 来源:[https://huggingface.co/papers/2604.14258](https://huggingface.co/papers/2604.14258) ## 摘要 Group Fine-Tuning 通过利用多样化的回复群组和自适应权重边界来解决监督微调的局限性,从而提升训练稳定性与效率。大语言模型通常在后训练中使用[监督微调](https://hug
查看缓存全文
缓存时间: 2026/04/21 07:20
论文页面 - GFT:基于无偏群体优势与动态系数修正的从模仿到奖励微调
来源:https://huggingface.co/papers/2604.14258
摘要
群体微调通过使用多样化的回复组与自适应权重边界来解决监督微调的局限性,从而提升训练稳定性与效率。
大语言模型通常在后训练阶段使用监督微调(SFT)和强化学习(RL)进行训练,但如何有效统一高效的知识注入与稳健的泛化能力仍然充满挑战。在本研究中,我们通过对训练动态的分析表明,SFT 可被解读为具有极度稀疏隐式奖励与不稳定逆概率加权的策略梯度优化之特例,这些因素共同导致了单路径依赖、熵坍缩与梯度爆炸。基于这一诊断,我们提出了群体微调(GFT),一个统一的后训练框架,通过两种机制解决这些固有缺陷:群体优势学习,通过构建多样化的回复组并导出归一化的对比监督以缓解奖励稀疏性;以及动态系数修正,通过自适应地限定逆概率权重以稳定优化,同时保持高效的知识注入。实验表明,GFT 始终优于基于 SFT 的方法,并能生成与后续 RL 训练更平滑融合的策略。
查看 arXiv 页面查看 PDF项目页面GitHub添加到合集
在您的智能体中获取这篇论文:
hf papers read 2604\.14258
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
暂无模型引用该论文
在模型的 README.md 中引用 arxiv.org/abs/2604.14258 以从此页面建立链接。
引用该论文的数据集 1
OmniAI-ZJU/NuminaMath-Cot-Distillation-100K 约 18 小时前更新 (https://huggingface.co/datasets/OmniAI-ZJU/NuminaMath-Cot-Distillation-100K)
引用该论文的 Space 0
暂无 Space 引用该论文
在 Space 的 README.md 中引用 arxiv.org/abs/2604.14258 以从此页面建立链接。
包含该论文的合集 0
暂无合集包含该论文
将此论文添加到合集以从此页面建立链接。
相似文章
论SFT的泛化:强化学习视角与奖励修正
本文从强化学习的视角分析了标准监督微调(SFT)的局限性,并提出了一种简单的梯度重新缩放方法——动态微调(DFT),该方法提高了LLM的泛化能力,并与离线RL性能相匹配。
@maximelabonne: 这真是太棒了!动态微调(DFT)根据模型自身的 token 概率重新加权 SFT 损失,这产生了一个……
动态微调(DFT)被介绍为一种方法,它利用模型自身的 token 概率重新加权 SFT 损失,形成一个反馈循环,并添加前向KL散度来惩罚那些基础模型认为很可能但策略已将其推向零概率的 token。这条推文对实际应用中的SFT论文表示怀疑,但赞赏这一尝试。
GAC: 噪声感知的自适应混合用于混合SFT-RL后训练
本文提出了GAC,一种用于大型语言模型混合SFT-RL后训练的噪声感知自适应混合控制器。它推导出一个闭式混合权重,平衡梯度噪声与SFT-RL分歧,在多个基准测试中取得一致的改进,且额外开销极小。
目标条件监督学习用于LLM微调
本文提出了目标条件监督学习(GCSL)作为LLM的离线微调框架,该方法将反馈作为显式目标,通过一种新颖的目标公式和自然语言目标表示,使用监督学习训练模型。在无毒生成、代码生成和LLM推荐三个任务上的评估显示,该方法优于标准的离线基线方法。
@LakshyAAAgrawal: 从丰富的文本反馈(错误、轨迹、部分推理)中学习,对于LLM优化来说,优于仅使用标量奖励。…
快速-慢速训练(FST)将上下文优化(通过GEPA)与通过强化学习进行的模型权重更新交替进行,在数学、代码和物理推理上实现了比单独使用RL高3倍的样本效率,同时保持了可塑性并实现了持续学习。