GFT:基于无偏群组优势与动态系数修正,从模仿迈向奖励微调

Hugging Face Daily Papers 论文

摘要

# 论文页面 - GFT:基于无偏群组优势与动态系数修正,从模仿迈向奖励微调 来源:[https://huggingface.co/papers/2604.14258](https://huggingface.co/papers/2604.14258) ## 摘要 Group Fine-Tuning 通过利用多样化的回复群组和自适应权重边界来解决监督微调的局限性,从而提升训练稳定性与效率。大语言模型通常在后训练中使用[监督微调](https://hug

大语言模型通常在后训练阶段采用监督微调(SFT)与强化学习(RL),但如何有效统一高效的知识注入与鲁棒泛化仍是一项挑战。本文通过对训练动态的分析表明,SFT 可被视为一种带有极度稀疏隐式奖励与不稳定逆概率加权的策略梯度优化特例,这两者共同导致了单路径依赖、熵崩溃与梯度爆炸。基于这一诊断,我们提出了 Group Fine-Tuning(GFT),一种统一的后训练框架,通过两种机制解决这些内在局限:Group Advantage Learning,其构建多样化的回复群组并导出归一化对比监督以缓解奖励稀疏性;以及 Dynamic Coefficient Rectification,其通过自适应地约束逆概率权重来稳定优化,同时保留高效的知识注入。实验表明,GFT 始终优于基于 SFT 的方法,并能得到与后续 RL 训练更平滑衔接的策略。
查看原文
查看缓存全文

缓存时间: 2026/04/21 07:20

论文页面 - GFT:基于无偏群体优势与动态系数修正的从模仿到奖励微调

来源:https://huggingface.co/papers/2604.14258

摘要

群体微调通过使用多样化的回复组与自适应权重边界来解决监督微调的局限性,从而提升训练稳定性与效率。

大语言模型通常在后训练阶段使用监督微调(SFT)和强化学习(RL)进行训练,但如何有效统一高效的知识注入与稳健的泛化能力仍然充满挑战。在本研究中,我们通过对训练动态的分析表明,SFT 可被解读为具有极度稀疏隐式奖励与不稳定逆概率加权策略梯度优化之特例,这些因素共同导致了单路径依赖熵坍缩梯度爆炸。基于这一诊断,我们提出了群体微调(GFT),一个统一的后训练框架,通过两种机制解决这些固有缺陷:群体优势学习,通过构建多样化的回复组并导出归一化的对比监督以缓解奖励稀疏性;以及动态系数修正,通过自适应地限定逆概率权重以稳定优化,同时保持高效的知识注入。实验表明,GFT 始终优于基于 SFT 的方法,并能生成与后续 RL 训练更平滑融合的策略。

查看 arXiv 页面查看 PDF项目页面GitHub添加到合集

在您的智能体中获取这篇论文:

hf papers read 2604\.14258

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型 0

暂无模型引用该论文

在模型的 README.md 中引用 arxiv.org/abs/2604.14258 以从此页面建立链接。

引用该论文的数据集 1

OmniAI-ZJU/NuminaMath-Cot-Distillation-100K 约 18 小时前更新 (https://huggingface.co/datasets/OmniAI-ZJU/NuminaMath-Cot-Distillation-100K)

引用该论文的 Space 0

暂无 Space 引用该论文

在 Space 的 README.md 中引用 arxiv.org/abs/2604.14258 以从此页面建立链接。

包含该论文的合集 0

暂无合集包含该论文

将此论文添加到合集以从此页面建立链接。

相似文章

论SFT的泛化:强化学习视角与奖励修正

Papers with Code Trending

本文从强化学习的视角分析了标准监督微调(SFT)的局限性,并提出了一种简单的梯度重新缩放方法——动态微调(DFT),该方法提高了LLM的泛化能力,并与离线RL性能相匹配。

GAC: 噪声感知的自适应混合用于混合SFT-RL后训练

arXiv cs.LG

本文提出了GAC,一种用于大型语言模型混合SFT-RL后训练的噪声感知自适应混合控制器。它推导出一个闭式混合权重,平衡梯度噪声与SFT-RL分歧,在多个基准测试中取得一致的改进,且额外开销极小。

目标条件监督学习用于LLM微调

arXiv cs.LG

本文提出了目标条件监督学习(GCSL)作为LLM的离线微调框架,该方法将反馈作为显式目标,通过一种新颖的目标公式和自然语言目标表示,使用监督学习训练模型。在无毒生成、代码生成和LLM推荐三个任务上的评估显示,该方法优于标准的离线基线方法。