强化微调的动态重要样本挖掘

Hugging Face Daily Papers 论文

摘要

DIEM 提出了一种用于强化微调的动态框架,通过自适应选择和重加权训练样本来提升策略改进并稳定优化过程。

强化微调(RFT)越来越多地用于增强大模型的推理能力,但其效果受限于训练数据的选择和使用方式。大多数以数据为中心的RFT方法依赖于静态或启发式样本选择,隐含地假设样本价值在训练过程中是固定的。这忽略了策略学习的非平稳动态,可能导致次优的更新。我们提出了动态重要样本挖掘(DIEM),这是一个有原则且完全自动化的框架,使数据利用在整个RFT过程中自适应。DIEM在每个优化步骤中集成了两个组件:(i)一个梯度对齐重要性估计器,高效近似每个样本对策略改进的边际贡献;以及(ii)一个约束批量重加权方案,最大化聚合效用同时保持更新的梯度大小以稳定优化。在多个推理基准测试中,DIEM持续优于强大的静态和动态基线。代码将通过 https://github.com/hrtan/DIEM 发布。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:48

论文页面 - 强化微调中的动态重要样本挖掘

来源: https://huggingface.co/papers/2608.29252 作者:

,

,

,

,

,

,

,

,

,

,

摘要

DIEM 通过估计每个样本对策略改进的边际贡献,并在批量更新中施加约束以稳定优化过程,从而在强化微调过程中自适应地选择和重新加权训练样本。

强化微调(RFT)越来越多地被用于增强大型模型的推理能力,但其效果受制于训练数据的选择和使用方式。大多数以数据为中心的RFT方法依赖于静态或启发式的样本选择,隐含地假设样本的价值在训练过程中是固定的。这忽略了策略学习的非平稳动态特性,并可能导致次优的更新。我们提出了动态重要样本挖掘(DIEM),一个原理清晰且完全自动化的框架,使数据利用在整个RFT过程中自适应化。DIEM在每个优化步骤中整合了两个组件:(i) 一个基于梯度对齐的重要性估计器,用于高效近似每个样本对策略改进的边际贡献;以及 (ii) 一个受约束的批量重加权方案,在保持更新梯度幅度以稳定优化的同时,最大化整体效用。在多个推理基准测试中,DIEM持续优于强大的静态和动态基线。代码将通过 https://github.com/hrtan/DIEM 发布。

查看arXiv页面 (https://arxiv.org/abs/2608.29252) 查看PDF (https://arxiv.org/pdf/2608.29252) GitHub0 (https://github.com/hrtan/DIEM) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.29252)

在你的智能体中获取此论文:

hf papers read 2608.29252

没有最新版CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型的README.md中引用 arxiv.org/abs/2608.29252,以从此页面链接到该模型。

引用此论文的数据集0

无数据集链接此论文

在数据集的README.md中引用 arxiv.org/abs/2608.29252,以从此页面链接到该数据集。

引用此论文的Space0

无Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2608.29252,以从此页面链接到该Space。

包含此论文的合集0

无合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接到该合集。

相似文章

Diff Mining:逻辑值差异揭示微调目标

arXiv cs.LG

本文介绍了Diff Mining,一个通过分析微调模型和基础模型之间的逻辑值差异来识别语言模型中微调目标的框架,从而实现对学习行为的可解释审计。

AEM:用于多轮智能体强化学习的自适应熵调制

Hugging Face Daily Papers

本文介绍了AEM,这是一种用于智能体强化学习的无监督方法,通过在响应级别自适应调整熵动态来改善探索与利用之间的平衡。通过在ALFWorld和SWE-bench等基准测试上展示性能提升,该方法将不确定性估计与动作粒度对齐。

Evolution Fine-Tuning: 跨371个优化任务学习发现

arXiv cs.CL

本文介绍了Evolution Fine-Tuning (EFT),这是一种中期训练范式,通过将进化搜索轨迹转化为监督信号,教会大语言模型跨优化任务进化解决方案。作者构建了包含156K条轨迹、涵盖371个任务的Finch Collection数据集,并证明微调后的模型能够泛化到保留任务,并在多个基准测试上达到最先进性能。