强化微调的动态重要样本挖掘
摘要
DIEM 提出了一种用于强化微调的动态框架,通过自适应选择和重加权训练样本来提升策略改进并稳定优化过程。
查看缓存全文
缓存时间: 2026/09/01 11:48
论文页面 - 强化微调中的动态重要样本挖掘
来源: https://huggingface.co/papers/2608.29252 作者:
,
,
,
,
,
,
,
,
,
,
摘要
DIEM 通过估计每个样本对策略改进的边际贡献,并在批量更新中施加约束以稳定优化过程,从而在强化微调过程中自适应地选择和重新加权训练样本。
强化微调(RFT)越来越多地被用于增强大型模型的推理能力,但其效果受制于训练数据的选择和使用方式。大多数以数据为中心的RFT方法依赖于静态或启发式的样本选择,隐含地假设样本的价值在训练过程中是固定的。这忽略了策略学习的非平稳动态特性,并可能导致次优的更新。我们提出了动态重要样本挖掘(DIEM),一个原理清晰且完全自动化的框架,使数据利用在整个RFT过程中自适应化。DIEM在每个优化步骤中整合了两个组件:(i) 一个基于梯度对齐的重要性估计器,用于高效近似每个样本对策略改进的边际贡献;以及 (ii) 一个受约束的批量重加权方案,在保持更新梯度幅度以稳定优化的同时,最大化整体效用。在多个推理基准测试中,DIEM持续优于强大的静态和动态基线。代码将通过 https://github.com/hrtan/DIEM 发布。
查看arXiv页面 (https://arxiv.org/abs/2608.29252) 查看PDF (https://arxiv.org/pdf/2608.29252) GitHub0 (https://github.com/hrtan/DIEM) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.29252)
在你的智能体中获取此论文:
hf papers read 2608.29252
没有最新版CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2608.29252,以从此页面链接到该模型。
引用此论文的数据集0
无数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2608.29252,以从此页面链接到该数据集。
引用此论文的Space0
无Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2608.29252,以从此页面链接到该Space。
包含此论文的合集0
无合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接到该合集。
相似文章
Diff Mining:逻辑值差异揭示微调目标
本文介绍了Diff Mining,一个通过分析微调模型和基础模型之间的逻辑值差异来识别语言模型中微调目标的框架,从而实现对学习行为的可解释审计。
动态自适应采样:用于数学推理的自感知迭代数据持久优化
SAI-DPO 引入了一个动态采样框架,在数学推理任务中根据模型不断演进的能力自适应调整训练数据,利用自感知难度指标和知识语义对齐在 AIME24 和 AMC23 等基准上以更少的数据实现最先进的效率。
AEM:用于多轮智能体强化学习的自适应熵调制
本文介绍了AEM,这是一种用于智能体强化学习的无监督方法,通过在响应级别自适应调整熵动态来改善探索与利用之间的平衡。通过在ALFWorld和SWE-bench等基准测试上展示性能提升,该方法将不确定性估计与动作粒度对齐。
Evolution Fine-Tuning: 跨371个优化任务学习发现
本文介绍了Evolution Fine-Tuning (EFT),这是一种中期训练范式,通过将进化搜索轨迹转化为监督信号,教会大语言模型跨优化任务进化解决方案。作者构建了包含156K条轨迹、涵盖371个任务的Finch Collection数据集,并证明微调后的模型能够泛化到保留任务,并在多个基准测试上达到最先进性能。
DRIFT: 解耦轨迹展开与重要性加权微调以实现高效多轮优化
本文提出DRIFT框架,该框架结合离线轨迹与重要性加权监督微调,高效实现与强化学习相当的多轮交互学习性能。