AC-ODM: Actor-Critic在线数据混合方法用于样本高效的大语言模型预训练

Hugging Face Daily Papers 论文

摘要

AC-ODM 使用强化学习动态优化大语言模型的预训练数据组成,实现了更快的收敛速度和更高的下游任务准确率,且计算开销可忽略不计。

优化预训练数据的组成对大语言模型的泛化能力至关重要。尽管动态混合方法通过捕捉不断变化的训练动态优于静态策略,但目前的方法无法在计算效率、样本效率和结构灵活性之间取得平衡,以适应多样化的训练流程。 我们提出了Actor-Critic在线数据混合方法(AC-ODM),该方法从强化学习的角度处理数据混合,使用参数化策略,我们理论上证明该策略充当动态线性替代,最大化梯度的建设性干扰。为增强实际灵活性,AC-ODM 支持两种操作模式:(i) 代理模式,用于固定的、预先准备好的语料库,将在小模型上学习到的策略迁移到更大的目标模型;(ii) 非代理模式,用于从头开始进行直接的端到端训练,无需先验知识。 实验证明,AC-ODM 在各种架构的收敛速度和下游准确率方面显著优于先前的方法。在 Pythia-1B 上,它使用比竞争基线少 66% 的训练步骤达到了最优验证困惑度,在 MMLU 准确率上实现了 27.5% 的相对提升,在 HumanEval 上的 pass@1 提高了 2.23 倍,同时每步的挂钟时间仅增加了可忽略不计的 0.4%,额外内存开销仅为 2%。代码可在 https://github.com/DANG-ai/AC-ODM 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/23 17:43

论文页面 - AC-ODM: Actor–Critic Online Data Mixing for Sample-Efficient LLM Pretraining

来源:https://huggingface.co/papers/2505.23878

摘要

AC-ODM 利用强化学习优化LLM的预训练数据组成,以提高收敛速度和下游准确性,同时保持计算效率。

优化预训练数据组成 (https://huggingface.co/papers?q=pretraining%20data%20composition) 对于LLM泛化 (https://huggingface.co/papers?q=LLM%20generalization) 至关重要。虽然动态混合 (https://huggingface.co/papers?q=dynamic%20mixing) 通过捕捉不断变化的训练动态优于静态策略 (https://huggingface.co/papers?q=static%20strategies),但当前方法未能协调计算效率与样本效率以及针对多样化管线的结构灵活性。我们引入 Actor–Critic Online Data Mixing (AC-ODM),该方法从强化学习 (https://huggingface.co/papers?q=reinforcement%20learning) 视角处理数据混合,采用参数化策略 (https://huggingface.co/papers?q=parameterized%20policy),我们理论上证明该策略可作为动态线性替代,最大化梯度的建设性干扰 (https://huggingface.co/papers?q=constructive%20interference)。为了增强实际灵活性,AC-ODM支持两种操作模式:(i) 代理模式 (https://huggingface.co/papers?q=proxy%20mode),用于固定的预准备语料库,在小模型上学习的策略迁移到更大的目标;(ii) 非代理模式 (https://huggingface.co/papers?q=non-proxy%20mode),用于从零开始直接端到端训练,无需先验。经验上,AC-ODM在各种架构上在收敛速度 (https://huggingface.co/papers?q=convergence%20speed) 和下游准确性 (https://huggingface.co/papers?q=downstream%20accuracy) 方面显著优于先前方法。在 Pythia-1B (https://huggingface.co/papers?q=Pythia-1B) 上,它比竞争基线使用多达66%的更少训练步骤达到最佳验证困惑度 (https://huggingface.co/papers?q=validation%20perplexity),在 MMLU 准确率 (https://huggingface.co/papers?q=MMLU%20accuracy) 上提升了27.5%,在 HumanEval (https://huggingface.co/papers?q=HumanEval) 上 pass@1 (https://huggingface.co/papers?q=pass%401) 提高了2.23倍,同时每个步骤的墙上时钟几乎可忽略地增加了0.4%,内存开销仅增加2%。代码可在 https://github.com/DANG-ai/AC-ODM 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2505.23878) 查看 PDF (https://arxiv.org/pdf/2505.23878) 项目页面 (https://github.com/DANG-ai/AC-ODM) GitHub1 (https://github.com/DANG-ai/AC-ODM) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2505.23878)

在您的代理中获取本论文:

hf papers read 2505.23878

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

没有与此论文关联的模型

在模型 README.md 中引用 arxiv.org/abs/2505.23878 以从本页面链接。

引用本论文的数据集0

没有与此论文关联的数据集

在数据集 README.md 中引用 arxiv.org/abs/2505.23878 以从本页面链接。

引用本论文的空间0

没有与此论文关联的空间

在空间 README.md 中引用 arxiv.org/abs/2505.23878 以从本页面链接。

包含本论文的收藏集0

无收藏集包含本论文

将本论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

大语言模型预训练的数据混合:综述与展望

arXiv cs.CL

# 大语言模型预训练的数据混合:综述与展望 来源:[https://arxiv.org/abs/2604.16380](https://arxiv.org/abs/2604.16380) [查看 PDF](https://arxiv.org/pdf/2604.16380) > 摘要:大型语言模型(LLMs)依赖于在海量且异构的语料上进行预训练,在现实中的计算和数据预算限制下,训练数据的构成对训练效率和下游泛化能力有着决定性的影响。与样本级的数据选择不同,数据混

始终学习,始终混合:高效简单的全时数据混合

arXiv cs.CL

本文介绍了OP-Mix,一种数据混合算法,它利用在当前模型上训练的低秩适配器来廉价模拟候选数据混合,从而在预训练、持续中间训练和持续指令微调中实现高效统一的数据混合。OP-Mix 始终能找出接近最优的混合方案,而计算量仅为基线方法的一小部分;在预训练中将平均困惑度提升了6.3%,在持续学习场景中减少了66-95%的计算量。

ProactiveLLM: 学习主动交互的流式大语言模型

arXiv cs.CL

ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。

使用ART微调多模态大语言模型:基于艺术强化训练

Hugging Face Daily Papers

ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。