AC-ODM: Actor-Critic在线数据混合方法用于样本高效的大语言模型预训练
摘要
AC-ODM 使用强化学习动态优化大语言模型的预训练数据组成,实现了更快的收敛速度和更高的下游任务准确率,且计算开销可忽略不计。
查看缓存全文
缓存时间: 2026/06/23 17:43
论文页面 - AC-ODM: Actor–Critic Online Data Mixing for Sample-Efficient LLM Pretraining
来源:https://huggingface.co/papers/2505.23878
摘要
AC-ODM 利用强化学习优化LLM的预训练数据组成,以提高收敛速度和下游准确性,同时保持计算效率。
优化预训练数据组成 (https://huggingface.co/papers?q=pretraining%20data%20composition) 对于LLM泛化 (https://huggingface.co/papers?q=LLM%20generalization) 至关重要。虽然动态混合 (https://huggingface.co/papers?q=dynamic%20mixing) 通过捕捉不断变化的训练动态优于静态策略 (https://huggingface.co/papers?q=static%20strategies),但当前方法未能协调计算效率与样本效率以及针对多样化管线的结构灵活性。我们引入 Actor–Critic Online Data Mixing (AC-ODM),该方法从强化学习 (https://huggingface.co/papers?q=reinforcement%20learning) 视角处理数据混合,采用参数化策略 (https://huggingface.co/papers?q=parameterized%20policy),我们理论上证明该策略可作为动态线性替代,最大化梯度的建设性干扰 (https://huggingface.co/papers?q=constructive%20interference)。为了增强实际灵活性,AC-ODM支持两种操作模式:(i) 代理模式 (https://huggingface.co/papers?q=proxy%20mode),用于固定的预准备语料库,在小模型上学习的策略迁移到更大的目标;(ii) 非代理模式 (https://huggingface.co/papers?q=non-proxy%20mode),用于从零开始直接端到端训练,无需先验。经验上,AC-ODM在各种架构上在收敛速度 (https://huggingface.co/papers?q=convergence%20speed) 和下游准确性 (https://huggingface.co/papers?q=downstream%20accuracy) 方面显著优于先前方法。在 Pythia-1B (https://huggingface.co/papers?q=Pythia-1B) 上,它比竞争基线使用多达66%的更少训练步骤达到最佳验证困惑度 (https://huggingface.co/papers?q=validation%20perplexity),在 MMLU 准确率 (https://huggingface.co/papers?q=MMLU%20accuracy) 上提升了27.5%,在 HumanEval (https://huggingface.co/papers?q=HumanEval) 上 pass@1 (https://huggingface.co/papers?q=pass%401) 提高了2.23倍,同时每个步骤的墙上时钟几乎可忽略地增加了0.4%,内存开销仅增加2%。代码可在 https://github.com/DANG-ai/AC-ODM 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2505.23878) 查看 PDF (https://arxiv.org/pdf/2505.23878) 项目页面 (https://github.com/DANG-ai/AC-ODM) GitHub1 (https://github.com/DANG-ai/AC-ODM) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2505.23878)
在您的代理中获取本论文:
hf papers read 2505.23878
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
没有与此论文关联的模型
在模型 README.md 中引用 arxiv.org/abs/2505.23878 以从本页面链接。
引用本论文的数据集0
没有与此论文关联的数据集
在数据集 README.md 中引用 arxiv.org/abs/2505.23878 以从本页面链接。
引用本论文的空间0
没有与此论文关联的空间
在空间 README.md 中引用 arxiv.org/abs/2505.23878 以从本页面链接。
包含本论文的收藏集0
无收藏集包含本论文
将本论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
大语言模型预训练的数据混合:综述与展望
# 大语言模型预训练的数据混合:综述与展望 来源:[https://arxiv.org/abs/2604.16380](https://arxiv.org/abs/2604.16380) [查看 PDF](https://arxiv.org/pdf/2604.16380) > 摘要:大型语言模型(LLMs)依赖于在海量且异构的语料上进行预训练,在现实中的计算和数据预算限制下,训练数据的构成对训练效率和下游泛化能力有着决定性的影响。与样本级的数据选择不同,数据混
始终学习,始终混合:高效简单的全时数据混合
本文介绍了OP-Mix,一种数据混合算法,它利用在当前模型上训练的低秩适配器来廉价模拟候选数据混合,从而在预训练、持续中间训练和持续指令微调中实现高效统一的数据混合。OP-Mix 始终能找出接近最优的混合方案,而计算量仅为基线方法的一小部分;在预训练中将平均困惑度提升了6.3%,在持续学习场景中减少了66-95%的计算量。
@songhan_mit: 探索简化 OPD 以高效进行 LLM 后训练:
本文介绍了一种简化 OPD 以实现大语言模型高效后训练的方法。
ProactiveLLM: 学习主动交互的流式大语言模型
ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。
使用ART微调多模态大语言模型:基于艺术强化训练
ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。