OmniOpt:现代优化器的分类体系、几何特性与基准测试

Hugging Face Daily Papers 论文

摘要

OmniOpt 提出了一个用于大规模模型训练中优化器选择的统一框架,该框架结合了元流水线变换、范数约束的线性最小化预言机以及跨领域基准,以系统分析优化器家族及其权衡。

大规模模型训练中的优化器选择已成为一个受计算资源、内存、调优预算和任务多样性共同约束的系统级设计决策,然而,超过一百种方法的现状仍然分散。因此,我们提出 OmniOpt,这是一个为研究社区提供的统一优化器综述与基准测试指南。OmniOpt 基于四个相互关联的组件。首先,我们将每个优化器更新视为一个通过五阶段元流水线进行的结构化变换,并表明大多数方法仅涉及其中一两个阶段。其次,我们使用范数约束的线性最小化预言机(LMOs)来统一不同的优化器。第三,这两种观点构成了一个二维分类体系,其中一个维度将每个方法分配到一个机制家族,另一个维度记录其旨在改进的可测量训练目标。第四,也是本文的核心,我们在一个统一的跨领域基准中实例化了完整的分类体系,该基准涵盖从语言模型预训练到图像分类的代表性优化器、模型规模和训练范式,系统分析每个方法家族在多个效果目标上的表现,并阐述其权衡。OmniOpt 因此为研究社区提供了一个操作性的坐标系,用于在明确的机制和目标假设下选择优化器,并为优化器社区的未来发展指明了方向。
查看原文
查看缓存全文

缓存时间: 2026/07/07 06:42

论文页面 - OmniOpt:现代优化器的分类、几何与基准测试

来源:https://huggingface.co/papers/2607.04033 作者:

摘要

OmniOpt 提出了一种面向大规模模型训练的优化器选择统一框架,通过结合元流水线变换、范数约束线性最小化预言机以及跨领域基准测试,系统性地分析了不同优化器系列及其在多种训练目标和模型规模下的权衡取舍。

优化器选择大规模模型训练 中已成为一种系统级的设计决策,受到计算、内存、调优预算和任务多样性的共同制约。然而,超过一百种方法的现有格局仍显零散。为此我们提出 OmniOpt,为研究社区提供一份统一的优化器综述与基准测试指南。OmniOpt 包含四个相互关联的组成部分。首先,我们将每次优化器更新视为经过五阶段 元流水线 的结构化变换,并表明大多数方法仅涉及其中一两个阶段。其次,我们利用 范数约束线性最小化预言机 (LMOs) 来统一不同的优化器。第三,这两种视角构成了一个双维分类体系:一个维度将每种方法归入特定的机制系列,另一个维度记录其旨在改进的可衡量 训练目标。第四,也是本文的核心,我们将完整的分类体系实例化到一个统一的 跨领域基准测试 中,涵盖具有代表性的优化器、模型规模 以及从语言模型预训练到图像分类的训练机制,系统分析每个方法系列在多个效果目标上的表现,并阐明其 权衡。通过 OmniOpt,研究社区获得了一套在明确机制和目标假设下选择优化器的操作坐标系统,并为优化器社区的未来发展指明了方向。

查看 arXiv 页面 查看 PDF 项目页面 GitHub5 添加到收藏

引用本文的模型0

暂无链接本文的模型

在模型 README.md 中引用 arxiv.org/abs/2607.04033 以从本页链接。

引用本文的数据集0

暂无链接本文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2607.04033 以从本页链接。

引用本文的空间0

暂无链接本文的 Space

在 Space README.md 中引用 arxiv.org/abs/2607.04033 以从本页链接。

包含本文的合集0

暂无包含本文的合集

将本文添加到合集中以从本页链接。

相似文章

optimize_anything:用于优化任意文本参数的通用API

arXiv cs.CL

本文介绍了optimize_anything,一个基于LLM的通用文本工件优化系统,在包括智能体架构发现、调度、CUDA内核生成和装箱在内的多种任务上取得了最先进的结果,展示了通用文本优化的能力。

乐观对偶平均化统一了现代优化器

arXiv cs.LG

本文介绍了 SODA,这是乐观对偶平均化的一种广义形式,统一了 Muon 和 Lion 等现代优化器。该研究提出了一种实用包装器,在不同规模下均可提升性能,且无需为权重衰减进行额外的超参数调优。