OmniOpt:现代优化器的分类体系、几何特性与基准测试
摘要
OmniOpt 提出了一个用于大规模模型训练中优化器选择的统一框架,该框架结合了元流水线变换、范数约束的线性最小化预言机以及跨领域基准,以系统分析优化器家族及其权衡。
查看缓存全文
缓存时间: 2026/07/07 06:42
论文页面 - OmniOpt:现代优化器的分类、几何与基准测试
来源:https://huggingface.co/papers/2607.04033 作者:
,
,
,
,
,
,
,
,
,
摘要
OmniOpt 提出了一种面向大规模模型训练的优化器选择统一框架,通过结合元流水线变换、范数约束线性最小化预言机以及跨领域基准测试,系统性地分析了不同优化器系列及其在多种训练目标和模型规模下的权衡取舍。
优化器选择 在 大规模模型训练 中已成为一种系统级的设计决策,受到计算、内存、调优预算和任务多样性的共同制约。然而,超过一百种方法的现有格局仍显零散。为此我们提出 OmniOpt,为研究社区提供一份统一的优化器综述与基准测试指南。OmniOpt 包含四个相互关联的组成部分。首先,我们将每次优化器更新视为经过五阶段 元流水线 的结构化变换,并表明大多数方法仅涉及其中一两个阶段。其次,我们利用 范数约束线性最小化预言机 (LMOs) 来统一不同的优化器。第三,这两种视角构成了一个双维分类体系:一个维度将每种方法归入特定的机制系列,另一个维度记录其旨在改进的可衡量 训练目标。第四,也是本文的核心,我们将完整的分类体系实例化到一个统一的 跨领域基准测试 中,涵盖具有代表性的优化器、模型规模 以及从语言模型预训练到图像分类的训练机制,系统分析每个方法系列在多个效果目标上的表现,并阐明其 权衡。通过 OmniOpt,研究社区获得了一套在明确机制和目标假设下选择优化器的操作坐标系统,并为优化器社区的未来发展指明了方向。
查看 arXiv 页面 查看 PDF 项目页面 GitHub5 添加到收藏
引用本文的模型0
暂无链接本文的模型
在模型 README.md 中引用 arxiv.org/abs/2607.04033 以从本页链接。
引用本文的数据集0
暂无链接本文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2607.04033 以从本页链接。
引用本文的空间0
暂无链接本文的 Space
在 Space README.md 中引用 arxiv.org/abs/2607.04033 以从本页链接。
包含本文的合集0
暂无包含本文的合集
将本文添加到合集中以从本页链接。
相似文章
optimize_anything:用于优化任意文本参数的通用API
本文介绍了optimize_anything,一个基于LLM的通用文本工件优化系统,在包括智能体架构发现、调度、CUDA内核生成和装箱在内的多种任务上取得了最先进的结果,展示了通用文本优化的能力。
乐观对偶平均化统一了现代优化器
本文介绍了 SODA,这是乐观对偶平均化的一种广义形式,统一了 Muon 和 Lion 等现代优化器。该研究提出了一种实用包装器,在不同规模下均可提升性能,且无需为权重衰减进行额外的超参数调优。
OmniPro:面向全主动流式视频理解的综合基准
OmniPro 是首个用于评估全模态大语言模型中主动流式视频理解的基准,包含 2,700 个样本,覆盖多种任务和双模式评估协议。
提升全模态语言模型:基于视觉去偏评估的分阶段后训练
本文提出了OmniClean,一个用于全模态语言模型的视觉去偏评估基准,并提出了OmniBoost,一种三阶段后训练方案,使得3B模型在清理后的基准上能够匹配30B模型的性能。
TriVAL: 一个用于忠实自动优化建模的三重验证框架
TriVAL 引入了一个三重验证框架,在自动优化建模的三个阶段(语义规范、数学公式、代码生成)执行显式验证以提高忠实性,并提出了 NL4COP,一个用于组合优化问题的新基准。