为什么以及何时神经网络能改进优化中的局部近似
摘要
本文通过识别三个关键因素——角色、半径和空间——来解决在无导数优化中使用神经网络的矛盾,这些因素决定了学习到的局部模型何时能在仿真优化中提升性能。
arXiv:2608.24963v1 公告类型:新
摘要:无导数优化中神经代理模型的已知经验存在矛盾:同一个模型家族能减少某个求解器的评估次数,却对另一个求解器无效,甚至使其变差。我们表明,一旦明确三个因素,这种矛盾就会消失,而且这些因素,而不是训练曲线报告的拟合精度,决定了学习到的局部模型何时有益。角色:提出候选方案但需真实目标验证的代理有帮助,而替代求解器依赖的梯度的代理有害。半径:拟合于优化路径的模型仅在其有界邻域内可靠,其误差在该邻域缩小时不会消失,在增长时也不会持续。空间:代理只能加速基础方法仍能实现的进展。我们将半径感知的局部泛化形式化,并将其与经典的完全线性条件联系起来,在代理类别、训练流程和基础方法固定的情况下测试每个因素。在117个基准实例上,受保护的辅助将高精度解决的实例从67个提高到84个,而梯度替换则降低到65个;从训练损失中移除梯度项使代理接受率从0.703降至0.148;在十个噪声水平上的1000次配对比较显示没有噪声阈值,只有过早停止的基础方法。同样的因素限制了增益:一个基于模型的信赖域求解器,在附加相同代理时,从88降至86,而发布的插值软件以103保持领先;在Monte-Carlo库存模型上,修复接受界面价值10.40成本单位,而代理为0.00。
查看缓存全文
缓存时间: 2026/08/27 09:29
# 神经网络为何以及何时能改善优化中的局部近似 来源:https://ar.org/html/2608.24963 Chengkuo Bian†† †† 作者单位:美国加州大学伯克利分校,邮编94720。邮箱:[email protected]。 Pengcheng Xie†† †† 通讯作者。劳伦斯伯克利国家实验室应用数学与计算研究部,加州大学,1回旋加速器路,伯克利,CA 94720,美国。邮箱:[email protected], [email protected]。 2026年8月 ###### 摘要 以往在无导数优化中使用神经代理模型的经验是矛盾的:同一族模型既能减少一个求解器的评估次数,也可能对另一个求解器毫无作用甚至使其变差。我们表明,一旦明确三个因素,这种矛盾便不复存在。这三个因素,而非训练曲线所报告的拟合精度,决定了学习型局部模型何时能发挥作用。 **角色**:当代理模型仅负责提出候选点,而真实目标函数仍需对其进行确认时,它会有所帮助;但若它替代了求解器所依赖的梯度信息,则会产生损害。 **半径**:一个在优化路径上拟合的模型仅在有界邻域内可靠,其误差既不会在该邻域缩小时消失,也不会在其扩大时持续存在。 **空间**:代理模型只能加速基础方法本身仍能取得的进展。 我们形式化了“半径感知局部泛化”概念,将其与经典的全线性条件联系起来,并在保持代理模型类别、训练流程和基础方法固定的前提下对每个因素进行了测试。在117个基准测试实例上,有保障的协助将高精度求解的实例数从67提升至84,而梯度替换则将其降至65;从训练损失中移除梯度项使代理模型的接受率从0.703降至0.148;在十个噪声水平上进行的1000次配对比较显示不存在噪声阈值,只有过早停止的基础方法。同样的因素也限制了收益:一个基于模型的信赖域求解器在附加相同代理模型后,其求解实例数从88降至86,而发布的插值软件Py-BOBYQA仍以103个实例保持领先。在一个蒙特卡洛库存模型上,修复接受界面的价值为10.40成本单位,而代理模型本身的价值为0.00。 关键词:仿真优化;无导数优化;代理元模型;神经网络;Sobolev训练;随机预言机;局部泛化;数据分布剖面图。 ## 1 引言 我们考虑无约束最小化问题 \min_{x\in\mathbb{R}^{n}}f(x), (1) 其中函数f的每次取值来自一次仿真运行,而非解析公式,且无法获得导数信息。这是基于仿真的优化中的标准情形:在候选设计x处执行排队、库存、基于主体或物理模型,优化器能看到的只有由此产生的性能度量。仿真运行缓慢,因此问题的“货币”是评估次数。无导数优化(DFO)正是为此而生的分支;Conn等人的专著[1]以及综述[2, 3, 5]涵盖了该领域。一次优化运行会留下记录:访问过的点、它们的仿真值、有效的步长,以及过程中通过有限差分计算出的任何梯度。利用一个廉价的元模型拟合该记录并用以引导搜索,是仿真文献中的旧思路,而神经网络是现代元模型的自然选择。 我们应首先说明结论的落点,因为标题提出了两个问题,且它们有不同的答案。 *为何*学习型模型能改善局部近似是较容易的那个:拟合运行中已支付的所有评估次数,可以平均掉有限差分所放大的噪声,而训练损失中的梯度信息则抑制了仅基于函数值的拟合可能自由臆造的曲率。两种效应都是可测量的:从损失中移除梯度项,会使代理步在验证中的存活率降低近五倍。 *何时*这种更好的近似能转化为优化进展是更难的问题。近似质量是先决条件但非充分条件;决定其能否转化为更少评估次数的是我们通过经验识别出的三个因素。其中两个是周围算法的属性:代理模型的角色,以及基础方法留下的空间——下文将其分为未使用的余地及其接受测试是否仍然有效。第三个因素是方法工作所处的半径,它是从求解器操作尺度上解读拟合所得到的属性,因此并非独立于近似质量,但也不是训练曲线所报告的内容。任何一个因素失效,更好的局部模型都不会成为更好的优化器,这在第9.6节的蒙特卡洛模型上表现得最为尖锐。定位这个边界是本文的结果,而非附加的注意事项。 在DFO方法中,基于模型的信赖域算法构成了最成功的框架之一。这些方法构建局部代理模型,并通过在信赖域内近似最小化模型来计算试验步。经典的多项式插值模型及其理论基础已经很成熟[4, 1, 5]。由Powell的NEWUOA[6]开创并通过后续模型更新策略[7]完善的欠定二次插值,构成了实用求解器的基础。基于有限差分的方法提供了另一条路径,其实际性能在近期研究中得到了重新评估[8, 9]。 尽管取得了这些进展,经典的基于模型的方法在高维设置中面临根本性限制。由于参数数量的增长,构建和维护多项式模型变得越来越昂贵,并且插值的质量严重依赖于样本集的几何形状。在实践中,有限且可能带有噪声的数据会导致脆弱的模型和不可靠的步长。这些挑战与维数灾难密切相关,并促使人们探索更丰富的近似类和基于学习的代理模型。神经网络(NN)为经典的代理模型提供了一种灵活的替代方案。利用平滑的激活函数,神经网络可以近似函数值和梯度,同时隐式地执行噪声平滑和特征提取。然而,最近的研究揭示了一幅微妙的图景。Giovannelli等人表明,尽管神经网络代理模型可以达到很强的函数值和梯度近似精度,但在捕捉二阶信息方面可能表现不佳,并且在直接替换拟牛顿更新中的有限差分梯度时,不一定会提高优化性能[10]。相反,Taminiau等人证明,当以保障方式使用时(即代理步仅在真实目标函数充分下降时才被接受),神经网络可以显著提高性能[12];相关的学习增强设计包括[13]中的神经网络加速隐式滤波。这些相反的发现表明,神经网络代理模型的有效性取决于其嵌入算法的方式,而不仅仅是近似精度。 从理论角度看,代理模型在信赖域方法中的作用受均匀近似性质支配,例如全线性和全二次条件[1]。虽然多项式模型在适当的采样几何下可以满足这些条件,但对于学习型代理模型——尤其是神经网络——何时能实现类似保证,目前仍知之甚少。神经近似理论的最新进展提供了部分见解。例如,目标值变化和基于形状的视角提供了超越经典插值误差来刻画局部近似质量的新方法[14]。此外,插值几何与鲁棒性之间的关系,包括Λ-鲁棒性和数据不规则性,已在[15]中进行了探索。这些发展表明,应结合近似理论、数据几何和算法集成来分析基于学习的代理模型。 另一个重要维度是可扩展性和应用背景。现代优化问题常涉及大规模系统、分布式环境和黑盒流水线,从基于仿真的设计到隐私受限和不确定性感知环境的各种应用,对数据访问、噪声和计算成本施加了自己的约束[2]。这些趋势进一步推动了将基于学习的代理模型以原则性和可扩展的方式集成到DFO框架中。 ##### 核心论点。本文围绕一个论点组织: > *神经网络代理模型能否改善DFO方法,主要取决于(i)代理模型嵌入的算法角色——是替换基础方法的核心量还是提供有保障的协助,以及(ii)该方法是否在代理模型的可靠局部泛化半径内运作,第三个因素则源于实验:基础方法是否还有未完成的空间。逐点近似精度本身对优化效益的预测性很差。* 该论点解释了上述分歧。在替换模式下,代理模型中的误差会直接进入求解器作用的量中,进而影响其搜索方向和曲率估计。在协助模式下,同样的误差会被对真实目标函数的测试过滤掉,而代理模型无法伪造这个测试。论点中关于半径的部分同样具体:一个在优化路径上少数点拟合的模型,仅在有界区域内准确,而一个在大于该区域尺度上工作的求解器,无论模型如何拟合其训练数据,都会被误导。 贡献如下: 1. **三个必要条件**:学习型局部模型仅在以下情况下才能改进优化:其角色是协助而非替换,工作半径位于其泛化区域内,且基础方法仍有评估预算。我们故意违反其中两个并观察到收益消失:替换模式的效果降至基础方法以下(65 vs 67);一个已无空间的基础方法无法获得任何收益。第三个条件在近似层面建立。 2. **量化效应与边界**:在117个实例上,有保障的协助将其基础方法高精度求解的实例数从67提升至84,占基准的六分之一,且随着容差收紧,差距增大。发布的Py-BOBYQA求解了103个实例,且在中位数上低了两个数量级,因此该效应是真实的,但尚未达到最先进水平。Extended Wood是例外,我们将其作为存在性结果而非规律报告。 3. **ARAS,其收敛定理与可计算的门限相关**:混合方向被证明是下降方向,且一旦混合权重由(1−θ)/(1+κ_k)(即框架已计算的门限统计量)界定,该方法便被证明继承基础方法的O(nε^{−2})复杂度。运行它表明混合步的代价超过了其回报,这与另一方面的校准结果一致,因此基准测试使用的是框架的存活实例。 4. **半径感知局部泛化**:建立了连接样本覆盖与训练误差到全线性条件的初等均匀误差界。 5. **三个自我纠正而非隐藏的问题**:在n=64处出现的交叉点是我们自身插值代码的缺陷,两个被提出又被否决的几何诊断,以及在早期版本中贯穿使用但被证明训练不足的网络设置(相当于117个实例中的九个)。 6. **关于参考集的警告**:将代理模型变体相互评分时,协助模式优于基于模型的方法;但加入已发布的求解器后,排序会逆转。一个省略已发布软件的Moré-Wild比较只衡量了其自身池。 在所有这一切之前,有一个注意事项比埋在实验部分更应突出:这是一项机制研究,而非求解器论文。我们比较的每个变体共享同一个网络类别、同一个训练流程和同一个基础方法,正是为了确保两者之间的差异可归因于我们变动的机制,而非实现细节;这种设计的代价是,没有一个变体被调校到具有竞争力。然而,这种设计并不能免除我们追问代理模型的效益是否仅仅修复了一个薄弱的基础方法,因此第9.2节增加了一个newuoa类型[6, 1]的基于模型的信赖域求解器,并直接回答了这个问题。结果大致如此:仅强求解器就优于有限差分方法上的协助模式,而将相同的代理模型附加到强求解器上则毫无增益。我们报告这一点,因为它强化而非削弱了论点。代理模型提供的是基础方法自身无法取得的进展,因此其价值应通过它所弥合的差距来衡量,而非模型的精度。 两个范围决定如下: 评估次数,而非秒数,是本研究的货币:一次评估是指这些实验背景下的模型运行,因此我们报告的墙钟时间数据来自未经优化的纯NumPy实现,旨在定位盈亏平衡的预言机成本,而非对算法进行排序。维度选择较小是故意的:一次隔离一个机制意味着在每个实例上运行每个变体,这在n≤16时可以穷举完成,在n=128时仅运行一次。 第2至6节通过角色区分重新解读两项源头研究,第7节精确化半径概念,第8节给出嵌入方式和ARAS,第9节为实验,第10至11节为后续结论。 ## 2 背景与问题设定 我们考虑无约束黑盒优化问题 \min_{x\in\mathbb{R}^{n}}f(x), (2) 其中目标函数评估代价高昂,且导数信息不可用、不可靠或计算成本过高。在这种背景下,核心问题不仅是如何构建f的局部近似,更是如何将该近似嵌入优化循环。这种区分对于神经网络代理模型尤为重要:一个能很好拟合局部数据的模型,如果以脆弱的方式使用,仍可能无法改进优化方法。 ### 2.1 基于模型的优化 一种标准方法...
相似文章
无限维空间上的分辨率一致贪婪神经近似
本文为具有无限维输入的浅层神经网络模型开发了构造性近似和学习保证,将误差分离为坐标截断、网络宽度和样本大小组件,以实现统一的理论分析。
用于高效期权定价模型的具有局部收敛输入的神经网络
本文介绍了局部收敛输入神经网络(NNLCI),用于加速基于PDE的期权定价,结合粗网格和细网格解,在多资产Black–Scholes和Heston模型中将RMSE降低4–12倍。
分叉附近的状态空间NTK坍缩
本文发展了动力模型分叉附近梯度下降的局部理论,表明状态空间神经正切核坍缩为秩一算子,主导学习动力学,使优化有效低维且可从规范形式预测。
非线性算子及其导数的通用逼近
本文证明了在无限维空间中非线性算子及其导数的首个通用逼近定理,将经典结果扩展到DeepONet和PCA-Net等算子学习架构。
本地模型是否比预期更快变得“足够好”?
这篇文章讨论了本地AI模型在日常任务中日益增长的可行性,暗示了向混合架构的转变,这种架构优化成本和延迟,而不是仅仅依赖前沿的云模型。