使用Product-Unit Residual Networks对非线性特征交互进行建模
摘要
本文介绍了Product-Unit Residual Networks(PURe),它将乘法乘积单元与残差连接相结合,显式建模非线性特征交互,相比标准MLP在准确性、鲁棒性和可解释性方面均有提升。
查看缓存全文
缓存时间: 2026/06/08 09:18
# 使用乘积单元残差网络建模非线性特征交互
来源: https://arxiv.org/html/2606.06861
11institutetext:科布伦茨应用科学大学数学、信息学与技术系,Joseph-Rovan-Allee 2, 53424 雷马根,德国
11email:{jaekel, dellen}@hs-koblenz.de22institutetext:慕尼黑工业大学,慕尼黑,德国
22email:[email protected]###### 摘要
理解非线性特征交互在科学和工程中至关重要,然而标准多层感知机(MLP)通常仅隐式地捕获此类交互,导致表征纠缠,从而可能损害鲁棒性和可解释性。我们研究了乘积单元残差网络(PURe),该网络将乘法乘积单元与残差连接相结合,以显式建模跨特征耦合,同时稳定优化过程。我们在一个以交互为驱动的合成基准和两个真实世界数据集上进行了系统评估,考察预测精度、对高斯特征噪声的鲁棒性以及在有限训练数据下的表现,并在匹配参数预算下比较了实数和复数变体。除了精度之外,基于SHAP(Shapley加法解释)的交互分析表明,PURe学习到的交互模式比MLP基线更集中且结构上更连贯。总体而言,PURe在数据稀缺场景下实现了具有竞争力或更优的性能、更好的鲁棒性和样本效率,并增强了交互层面的可解释性。
## 1 引言
对输入变量之间的非线性关系进行建模,是科学和工程回归任务中面临的基本挑战,包括物理系统建模、材料科学和社会经济预测问题。目标变量通常并非仅由单个特征决定,而是由多个因素之间的非线性交互共同决定。因此,准确捕获这些非线性特征交互对于实现可靠的预测和有意义的科学见解至关重要。
多层感知机网络(MLP)因其通用逼近能力和灵活的函数表示,已成为非线性回归的标准工具[3,18]。然而,其底层的加性组合通常导致特征交互的表征隐式且纠缠,这可能会限制泛化性能,尤其是在数据稀缺或高噪声场景下[17,22]。此外,传统神经网络学到的内部表征通常难以解释,这使得评估模型是否捕获了有意义的交互模式或是否学到了虚假相关性变得具有挑战性[15,14]。尽管最近的研究表明神经网络可以隐式编码统计特征交互,但此类交互通常是纠缠的,在没有明确结构约束的情况下难以解缠[19]。
为了解决这些局限性,基于乘积单元的乘法神经网络架构被提出作为一种替代建模范式[12,13,4,11,5,10,6]。通过显式编码乘法关系,乘积单元网络为建模科学数据中常见的非线性特征交互提供了自然的归纳偏置。尽管理论上表达能力很强,但乘积单元模型至今得到的关注有限,这可能是由于优化困难、对初始化敏感以及训练不稳定[10,5],这些问题在更深的架构中预计会尤其严重。
残差连接已被证明能够通过促进梯度流动和减少梯度消失效应,显著改善深度神经网络的优化和稳定性[9]。残差架构已成功应用于广泛的学习问题,包括具有复杂非线性结构的回归任务[20,1]。最近,有人提出了将残差连接与乘法乘积单元网络结合使用[13,12]。尽管结果令人鼓舞,但目前尚不清楚在针对显式交互建模时,残差连接如何影响预测性能、泛化行为和可解释性。
在本工作中,我们研究乘积单元残差网络(PURe),这是一类将乘法乘积单元与残差连接相结合的神经架构,旨在显式建模非线性特征交互,同时保持优化的稳定性。我们在合成和真实世界回归数据集上进行了系统的实证评估,分析预测精度、对噪声的鲁棒性以及在有限训练数据下的表现。此外,我们采用基于交互的分析来评估所提出的架构是否比标准MLP基线以更清晰的结构捕获了有意义的特征依赖关系。我们的结果表明,PURe在由复杂非线性关系主导的计算科学应用中,实现了具有竞争力的性能、增强的泛化能力和改进的可解释性,是一种有前景的建模框架。
## 2 相关工作
乘积单元神经网络被引入以显式编码输入特征之间的乘法交互[6]。给定输入向量x=(x_1,...,x_d),经典乘积单元的计算为
y = ∏_{i=1}^d x_i^{w_i}, (1)
其中w_i是与第i个输入相关的可学习指数。这种公式能够紧凑地表示高阶特征交互,否则可能需要更深的加法网络才能实现。
为了提高数值稳定性,乘积单元通常使用对数重参数化来实现[5]:
y = exp(∑_{i=1}^d w_i log x_i)。 (2)
这种对数-线性-指数形式突出了乘积单元的乘法归纳偏置,并在结构上将其与加性神经表征区分开来。尽管在表达能力上有优势,但先前的研究报告了优化困难和初始化敏感性问题,这大概限制了乘积单元网络在更深架构中的使用[5]。
乘积单元公式由于其实现中涉及对数变换,固有地限制为正值输入。为了适应有符号输入并实现对幅度和相位信息的联合建模,乘积单元表征已扩展到复数域[4,12]。对于复数输入z∈C^d,复数乘积单元可以定义为
y = exp(∑_{i=1}^d w_i log(z_i)),w_i∈C, (3)
其中复对数由log(z)=log|z|+i arg(z)给出。这种公式保留了乘法交互结构,同时实现了幅度和相位的联合建模,而这对于实数加法网络来说是难以实现的。现有关于复数值乘积单元的工作主要关注表征方面,对它们与现代深度架构组件的集成研究有限。
## 3 方法
### 3.1 乘积单元残差块
设h∈R^d为残差块的输入,其中d是隐藏维度。我们的实数值乘积单元残差块实现为一个三阶段变换后接一个恒等跳跃连接:
h_out = h + FC_2(PU(FC_1(h)))。 (4)
这里,FC_1和FC_2是从R^d到R^d的仿射映射(带偏置的线性层)。
给定中间向量a=FC_1(h)∈R^d,乘积单元映射通过一个强制正性的预处理进行计算,即
s = ReLU(a) + 1, ReLU(·)=max(·,0), (5)
其中1∈R^d表示全1向量,随后是对数-线性-指数计算:
PU(a) = exp(W_pu log(s)), (6)
这里W_pu∈R^{d×d}是一个可学习的权重矩阵(无偏置),log(·)和exp(·)按元素应用。我们采用s=ReLU(a)+1来确保s>0,从而log(s)定义良好且避免了零值因子。此外,加1提供了一个严格正的乘法门:当a_k≤0时,s_k=1作为中性元素(因为log 1=0),而当a_k>0时,其产生一个正缩放因子,使得PU能够调制交互而无符号歧义。
### 3.2 整体实数值网络
给定输入x∈R^p,网络首先将其映射到隐藏空间并应用逐元素的修正线性单元:
h^(0) = ReLU(FC_in(x))。 (7)
然后,依次应用两个残差块,即
h^(1) = B(h^(0)),h^(2) = B_0(h^(1)), (8)
其中B表示式(4)中的块,B_0表示相同块但采用零初始化以保持稳定性(详见实现细节)。最后,通过一个线性输出层产生预测:
ŷ = FC_out(h^(2))。 (9)
### 3.3 复数值乘积单元残差块
为了适应有符号输入并实现幅度和相位的联合建模,我们将该块扩展到复数域。设z∈C^d为复数值块的输入。块结构与实数值情况类似,即
z_out = z + FC_2^C(PU_C(FC_1^C(z)))。 (10)
给定a=FC_1^C(z),我们通过分别对实部和虚部进行修正并添加一个常数偏移进行数值稳定的预处理,得到
ã = (ReLU(ℜ(a)) + c) + i (ReLU(ℑ(a)) + c),c=√0.5, (11)
并计算
PU_C(a) = exp(W_pu^C log(ã)), (12)
其中W_pu^C∈C^{d×d}是一个复数值权重矩阵(无偏置),log(·)和exp(·)表示按元素应用的复对数与复指数。
## 4 实验
### 4.1 实验设置
我们在三个复杂度递增的回归基准上评估所提出的PURe,涵盖合成交互驱动数据、小规模真实世界工程数据和大规模社会经济数据。
*Friedman 1*是一个合成基准,旨在显式评估模型捕获非线性特征交互的能力[7]。它包含10个独立的输入特征,目标变量由已知的非线性交互通过特征子集生成:
y = 10 sin(π x_0 x_1) + 20 (x_2−0.5)^2 + 10 x_3 + 5 x_4 + ε, (13)
而其余特征作为噪声。该数据集包含10,000个样本,按70%训练、15%验证和15%测试划分。
*混凝土抗压强度*是一个真实世界工程数据集,涉及材料组成与抗压强度之间的非线性关系[21]。它包含8个物理和化学特征,共1,030个样本,按60%训练、20%验证和20%测试划分。
*加州房价*是一个大规模真实世界回归基准,基于美国人口普查数据,包含异质的社会经济和地理因素[16]。它包含8个输入特征和20,640个样本,按80%训练、10%验证和10%测试划分。
我们在相同的实验设置下评估了MLP和PURe的实数值和复数值变体。对于复数值模型,所有层在复数域中操作,最终预测通过对复数输出应用幅度运算以获得实值回归目标。这在此处是合适的,因为所有三个基准的目标均为非负。为了在模型容量上进行公平比较,我们考虑到每个复数参数对应两个实数值自由度。因此,实数值网络使用128的隐藏维度,而复数值网络使用64的隐藏维度,使得实数和复数架构的可训练参数总数相当。
所有模型使用均方误差损失进行训练,即
L = (1/N) Σ_{i=1}^N (y_i − ŷ_i)^2, (14)
其中y_i和ŷ_i分别表示真实目标和模型预测[2]。相似文章
Feature Interaction Modeling for Physics-Informed Neural Networks and Neural Operators
This paper introduces feature interaction modules based on factorization machines into physics-informed neural networks and neural operators (FM-PINN, FM-Operator, FM-DeepONet) to better capture spatio-temporal variable couplings for solving parameterized PDEs, showing accuracy gains particularly on shock-dominated equations.
门控循环单元中的乘积单元改进核质量预测
本文提出了一种新颖的复值门控循环单元(GRU)架构,结合乘法乘积单元(AM-PU-GRU),用于预测核质量,在原子质量评估数据集上实现了最先进的插值和外推精度。
从权重扰动到特征归因:解释全连接神经网络
提出一种基于权重扰动的特征归因方法(XWP和XWPc),用于全连接神经网络,在标准基线指标上取得了有竞争力的性能。
PRB-RUPFormer:一种用于残差PRB预测的递归统一概率Transformer
提出PRB-RUPFormer,一种递归统一概率Transformer,用于预测蜂窝网络中残差物理资源块,在商业LTE数据上实现了高精度和不确定性量化。
基于路径策略梯度的非短视主动特征获取
本文提出了 NM-PPG,这是一种利用路径策略梯度优化昂贵预测场景中顺序特征选择的非短视主动特征获取方法。