标签
TriPLU 为微型仅解码器语言模型引入了直接三线性积前馈网络,展示了在低计算环境下验证损失优于 SwiGLU 的结果。
一项可重复性研究揭示了在Pre-LN Transformer中移除残差连接时产生的非对称效应:移除注意力跳跃导致崩溃,而移除FFN跳跃在较小规模下允许部分恢复。
The paper introduces DUD (Decoupled Update Dynamics), a framework that separates Feed-Forward Network and Attention contributions via causal interventions to improve uncertainty quantification and calibration in large language models, outperforming state-of-the-art baselines.
本文研究使用符号回归发现显式神经网络权重更新规则,这些规则在小型符号回归基准上优于标准手工设计的优化器,在30个基准/网络组合中的25个上实现了44.47%的聚合MSE降低。
本文研究了长上下文检索中FFN残差写入的符号性质,发现FFN写入根据层和任务的不同起到抑制或放大作用,并提出了一种基于梯度的诊断方法来区分这两种角色。
本文评估了Kolmogorov--Arnold网络(KAN)作为可解释组件以及Transformer前馈网络在小语言模型中的替代方案,发现虽然KAN提供了实用的审计接口,但与MLP基线相比,它们并未显示出持续一致的基准优势。