深度线性网络中的非线性计算
摘要
# 深度线性网络中的非线性计算 来源:[https://openai.com/index/nonlinear-computation-in-deep-linear-networks/](https://openai.com/index/nonlinear-computation-in-deep-linear-networks/) `` ``` 1x = tf.placeholder(dtype=tf.float32, shape=[batch_size,784]) 2y = tf.placeholder(dtype=tf.float32, shape=[batch_size,10]) 34w1 = tf.Variable(np.random.normal(scale=np.sqrt(2./784),size=[784,512]).astype(np.float32)) 5b1 = tf.Variable(np.zeros(512,dtype=np.float32)) 6w2 = tf.Variable(np.random
查看缓存全文
缓存时间: 2026/04/20 14:56
相似文章
线性表示是如何学习的?抽象动态过程的精确解
本文构建了一个框架,研究线性概念表示在神经网络训练过程中如何涌现,在线性网络中提供精确解,并分析非线性网络中的抽象动态过程。结果揭示了控制抽象的关键原则,并为可解释性和控制提供了启示。
即插即用脉冲算子:突破脉冲Transformer中的非线性瓶颈
本文提出一种即插即用框架,通过LIF神经元的种群计算和轻量级位移缩放,实现Transformer非线性(如Softmax、SiLU、归一化)的脉冲友好近似,在无需微调的LLMs上准确率下降不到1%。
@AnimaAnandkumar: 神经算子 – 将流行神经网络转换为神经算子用于科学建模 扩展神经网…
本文提出了将流行神经网络架构(CNNs、GNNs、Transformers)转换为神经算子的原则性方法,这些神经算子学习无限维函数空间之间的映射,使得在不同离散化下进行科学建模时能够获得一致的预测。发表于《Nature Machine Intelligence》。
@AnimaAnandkumar: 这是我们自开始研究神经算子以来一直在强调的一点。我们很快就从简单的...
Anima Anandkumar 强调,尽管基准测试简单,但神经算子在像高分辨率 AI 天气预报模型 (FourCastNet) 和核聚变湍流这样的困难实际问题上实现了巨大加速(10,000 到百万倍)。她引用了一篇新论文,表明随着 PDE 任务难度的增加,学习型求解器变得更加经济高效。
重新思考神经非线性:门控机制
本文提出阈值门控(TG)作为神经非线性的统一原语,表明标准激活函数可以表示为TG的实例。作者通过将预训练模型在各种架构间转换而不进行重新训练来验证其方法,并讨论了硬件优势。