标签
ERASE 引入了一种新颖的训练调度,通过分离子图将反向传播与前向工作重叠,在大规模推荐系统中将吞吐量提高高达 9.51%,同时保持模型性能。
作者认为,虽然工具使用使较小的语言模型能够有效执行任务,但较大的模型在速度、可靠性和内化知识方面仍然至关重要,强调在人工智能领域持续扩展规模的必要性。
本文介绍了一种受生物学启发的神经架构,该架构遵循Dale约束——神经元和突触具有固定符号——同时仍支持使用非负误差信号和局部Hebbian更新的类反向传播学习,并在Tiny ImageNet上取得了性能提升。
通过矩阵乘法手动演练一个3层网络的反向传播,展示从梯度到权重更新的全部11个步骤。
本文证明现代深度网络中预测编码(PC)使用的Jacobian转置乘积可以分解为局部可用的项,从而消除了自动求导反向传播的需要。提出的WF-Act-PC方法在CIFAR-10/100和Tiny-ImageNet上匹配甚至超越经过调优的反向传播基线,且性能随深度增加而提升。
本文逐步追踪了PyTorch的自动微分引擎如何为物理信息神经网络训练计算梯度,包括物理残差和参数梯度所需的两个层次的微分,并使用一个简单的MLP和ODE示例。
这条推文列出了机器学习工程师每天使用的7个基础数学概念,并简要强调了这些概念背后的推导过程,例如为什么梯度下降沿着最陡方向移动,以及为什么softmax加交叉熵会产生一个干净的梯度。
提出 K-ABENA 框架,一种选择性梯度计算框架,采用基于补偿损失的样本排除与无偏梯度估计,证明收敛保证,并在多种数据集上实现 28-54% 的计算节省且无性能下降。
本文展示了在宽度远大于深度的极限情况下,预测编码网络计算出与反向传播相同的梯度,从而在生物学习与标准神经网络训练之间架起桥梁。
本文提出了一种基于可扩展反向传播的算法,用于训练在热力学Ising硬件上运行的深度卷积网络,在CIFAR-10上达到94.9%的准确率,在CIFAR-100上达到76.0%的准确率,同时分析了推理成本与准确率之间的权衡。
一条推特串,列出了面试官期望候选人了解的13个核心机器学习概念,涵盖从偏差-方差权衡到维度灾难等主题。
Microcrad 用C语言重新实现了 Karpathy 的 micrograd 自动微分引擎,提供了一个教育性的标量值自动微分库,带有引用计数和小型神经网络,旨在帮助在标量层面理解反向传播。
本文提出了一个新皮层学习框架,满足计算、算法和实现三个层面的合理性标准,通过时间导数和皮层-丘脑回路实现基于错误驱动的预测学习,并指出了相对于反向传播的潜在改进。
本文诊断了基于梯度反演的Gray-Scott反应扩散系统的损失景观,表明直接反向传播由于平坦平台和陡峭悬崖而失败,而PINN组件(如残差损失)则平滑了景观。这些发现为PINN类方法提供了设计启示。
本文追踪了不同学习规则(反向传播、反馈对齐、预测编码、STDP)在训练过程中如何影响CNN表征与人类fMRI的对齐。研究发现反向传播在一个epoch内摧毁V1对齐,而局部规则则保持该对齐,这表明构建高级表征与保留早期视觉特征之间存在权衡。
斯坦福CS224N课程笔记清晰地介绍了神经网络中反向传播和梯度计算的数学原理,涵盖链式法则、计算图和向量化导数。
本文追踪了使用不同学习规则(反向传播、反馈对齐、预测编码、STDP)的监督训练如何降低神经网络表征与早期视觉皮层fMRI数据之间的对齐度,发现未训练的网络在V1对齐度上通常达到或超过训练后的网络。
Sakana AI 提出了 DiffusionBlocks,一种通过将前向传播解释为扩散去噪来分块训练神经网络的方法,与传统端到端反向传播相比,显著降低了内存需求。
本线程解释了雅可比矩阵背后的直觉及其在人工智能和机器学习中的广泛应用,包括反向传播、归一化流、计算机视觉和机器人技术。
本文介绍了通过分层高斯滤波器实现的闭式预测编码,该编码恢复了精度加权的预测误差,从而在没有全局误差信号的情况下实现更快、更高效的训练,并在某些任务上优于反向传播。