标签
一篇通俗易懂的解释,说明为什么Transformer需要位置编码,用bug报告类比和Python的Counter来演示并行处理如何丢失词序。
重点介绍了一篇引入 ZeRO(零冗余优化器)的文章,这是一种内存优化系统,用于在有限的 GPU 内存上高效训练超大规模模型。
斯坦福大学CS230深度学习(2025年秋季)课程播放列表已在YouTube上分享,可免费观看讲座。
本文提出了一种以设备为中心的框架,利用基于深度学习的视觉和事件驱动有限状态机在热锻工厂中定位工件,在运行环境中实现了高检测精度和低延迟。
本文识别了多变量时间序列直接预测中的目标差距,并提出CvLoss,一种即插即用的结构正则化器,它在跨变量图上约束预测残差,以提高同步和异步交互之间的一致性。实验表明,相对于有竞争力的预测模型,它带来了一致的改进。
This paper introduces Matrix Zonotopic Attention (MZAttn), a context-adaptive value projection for set transformers, and provides a theoretical analysis showing it can represent target operators that standard attention requires depth to approximate. Experiments demonstrate performance gains on high-rank combinatorial set-prediction tasks.
本文介绍了 Unscented KalmanNet (UKN),一种混合深度学习滤波器,它通过可学习组件增强无迹卡尔曼滤波器,在未知噪声统计和模型失配下提高状态估计精度和协方差校准。实验表明,与 UKF 和其他 KalmanNet 变体相比,RMSE 显著降低。
CAMP 引入了一种用于时间序列预测的周期感知多尺度补丁混合器,通过自适应周期学习和预测时域引导的补丁细化,在多个基准上取得了最先进的结果。
This paper introduces NeuMoSync, a novel architecture that integrates neuron-specific neuromodulatory signals into deep neural networks to improve plasticity and adaptability in continual learning, demonstrating strong performance across multiple benchmarks.
ENCODE GRAMMAR 是一种用于解码人类基因组中调控元件DNA序列逻辑的深度学习模型资源,附带一系列博客文章,涵盖模型访问、解释和应用。
一篇研究论文,评估了CNN-BiLSTM模型CHAP在可穿戴加速度计数据中分类久坐行为的表现,重点关注从髋部到腕部佩戴位置的迁移以及微调的好处。
本文介绍了一种对比不变的深度叠层衍射神经网络,利用分解策略将学习到的物体纹理与测量缩放解耦,从而在不同光照条件下实现一致的图像重建。该方法在多个实验数据集上,与之前的PtychoPINN-torch基线相比,傅里叶误差最多降低了5倍。
本文介绍了GLOBE,一种轨迹对齐的核心集选择框架,它利用跨多个检查点的梯度轨迹和多阶匹配与结构化稀疏优化来选择紧凑且具有代表性的训练子集,在六个基准上优于现有方法。
This paper unifies Euclidean residual connections and geodesic normalization on the hypersphere, introducing a one-parameter family of angular retractions called p-SpheretNorm. The proposed norm-preserving algebraic methods outperform existing deep connection schemes on nanoGPT, showing the exponential map is just one end of a spectrum.
本文提出了一种多表征深度学习框架,结合CNN、LSTM和递归图分析来表征脆性X综合征中的α和γ脑电生物标志物,相较于单模态基线方法,分类性能得到提升。
DSETA是一种用于行程时间预测的双阶段持续学习框架,将日内实时自适应与跨日长期趋势学习分离。在线A/B测试显示,在三个城市中MAE均有降低,并已成功部署于DiDi的生产环境。
本文提出了一种面向机器遗忘的保留感知定位方法,可减少对语义相似保留样本的附带损害,并引入了一个保留相似性评估集。在CIFAR-10上的ResNet18实验表明,该方法减少了附带损害并改善了遗忘指标。
This paper analyzes the Virtual Cell Challenge benchmark for held-out CRISPRi perturbation prediction, finding that simple magnitude-based scalar features outperform deep MLP encoders, and that magnitude-only predictors transfer better across cell types.
首尔国立大学的深度学习CNN模型比NOAA基于物理的模型提前数月预报了一次极强厄尔尼诺事件,并随着模型收敛而得到验证。该AI还预测2028年将转为拉尼娜,远超传统预报期限。
一篇 13 步的可视化讲解,解释 Switch Transformer 的工作原理,涵盖稀疏混合专家路由,以及为什么 GPT-4、Claude、DeepSeek-V3 和 Kimi 等模型使用这种架构来保持高效。