标签
一位YouTube创作者在休整期后回归,教授从零开始构建分布式训练框架,专注于DeepSeek、MoE和MLA等高级AI主题,并强调培养解决问题的能力和自信心。
RecurrentGPT引入了一种递归深度Transformer,它使用门控调制来迭代重用共享层,与标准Transformer相比,以更少的参数实现了竞争性的准确性并提高了内存效率。
本文介绍了Wiola,一个具有13M参数的仅解码器语言模型,采用螺旋旋转位置编码和门控螺旋注意力等新组件,以提升小型设备端语言模型的参数效率。
本文介绍了full-bandwidth transformers,它利用潜在反馈来增强自回归模型,允许未表达的计算重新进入堆栈,从而以可忽略的解码开销提高性能。
FLARE++ 是一种低秩注意力架构,用输入条件动态路由取代静态学习查询,在 PDE 代理基准和 Long Range Arena 上均优于 FLARE,同时保持线性复杂度。
This paper shows that four seemingly minor architectural choices—normalization, GQA, pretraining context length, and sliding window attention—have a compoundingly negative effect on long context extensibility, dropping performance by up to 47% when combined. The authors release OlmPool, a set of 26 comparable 7B models, after 170,000 GPU hours of controlled ablations.
TenStrip/10Eros-Max是一个实验性AI模型,通过正交投影从LTX 2.3、Wan 2.2和Krea 2视频与图像扩散模型中迁移学习模式,以修改MiniMax H3基础模型,增强美学与运动特性,同时保留核心视频和音频功能。
Looped transformers 在多次传递中重复使用相同的层,以参数数量换取计算量,用更少的权重实现更好的推理。文章追溯了这一想法到 Universal Transformer (2018),并解释了其最初因扩展定律和时机而失败的原因。
介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。
本文介绍了Bifocal Attention,它将位置编码解耦为几何(标准RoPE)和频谱(Learnable Harmonic Operators)两种模态,以解决固定RoPE的'Spectral Rigidity'问题,从而改善超出训练窗口的算法泛化能力。
提出一个连续几何框架,将Transformer操作建模为语义纤维丛上的积分-微分方程,并在多种架构上进行了验证。
DeepLoop为循环Transformer引入了一种残差缩放方法,该方法根据参数访问进行调整,从而在物理块跨多轮重用时提高稳定性和性能。
本课程笔记总结了从原始Transformer到现代LLM的架构演变,重点介绍了预归一化、RMS归一化、RoPE等趋同演化,并提供了超参数选择建议。
GigaWorld-Policy-0.5 是一个用于机器人控制的增强版世界动作模型(WAM),通过混合动作条件世界建模(AC-WM)策略和混合变换器(Mixture-of-Transformers)架构提升训练与推理效率,在本地 RTX 4090 上实现 85 毫秒延迟。
OpenMythos 是一个基于 Claude Mythos 架构理论复现的开源项目,完整实现了 Recurrent-Depth Transformer (RDT),支持 MLA/GQA 注意力机制和稀疏 MoE,提供从 1B 到 1T 参数的预设配置,可通过 pip 安装使用。
本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。
本文认为,开源权重AI模型追赶闭源模型并非通过蒸馏技术,而是得益于AI堆栈的模块化——稳定的接口(Transformer架构、兼容OpenAI的推理API、智能体框架)使得创新能在整个生态系统中迅速扩散,在缩小能力差距的同时保持巨大的价格优势,最终可能导致前沿AI的商品化。
一个涵盖LLM内部原理的全面15部分系列,从分词到服务部署,基于Gemma 4 12B的实际配置。
OneRank提出了一种原生Transformer的多任务排序框架,该框架将特征编码与预测相结合,以减少任务间干扰并提升推荐系统中的排序性能。
本文提供了大型语言模型中Transformer架构的可视化指南,涵盖自注意力、因果自注意力、掩码多头注意力以及输出层,并附有逐步解释和示例。