transformer-architecture

标签

Cards List
#transformer-architecture

YouTube本地LLM王者回归

Reddit r/LocalLLaMA · 7小时前 缓存

一位YouTube创作者在休整期后回归,教授从零开始构建分布式训练框架,专注于DeepSeek、MoE和MLA等高级AI主题,并强调培养解决问题的能力和自信心。

0 人收藏 0 人点赞
#transformer-architecture

RecurrentGPT:通过递归调制在Transformer中实现表达性深度

arXiv cs.CL · 8小时前 缓存

RecurrentGPT引入了一种递归深度Transformer,它使用门控调制来迭代重用共享层,与标准Transformer相比,以更少的参数实现了竞争性的准确性并提高了内存效率。

0 人收藏 0 人点赞
#transformer-architecture

Wiola 13M,一种用于参数高效小型语言模型的门控螺旋注意力架构

arXiv cs.CL · 8小时前 缓存

本文介绍了Wiola,一个具有13M参数的仅解码器语言模型,采用螺旋旋转位置编码和门控螺旋注意力等新组件,以提升小型设备端语言模型的参数效率。

0 人收藏 0 人点赞
#transformer-architecture

Microsoft的Full-bandwidth Transformers(26分钟阅读)

TLDR AI · 昨天 缓存

本文介绍了full-bandwidth transformers,它利用潜在反馈来增强自回归模型,允许未表达的计算重新进入堆栈,从而以可忽略的解码开销提高性能。

0 人收藏 0 人点赞
#transformer-architecture

FLARE++:低秩注意力与动态注意力路由

arXiv cs.LG · 5天前 缓存

FLARE++ 是一种低秩注意力架构,用输入条件动态路由取代静态学习查询,在 PDE 代理基准和 Long Range Arena 上均优于 FLARE,同时保持线性复杂度。

0 人收藏 0 人点赞
#transformer-architecture

Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

arXiv cs.CL · 6天前 缓存

This paper shows that four seemingly minor architectural choices—normalization, GQA, pretraining context length, and sliding window attention—have a compoundingly negative effect on long context extensibility, dropping performance by up to 47% when combined. The authors release OlmPool, a set of 26 comparable 7B models, after 170,000 GPU hours of controlled ablations.

0 人收藏 0 人点赞
#transformer-architecture

TenStrip/10Eros-Max

Hugging Face Models Trending · 2026-08-04 缓存

TenStrip/10Eros-Max是一个实验性AI模型,通过正交投影从LTX 2.3、Wan 2.2和Krea 2视频与图像扩散模型中迁移学习模式,以修改MiniMax H3基础模型,增强美学与运动特性,同时保留核心视频和音频功能。

0 人收藏 0 人点赞
#transformer-architecture

什么是 Looped Transformers?清晰解释(8分钟阅读)

TLDR AI · 2026-07-28 缓存

Looped transformers 在多次传递中重复使用相同的层,以参数数量换取计算量,用更少的权重实现更好的推理。文章追溯了这一想法到 Universal Transformer (2018),并解释了其最初因扩展定律和时机而失败的原因。

0 人收藏 0 人点赞
#transformer-architecture

多头注意力残差

Hugging Face Daily Papers · 2026-07-22 缓存

介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。

0 人收藏 0 人点赞
#transformer-architecture

Bifocal Attention: 协调几何与频谱位置嵌入以实现算法泛化

arXiv cs.CL · 2026-07-20 缓存

本文介绍了Bifocal Attention,它将位置编码解耦为几何(标准RoPE)和频谱(Learnable Harmonic Operators)两种模态,以解决固定RoPE的'Spectral Rigidity'问题,从而改善超出训练窗口的算法泛化能力。

0 人收藏 0 人点赞
#transformer-architecture

语义空间的几何:Transformer架构的连续几何框架

Hugging Face Daily Papers · 2026-07-19 缓存

提出一个连续几何框架,将Transformer操作建模为语义纤维丛上的积分-微分方程,并在多种架构上进行了验证。

0 人收藏 0 人点赞
#transformer-architecture

DeepLoop:循环Transformer的深度缩放

arXiv cs.LG · 2026-07-16 缓存

DeepLoop为循环Transformer引入了一种残差缩放方法,该方法根据参数访问进行调整,从而在物理块跨多轮重用时提高稳定性和性能。

0 人收藏 0 人点赞
#transformer-architecture

@kuririrn: Studying to grasp the recent trends in scratch development of LLMs Stanford CS336 Lang. Modeling from Scratch | Spring …

X AI KOLs Following · 2026-07-15 缓存

本课程笔记总结了从原始Transformer到现代LLM的架构演变,重点介绍了预归一化、RMS归一化、RoPE等趋同演化,并提供了超参数选择建议。

0 人收藏 0 人点赞
#transformer-architecture

GigaWorld-Policy-0.5:由AutoResearch赋能的更快更强的WAM

Hugging Face Daily Papers · 2026-07-15 缓存

GigaWorld-Policy-0.5 是一个用于机器人控制的增强版世界动作模型(WAM),通过混合动作条件世界建模(AC-WM)策略和混合变换器(Mixture-of-Transformers)架构提升训练与推理效率,在本地 RTX 4090 上实现 85 毫秒延迟。

0 人收藏 0 人点赞
#transformer-architecture

@XAMTO_AI: 重磅开源!OpenMythos —— Claude Mythos 架构的理论复现项目! 由 KyeGomezB从第一性原理构建,完整实现了 Recurrent-Depth Transformer (RDT): • Prelude(前奏层)…

X AI KOLs Timeline · 2026-07-03 缓存

OpenMythos 是一个基于 Claude Mythos 架构理论复现的开源项目,完整实现了 Recurrent-Depth Transformer (RDT),支持 MLA/GQA 注意力机制和稀疏 MoE,提供从 1B 到 1T 参数的预设配置,可通过 pip 安装使用。

0 人收藏 0 人点赞
#transformer-architecture

理解大型语言模型

arXiv cs.CL · 2026-07-02 缓存

本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。

0 人收藏 0 人点赞
#transformer-architecture

开源权重模型并非通过抄袭来追赶闭源模型,它们之所以胜出,是因为整个AI堆栈正在悄然模块化

Reddit r/singularity · 2026-06-30

本文认为,开源权重AI模型追赶闭源模型并非通过蒸馏技术,而是得益于AI堆栈的模块化——稳定的接口(Transformer架构、兼容OpenAI的推理API、智能体框架)使得创新能在整个生态系统中迅速扩散,在缩小能力差距的同时保持巨大的价格优势,最终可能导致前沿AI的商品化。

0 人收藏 0 人点赞
#transformer-architecture

我写了一个免费的15部分系列文章,讲解LLM内部原理——真实的数学、真实的张量形状、真实的硬件限制。全部基于Gemma 4 12B的实际配置。

Reddit r/LocalLLaMA · 2026-06-20

一个涵盖LLM内部原理的全面15部分系列,从分词到服务部署,基于Gemma 4 12B的实际配置。

0 人收藏 0 人点赞
#transformer-architecture

OneRank:面向多任务推荐的统一原生Transformer排序架构

Hugging Face Daily Papers · 2026-06-15 缓存

OneRank提出了一种原生Transformer的多任务排序框架,该框架将特征编码与预测相结合,以减少任务间干扰并提升推荐系统中的排序性能。

0 人收藏 0 人点赞
#transformer-architecture

@_rohit_tiwari_: https://x.com/_rohit_tiwari_/status/2063982924714901858

X AI KOLs Timeline · 2026-06-08 缓存

本文提供了大型语言模型中Transformer架构的可视化指南,涵盖自注意力、因果自注意力、掩码多头注意力以及输出层,并附有逐步解释和示例。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈