标签
这篇 arXiv 论文介绍了 TEMPER,一种用于超连接残差路由的张量化参数化方法,在保持表达性、流形约束路由的同时减少参数增长。实验表明,在需要大幅减少额外参数的情况下,它能够匹配或超越现有方法。
全带宽Transformer是一种新的Transformer变体,通过门控线性单元反馈顶层隐藏状态,在不改变核心架构的情况下提升推理能力和效率。在多达400B个token上训练后,它能匹配使用1.5倍数据训练的标准Transformer,同时生成更短的推理轨迹。
Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。
本文从自然语言处理(NLP)的视角研究阿拉伯语字符形式与功能之间的关系是否具有任意性,结果表明,将字符随机重新映射到缩减的rasm集合上,可以在各种NLP任务中取得具有竞争力的表现。
PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。
本文分析了为什么确定性JEPA风格的潜在预测适用于图像但不适用于文本,将失败归因于语言中的高条件方差,其中被屏蔽的上下文允许多个有效补全,而这些补全的表征缺乏一致的质心。
本文提出了一种无参数的自适应稀疏注意力方法,利用gzip压缩比动态选择非冗余块进行长程注意力,在PG-19语言建模上相较于固定和学习的稀疏注意力基线取得了显著的困惑度提升。
一个个人项目,使用Fineweb-edu数据集中的10亿个token训练了一个0.5M参数的语言模型。
Gigatoken 是一个即插即用的替代 tokenizer,声称相比 HuggingFace 的 tokenizer 速度提升高达 1000 倍,支持许多常见的 tokenizer 和 CPU。
本文分析了用于大语言模型预训练的离策略蒸馏方法,刻画了训练目标如何塑造令牌级监督和下游能力,并提出了自适应目标路由,将不同目标应用于不同数据领域,将预训练重新定义为一种数据条件监督设计问题。
本文提出了多层级上下文融合MoE(MCF-MOE)框架,通过集成跨层语义聚合和局部词元级交互,提升了混合专家模型中的路由一致性,在语言建模和理解基准测试上优于强基线。
研究人员提出Latent Thought Flows,将256个文本令牌压缩为8个连续潜变量,实现单步生成,在推理计算与生成质量的帕累托前沿上优于自回归基线。
一条推文区分了AI领域的两条职业道路——API调用者与架构师,并推荐了斯坦福大学免费的CS336课程给那些想成为架构师的人。
ResonatorLM 引入了一种源于物理学的因果共振场混合机制,用于替代 Transformer 中的自注意力机制,在长上下文语言建模任务上实现了显著的速度提升和准确性改善。
本文提出了状态预测分离假说,认为在Transformer中将状态预测与令牌预测分离,能在不同规模上提升语言建模的性能和效率,实验表明该方法持续带来改进。
Flexformer提出了一种灵活的线性Transformer,使用随机傅里叶特征实现完全可学习的注意力核,在语言建模和序列分类任务中达到线性复杂度,同时匹配或超越softmax注意力的性能。
斯坦福大学的CS336课程宣布开课,从零开始教授语言建模,包含密集的实践作业,涵盖分词器、Transformer、数据和对齐。
提出擦除后增量注意力(EDA),一种用于线性注意力的记忆更新规则,它在写入新内容之前,先通过解耦擦除和写入地址来有选择地抑制过时信息。在2.5B密集模型和25B MoE模型上的实验表明,在标准评估和长上下文评估中均取得一致增益。
斯坦福大学CS336课程旨在让学生从零开始构建语言模型,深入理解数据、系统和模型的全栈设计,课程视频已公开,适合AI初学者学习。