language-modeling

标签

Cards List
#language-modeling

TEMPER:面向表达性残差路由的张量化高效流形约束参数化

arXiv cs.LG · 3天前 缓存

这篇 arXiv 论文介绍了 TEMPER,一种用于超连接残差路由的张量化参数化方法,在保持表达性、流形约束路由的同时减少参数增长。实验表明,在需要大幅减少额外参数的情况下,它能够匹配或超越现有方法。

0 人收藏 0 人点赞
#language-modeling

全带宽Transformer

Hugging Face Daily Papers · 6天前 缓存

全带宽Transformer是一种新的Transformer变体,通过门控线性单元反馈顶层隐藏状态,在不改变核心架构的情况下提升推理能力和效率。在多达400B个token上训练后,它能匹配使用1.5倍数据训练的标准Transformer,同时生成更短的推理轨迹。

0 人收藏 0 人点赞
#language-modeling

Kathleen写作:无注意力机制的自回归生成与数据规模扩展

arXiv cs.CL · 2026-08-06 缓存

Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。

0 人收藏 0 人点赞
#language-modeling

字符象似性与任意性:阿拉伯语NLP视角

arXiv cs.CL · 2026-08-05 缓存

本文从自然语言处理(NLP)的视角研究阿拉伯语字符形式与功能之间的关系是否具有任意性,结果表明,将字符随机重新映射到缩减的rasm集合上,可以在各种NLP任务中取得具有竞争力的表现。

0 人收藏 0 人点赞
#language-modeling

PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力

arXiv cs.AI · 2026-07-29 缓存

PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。

0 人收藏 0 人点赞
#language-modeling

语言中的JEPA悖论:语言替代的几何学

arXiv cs.CL · 2026-07-28 缓存

本文分析了为什么确定性JEPA风格的潜在预测适用于图像但不适用于文本,将失败归因于语言中的高条件方差,其中被屏蔽的上下文允许多个有效补全,而这些补全的表征缺乏一致的质心。

0 人收藏 0 人点赞
#language-modeling

基于压缩内容选择的无参数自适应稀疏注意力

arXiv cs.LG · 2026-07-27 缓存

本文提出了一种无参数的自适应稀疏注意力方法,利用gzip压缩比动态选择非冗余块进行长程注意力,在PG-19语言建模上相较于固定和学习的稀疏注意力基线取得了显著的困惑度提升。

0 人收藏 0 人点赞
#language-modeling

我在Fineweb-edu数据集上训练了一个0.5M参数的模型,使用了10亿个token。

Reddit r/LocalLLaMA · 2026-07-23

一个个人项目,使用Fineweb-edu数据集中的10亿个token训练了一个0.5M参数的语言模型。

0 人收藏 0 人点赞
#language-modeling

Gigatoken (GitHub Repo)

TLDR AI · 2026-07-22 缓存

Gigatoken 是一个即插即用的替代 tokenizer,声称相比 HuggingFace 的 tokenizer 速度提升高达 1000 倍,支持许多常见的 tokenizer 和 CPU。

0 人收藏 0 人点赞
#language-modeling

让数据决定:基于离策略蒸馏的持续预训练中的监督分析、能力权衡与自适应目标路由

arXiv cs.LG · 2026-07-21 缓存

本文分析了用于大语言模型预训练的离策略蒸馏方法,刻画了训练目标如何塑造令牌级监督和下游能力,并提出了自适应目标路由,将不同目标应用于不同数据领域,将预训练重新定义为一种数据条件监督设计问题。

0 人收藏 0 人点赞
#language-modeling

面向混合专家模型中一致专家选择的多层级上下文建模

arXiv cs.CL · 2026-07-21 缓存

本文提出了多层级上下文融合MoE(MCF-MOE)框架,通过集成跨层语义聚合和局部词元级交互,提升了混合专家模型中的路由一致性,在语言建模和理解基准测试上优于强基线。

0 人收藏 0 人点赞
#language-modeling

@mihirp98: 图像、视频、音频、动作——生成式建模已趋同于一个范式:压缩成连续潜变量,生成…

X AI KOLs Timeline · 2026-07-16 缓存

研究人员提出Latent Thought Flows,将256个文本令牌压缩为8个连续潜变量,实现单步生成,在推理计算与生成质量的帕累托前沿上优于自回归基线。

0 人收藏 0 人点赞
#language-modeling

@ParamSiddh: AI领域有两条职业道路:1. API调用者:知道如何使用API。(低杠杆,最先被自动化,年薪10万美元……

X AI KOLs Timeline · 2026-07-13 缓存

一条推文区分了AI领域的两条职业道路——API调用者与架构师,并推荐了斯坦福大学免费的CS336课程给那些想成为架构师的人。

0 人收藏 0 人点赞
#language-modeling

COLM 2026 决策讨论 [R]

Reddit r/MachineLearning · 2026-07-08

关于即将到来的 COLM 2026 决策通知的讨论帖。

0 人收藏 0 人点赞
#language-modeling

ResonatorLM:用于高效长上下文语言建模的因果共振场混合

arXiv cs.CL · 2026-07-08 缓存

ResonatorLM 引入了一种源于物理学的因果共振场混合机制,用于替代 Transformer 中的自注意力机制,在长上下文语言建模任务上实现了显著的速度提升和准确性改善。

0 人收藏 0 人点赞
#language-modeling

状态预测分离假说

Hugging Face Daily Papers · 2026-07-01 缓存

本文提出了状态预测分离假说,认为在Transformer中将状态预测与令牌预测分离,能在不同规模上提升语言建模的性能和效率,实验表明该方法持续带来改进。

0 人收藏 0 人点赞
#language-modeling

Flexformer:具有可学习注意力核的灵活线性Transformer

arXiv cs.LG · 2026-06-29 缓存

Flexformer提出了一种灵活的线性Transformer,使用随机傅里叶特征实现完全可学习的注意力核,在语言建模和序列分类任务中达到线性复杂度,同时匹配或超越softmax注意力的性能。

0 人收藏 0 人点赞
#language-modeling

@stanfordnlp: CS336的“问题”不在于大约22小时的视频,而在于完成作业所需的大量时间。…

X AI KOLs Following · 2026-06-28 缓存

斯坦福大学的CS336课程宣布开课,从零开始教授语言建模,包含密集的实践作业,涵盖分词器、Transformer、数据和对齐。

1 人收藏 1 人点赞
#language-modeling

擦除后增量注意力:在Delta规则线性注意力中解耦擦除与写入地址

arXiv cs.CL · 2026-06-26 缓存

提出擦除后增量注意力(EDA),一种用于线性注意力的记忆更新规则,它在写入新内容之前,先通过解耦擦除和写入地址来有选择地抑制过时信息。在2.5B密集模型和25B MoE模型上的实验表明,在标准评估和长上下文评估中均取得一致增益。

0 人收藏 0 人点赞
#language-modeling

@tan_maty: 我勒个去,下周去 OpenAI 上班的神仙姐姐 @alisawuffles 分享的 AI 斯坦福课程,我给找到了,小白必看! 我已经学废了,你们也快来吧,我感觉我英文水平也进步了! Stanford CS336: Language Mod…

X AI KOLs Timeline · 2026-06-23 缓存

斯坦福大学CS336课程旨在让学生从零开始构建语言模型,深入理解数据、系统和模型的全栈设计,课程视频已公开,适合AI初学者学习。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈