language-modeling

标签

Cards List
#language-modeling

@shao__meng: https://x.com/shao__meng/status/2103072921308877122

X AI KOLs Timeline ↗ · 3天前 缓存

斯坦福大学CS336课程「从零构建语言模型」公开了18讲完整视频、开源作业和课程材料,全面覆盖大语言模型工程的全流程,适合自学者系统学习LLM开发。

0 人收藏 0 人点赞
#language-modeling

[R] 复杂KDA:理解与增强Kimi Delta Attention的表达能力

Reddit r/LocalLLaMA ↗ · 5天前

本文介绍了Complex KDA,这是对Kimi Delta Attention的增强,通过实现二维旋转和状态追踪能力,提高了线性RNN的表达能力,从而在长度外推和语言建模性能上取得了卓越表现。

0 人收藏 0 人点赞
#language-modeling

IntBMoE: 在专家组合中集成区块级条件的全参与式混合专家模型

arXiv cs.LG ↗ · 6天前 缓存

IntBMoE是一种新颖的混合专家方法,通过区块级条件和稀疏执行,解耦参与、执行和具体化成本,在图像分类、语言建模和推荐系统方面展现出改进,并在AMap的生成式推荐系统中实现了实际部署。

0 人收藏 0 人点赞
#language-modeling

Complex KDA:理解与增强 Kimi Delta Attention 的表达能力

Hugging Face Daily Papers ↗ · 6天前 缓存

本文介绍了 Complex KDA,这是 Kimi Delta Attention 的增强版本,它结合了 delta规则变换与反射以实现更高的表达能力,在某些任务中优于 Transformers,同时保持效率,并提供开源代码和模型。

0 人收藏 0 人点赞
#language-modeling

超立方体上的旋转稀疏布线:一种无需搜索即可覆盖所有位置的注意力替代方案

arXiv cs.LG ↗ · 2026-09-17 缓存

本文提出一种利用超立方体上旋转稀疏布线替代神经网络注意力的方法,在显著降低计算成本和参数量的同时,实现相当或更优的性能。

0 人收藏 0 人点赞
#language-modeling

DANTINOX:用于多范式语言建模的统一框架

arXiv cs.CL ↗ · 2026-09-17 缓存

DantinoX 是一个开源 JAX/Flax 库,提供了一个统一的框架,用于训练和比较自回归、掩码扩散和流匹配语言模型,实现受控实验和基准测试。

0 人收藏 0 人点赞
#language-modeling

@kplikethebird: 让AI像你一样写作最困难的部分之一,是让它做出与你相同的语言决策,逐字逐句地……

X AI KOLs Timeline ↗ · 2026-09-15 缓存

这条推文讨论了在AI写作模型中使用概率方法来复制个人语言决策的挑战,可能推动AI辅助写作的发展。

0 人收藏 0 人点赞
#language-modeling

@PyTorch:了解PyTorch如何将语言建模扩展到超越分类的实际时间至事件预测。Witold Czub…

X AI KOLs Following ↗ · 2026-09-14 缓存

这篇文章推广了PyTorch Conference North America,重点介绍了来自UBS的Witold Czubala的一个会议,他讨论了使用基于PyTorch的Transformer模型从纵向电子邮件数据中进行财富管理的时间至事件预测。

0 人收藏 0 人点赞
#language-modeling

Representation-based Masked Diffusion Model

arXiv cs.CL ↗ · 2026-09-14 缓存

本文提出了基于表示的遮蔽扩散模型(RMDM),该模型利用文本表示来改进遮蔽扩散模型中的并行令牌更新,特别是在少步采样中提升生成质量。

0 人收藏 0 人点赞
#language-modeling

循环GPT-BERT:以参数换取计算的小型语言建模

arXiv cs.CL ↗ · 2026-09-10 缓存

本文介绍了循环GPT-BERT,它通过深度方向参数共享来训练参数更少的小型语言模型,在BabyLM 2026严格小规模设定中达到了与基准模型相当的性能。

0 人收藏 0 人点赞
#language-modeling

卡尔曼增量网络:不确定性感知的联想记忆

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

介绍了卡尔曼增量网络,该网络通过将线性注意力重新表述为带有卡尔曼滤波更新的线性高斯状态空间模型来改进语言建模,以追踪记忆不确定性,从而产生比现有线性注意力模型性能更优的高效近似。

0 人收藏 0 人点赞
#language-modeling

颠覆字节级语言建模中的层级结构

arXiv cs.CL ↗ · 2026-09-02 缓存

本文研究了分层字节级语言模型,并揭示了其设计限制了字符级理解,纯字节级模型在字符操作任务上优于它们,从而确立了计算效率与细粒度性能之间的权衡。

0 人收藏 0 人点赞
#language-modeling

Gated Recurrent Transformers:通过循环调制实现Transformer中的表达性深度

Hugging Face Daily Papers ↗ · 2026-08-25 缓存

本文介绍了Gated Recurrent Transformer模型,该模型通过自适应更新门在深度上重用共享核心,以更少的参数和更低的内存实现与更深模型相当或更好的质量。

0 人收藏 0 人点赞
#language-modeling

当分词与语言建模联合优化时,会学习到哪些词元?

arXiv cs.CL ↗ · 2026-08-19 缓存

本文研究了当分词与语言建模联合优化时所学习到的词元,比较了跨多种语言的无分词器方法,发现它们为自然语言处理生成了独特而高效的词汇表。

0 人收藏 0 人点赞
#language-modeling

Q-Interference:内存高效的相位感知量子启发注意力机制

arXiv cs.CL ↗ · 2026-08-19 缓存

本文提出Q-Interference,一种用于GPT模型的内存高效量子启发注意力机制,该机制使用相位感知评分和精确三角因式分解,以改善令牌交互而不增加内存开销。

0 人收藏 0 人点赞
#language-modeling

BCMT:分块因果记忆Transformer

arXiv cs.CL ↗ · 2026-08-17 缓存

BCMT引入了一个分块因果记忆Transformer架构,它在长上下文语言建模中解耦了局部和全局依赖,在保持与密集Transformer相当的性能的同时提高了效率。

0 人收藏 0 人点赞
#language-modeling

Microsoft的Full-bandwidth Transformers(26分钟阅读)

TLDR AI ↗ · 2026-08-17 缓存

本文介绍了full-bandwidth transformers,它利用潜在反馈来增强自回归模型,允许未表达的计算重新进入堆栈,从而以可忽略的解码开销提高性能。

0 人收藏 0 人点赞
#language-modeling

TEMPER:面向表达性残差路由的张量化高效流形约束参数化

arXiv cs.LG ↗ · 2026-08-11 缓存

这篇 arXiv 论文介绍了 TEMPER,一种用于超连接残差路由的张量化参数化方法,在保持表达性、流形约束路由的同时减少参数增长。实验表明,在需要大幅减少额外参数的情况下,它能够匹配或超越现有方法。

0 人收藏 0 人点赞
#language-modeling

全带宽Transformer

Hugging Face Daily Papers ↗ · 2026-08-09 缓存

全带宽Transformer是一种新的Transformer变体,通过门控线性单元反馈顶层隐藏状态,在不改变核心架构的情况下提升推理能力和效率。在多达400B个token上训练后,它能匹配使用1.5倍数据训练的标准Transformer,同时生成更短的推理轨迹。

0 人收藏 0 人点赞
#language-modeling

Kathleen写作:无注意力机制的自回归生成与数据规模扩展

arXiv cs.CL ↗ · 2026-08-06 缓存

Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈