language-modeling

标签

Cards List
#language-modeling

Mela:基于转化假说的测试时记忆巩固

Hugging Face Daily Papers · 2026-05-11 缓存

本文介绍了 Mela,这是一种受人类记忆巩固机制启发的、增强记忆的 Transformer 架构,其核心特征为层级记忆模块(HMM),能够有效提升长上下文语言建模的性能。

0 人收藏 0 人点赞
#language-modeling

@HongcanGuo: 一种全新的文本建模方法

X AI KOLs Timeline · 2026-05-08 缓存

一位名叫HongcanGuo的研究人员透露了一种全新的文本建模方法,但推文未提供技术细节。

0 人收藏 0 人点赞
#language-modeling

轨迹即师:通过能量导航蒸馏实现少步离散流匹配

Hugging Face Daily Papers · 2026-05-08 缓存

本文介绍了轨迹塑造离散流匹配(TS-DFM),该方法以引导式导航取代盲目随机跳跃,显著提升了文本生成效率并降低了计算成本。与传统多步基线相比,该方法在保持推理成本不变的同时,实现了更低的困惑度和更快的速度。

0 人收藏 0 人点赞
#language-modeling

TextLDM:利用连续潜在扩散进行语言建模

Hugging Face Daily Papers · 2026-05-08 缓存

本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。

0 人收藏 0 人点赞
#language-modeling

令牌时间连续扩散用于语言建模

Hugging Face Daily Papers · 2026-05-07 缓存

本文介绍了令牌时间连续扩散(Token Time Continuous Diffusion,简称TTCD),这是一种新型扩散语言模型,它在连续空间中运行,采用每个令牌的时间步,在条件生成和数独求解方面以高加速比优于离散模型。

0 人收藏 0 人点赞
#language-modeling

LangFlow:连续扩散在语言建模中可与离散扩散相媲美

Hugging Face Daily Papers · 2026-04-15 缓存

LangFlow提出了首个可与离散扩散方法相媲美的连续扩散语言模型,挑战了长期以来认为连续扩散在语言建模中劣于离散扩散的观点。该工作引入了基于最优Gumbel噪声调度等关键要素,并展示了与离散扩散基线相比具有竞争力的困惑度和迁移学习性能。

0 人收藏 0 人点赞
#language-modeling

karpathy/nn-zero-to-hero

GitHub Trending (daily) · 2026-05-22 缓存

Andrej Karpathy 的《Neural Networks: Zero to Hero》是一门免费课程,涵盖从基础神经网络到现代架构(如 Transformer)的内容,配有 YouTube 讲座和 Jupyter notebook。包含 micrograd 和 makemore 的动手实现。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈