自己从零写扩散语言模型比我想的简单多了[P]

Reddit r/MachineLearning 工具

摘要

开发者分享了一个极简的750万参数扩散语言模型,用莎士比亚文本从头训练,并开源代码供学习。

最近觉得太依赖 Claude Code 了,就想试试不用任何 AI 生成代码,从头实现一个扩散语言模型到底有多难。于是趁硕士论文训练排队空档,随手写了一个。在 MacBook Air M2 上跑了几个小时,用 Karpathy 的 tiny Shakespeare 数据集练完,我输入提示 "to be, ",模型输出: To be, fo hend! First her sense ountier to Jupits, be horse. 字字珠玑! 模型只有 750 万参数,词表 66(65 个字符 + \[MASK\])。训练时间确实不够,但时间有限只能到此为止。做这种项目,让我把“离散扩散”“编码器”“解码器”“分词器”这些吓人的大词儿真正搞明白。希望也能给你一点勇气 :) 代码在这儿,有兴趣自取:[https://github.com/Encrux/simple\_dlm](https://github.com/Encrux/simple_dlm) 感谢阅读!Be horse.
查看原文

相似文章

扩散语言模型:实验分析

arXiv cs.AI

一项系统性的实验分析,评估了八种最先进的扩散语言模型在多个基准测试上的表现,分析了生成质量与计算效率之间的权衡。

改进的大型语言扩散模型

arXiv cs.CL

iLLaDA是一个80亿参数的掩码扩散语言模型,具有完全双向注意力机制,从头开始在12万亿token上训练。与LLaDA相比,它在多个方面都有显著改进,并在多个基准测试上与Qwen2.5 7B保持竞争力。模型和代码已开源。