标签
一条推荐 Nathan Cantafio 博客文章 "MLE is not intuitive" 的推文,该文章以易懂的方式讨论了关于最大似然估计的常见误解。
本文分析了大型语言模型中的幻觉,将其视为三个架构决策的结构性后果:自注意力的共现学习、最大似然估计训练目标以及自回归解码的左到右承诺。它将每种机制映射到特定的幻觉类型,并论证了数据集病态会放大但不会导致这些脆弱性。
本文介绍了行为克隆(Behavioral Cloning),这是一种模仿学习技术,用于从专家演示中训练策略。文章讨论了其在最大似然估计中的理论基础,以及其在 AlphaGo 等历史应用中的使用情况。