标签
AI Engineering 第三章课程笔记,系统讲解评估方法学(Evals):从开放式输出与黑盒模型带来的评估挑战出发,介绍交叉熵、困惑度、BPC/BPB 等语言建模指标,并对比 AI-as-a-judge 与比较评估两种主流评估思路。
A detailed walkthrough explains how Claude Shannon's 1948 information theory underlies LLMs and shows that the 'next-token prediction' story is misleading, linking compression and prediction mathematically.
一位从业者推荐了一场免费的33分钟关于交叉熵的讲座,该讲座将语言模型重新定义为压缩而非下一个词预测,并比作斯坦福机器学习博士资格考试。
本文利用广义外信息传递(GEXIT)函数为扩散模型建立了守恒律,表明交叉熵可以表示为沿噪声路径的局部信息论导数的积分,从而统一了离散和连续扩散的似然表征。
本文研究在交叉熵损失下,权重范数是直接控制神经网络中的grokking延迟,还是其效果通过对数几率尺度和softmax饱和来中介。实验表明,延迟几乎完全由有效对数几率尺度解释,权重范数的贡献微乎其微。
本文表明,交叉熵和监督对比学习都是超球面上的原型学习形式,并提出了归一化损失函数(NTCE和NONL),这些损失函数通过设计实现Neural Collapse,性能优于标准方法。
本文利用KL散度和Bregman几何,推导了信念空间动力学中允许的学习率步长的闭式上界,重点关注交叉熵分类任务。