KL Zero: KL散度直觉游戏
摘要
KL Zero是一款交互式浏览器游戏,玩家在其中绘制概率分布以匹配目标KL散度值,帮助用户直观理解机器学习中KL散度的概念。
暂无内容
查看缓存全文
缓存时间: 2026/06/02 04:47
# KL Zero
来源:https://klzero.sarna.dev/
**绘制到目标 KL 值。**
KL 散度衡量的是:如果实际用的是你画的绿色分布 Q,那么原本的蓝色分布 P 看起来会多么令人意外。
画出任意概率分布(总和接近 1),让它的 KL 散度尽可能接近目标数值。
你只有 10 秒。开始!
**KL 0.1**
几乎相同
**KL 1**
形状偏移
**KL 10**
相距甚远
相似文章
KL散度:用还是不用?量化分析师的两难之选
讨论了在量化分析中使用KL散度的权衡,将其描述为量化分析师面临的哈姆雷特式两难困境。
@neural_avb: 这篇文章实际上解释了On Policy Distillation损失函数的所有组成部分(前向与反向KL),等等…
本文解释了On Policy Distillation损失函数的组成部分,包括前向与反向KL散度、监督粒度、特权类型以及特权优势估计。还提供了来自Thinking Machines、Hugging Face等的其他资源。
训练-推理内核合约:约束后训练与部署中的差异
本文形式化了现代AI后训练流程中训练内核与推理内核之间的数值差异,提出了一种内核合约规范以及一系列Lipschitz风格的界限,以减轻离策略偏差、切片级回归和可重复性问题。
可检测性边缘的后训练:一种博弈论驱动的微调方法
本文介绍了一种博弈论的微调语言模型方法,该方法优化了奖励与偏离参考策略之间的权衡,并提供了一种设置KL正则化系数的原则性方法。
面向LLM的高效知识蒸馏:离线Top-K Logits与融合分块KL损失
本文对如何让LLM的知识蒸馏训练更高效进行了实践研究,引入了离线Top-K logits缓存和一种融合的分块KL损失,从而减少内存尖峰,并允许在单张GPU上训练更长的上下文。