围棋网络内部有多对称?[R]

Reddit r/MachineLearning 论文

摘要

一项关于 KataGo 围棋神经网络如何在内部表示棋盘对称性的研究,发现尽管只使用了随机的八重数据增强,模型仍学习到了部分对称的概念,并有一个意料之外的结果。

我刚刚发布了一项小型研究 / ML 可解释性研究,内容关于我维护的开源围棋程序("KataGo")神经网络内部的对称性。围棋规则在旋转/反射下是完全对称的,但模型并没有被强制要求满足这种对称性——我们为此所做的唯一事情是在训练期间进行随机的八重数据增强,将每个批次的空间方向随机化。超人类水平的围棋神经网络在多大程度上会自动学会在内部以独立于棋盘方向的方式表示棋盘,即通过"对称"概念使棋盘方向无关紧要?又有多少是需要针对每个方向分别学习/记忆的?https://lightvector.github.io/katagostudies/202607-symmetry/ 提醒一下:这项研究及其撰写几乎完全由 AI 驱动,不过过程中有详细的人类指导和反馈。但我花时间尽量打磨这篇文章,让它具有教育意义,我希望它明显优于人们常见的低质量 AI "垃圾内容",如果你喜欢这样的小型研究,值得一看。文章的写作也相当温和,便于 ML 领域之外的人理解。代码也附在帖子中(与托管 github.io 页面的仓库相同)。我想探索这个问题,是因为我(现在仍然!)非常好奇神经网络内部究竟在做什么!而且我之前不知道结果会是什么。其中有一个发现是出乎意料的。总的来说,这只是可解释性研究领域中的沧海一粟,但我希望你觉得它有趣。
查看原文

相似文章

图神经网络Top-k解释中的自同构诱导非规范性问题

arXiv cs.LG

本文揭示了图神经网络top-k解释中的一个根本问题:输入图中的自同构导致解释不唯一,因为模型无法区分对称元素。作者提出了一个检测这种任意性的标准,并利用Lean 4中的自动推理对其进行了验证,表明该问题在分子数据集中广泛存在。

[R] 测量对称性--数据交换速率

Reddit r/MachineLearning

本文实证测量了等变性理论预测的对称性与数据交换速率,发现错误群对称约束具有实际危害,测试时轨道平均的数据增强与等变架构相匹配,而理论上 |G| 倍的样本复杂度降低仅得到弱证实,且置信区间较宽。该研究明确为探索性,未预先注册。