chessformer_lens 演示:消融国际象棋 transformer 的 128 个注意力头中的一个,导致模型不再能找到 Morphy 的后牺牲 [P]

Reddit r/MachineLearning 工具

摘要

chessformer_lens 的一个演示表明,消融国际象棋 transformer 中的一个注意力头,会导致模型停止识别 Morphy 的后牺牲,这展示了特定能力集中在单个注意力头中。

https://i.redd.it/ipz7i6ife1jh1.gif 复现用的笔记本在 GitHub 上!
查看原文

相似文章

仅注意力Transformer的对照研究

arXiv cs.LG

本文提出了一项对照研究,比较了仅注意力Transformer(简单注意力网络,SANs)与在参数、计算量和深度上匹配的标准Transformer。研究发现,当将释放的容量重新分配给注意力深度时,移除前馈层在很大程度上缩小了性能差距,剩余差距归因于参数回忆。