标签
本文介绍了'Rosetta Neurons'——跨越不同神经网络的通用神经元——并展示它们以亚线性幂律缩放,随着规模增大变得更具选择性和单义性,从而实现几乎与oracle性能相匹配的数据过滤。
本文展示稀疏自编码器能够从生产级语言模型Claude 3 Sonnet中提取可解释特征,解决了字典学习方法在扩展性方面的担忧。这些特征具有多语言、多模态特性,并涵盖欺骗、谄媚等安全相关概念,且对模型输出具有因果影响。