标签
本文提出了一种数学框架,用于逆向工程 Transformer 模型,以增强机制可解释性并解决 AI 系统中的安全问题。
这篇博文延续了Anthropic的verbalizable workspace论文,通过测量中间层转向方向的影响范围、训练中结构的形成时机、结构在不同模型间的迁移性以及其扩展性,全部基于开放模型进行实验。
本文介绍了可验证Transformer(Verifiable Transformers),这是一个将任务局部化的Transformer电路转换为有界的、求解器可验证的声明框架,从而能够对功能等价性、边必要性及鲁棒性等属性进行形式化验证。