mask-learning

标签

Cards List
#mask-learning

Matryoshka归因:学习将语言模型输出归因到表示和权重

arXiv cs.CL · 昨天 缓存

论文介绍了Matryoshka Attribution(MAttr),一种用于将语言模型输出归因到内部组件的掩码学习方法,在Mechanistic Interpretability Benchmark上取得了顶尖性能,并展示了通过调整权重来修改大语言模型行为的实际应用。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈