attribution-patching

标签

Cards List
#attribution-patching

算术启发神经元是否具有形式不变性?对LLMs中符号、文本和代码的机制分析

arXiv cs.CL · 2026-07-21 缓存

本文研究了LLM中的算术启发神经元在符号算术、自然语言文字题和Python代码中是否具有形式不变性。通过激活修补,他们发现了一个共享的神经元回路,该回路对于算术计算是必要且充分的,并且跨格式失败源于激活状态而非不同的回路。

0 人收藏 0 人点赞
#attribution-patching

当 Attribution Patching 存在偏差:诊断与二阶修正

arXiv cs.LG · 2026-06-10 缓存

本文诊断了 attribution patching 中的系统性误差——这是一种用于语言模型因果定位的基于梯度的近似方法——并提出了一种使用 Hessian-vector product 的二阶修正,该修正以极小的额外计算成本提高了可靠性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈