induction-heads

标签

Cards List
#induction-heads

双向归纳:掩码扩散语言模型中上下文学习的机制分析

arXiv cs.CL · 2026-07-20 缓存

本文对掩码扩散语言模型中的归纳机制进行了机制分析,识别出一个双向归纳电路,并表明这些模型将全局掩码标记比例用作隐式时间步。

0 人收藏 0 人点赞
#induction-heads

指纹,而非蓝图:位置方案如何设定注意力的默认谱代数

arXiv cs.LG · 2026-07-09 缓存

本文研究了注意力头中QK算子的谱性质,表明位置方案(RoPE、学习到的绝对位置、ALiBi)设定了一个默认的谱代数,它起到了功能确定后固化的指纹作用,而非硬约束。

0 人收藏 0 人点赞
#induction-heads

归纳头插值N-grams

arXiv cs.LG · 2026-07-07 缓存

本文研究了在马尔可夫链上训练的Transformer,发现归纳头实现了软上下文匹配和狄利克雷风格平滑,表明Transformer对上下文内估计进行正则化,而不是简单地统计n-gram。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈