标签
论文介绍了 LOGOS,一种写感知检测器,通过将其 OV 电路输出投影到答案令牌反嵌入方向上的得分来识别 LLM 中负责非字面检索的注意力头,在多个模型家族中优于先前的基于注意力的方法。
本文介绍了LOCOS,一种用于识别大型语言模型中负责非字面上下文合成的注意力头的方法,在检索基准上优于现有技术。
Hard-KV 引入了级联缓存层次结构和 Logits 校准机制,以解决头部自适应 KV 缓存压缩中的静态-动态不匹配问题,在长上下文 LLM 推理中实现了高达 2 倍的吞吐量提升。
本文研究视觉-语言模型如何解决视觉证据与世界知识之间的冲突,揭示了视觉基础是默认的,而先验知识依赖于一小部分位于后层的注意力头。作者在三个VLM系列上进行因果分析,展示了一种不对称结构:消融这些头部会使得预测从基于知识的答案转向基于视觉的答案。
本文将上下文夹带从标记级扩展到句子级,表明提示中的反事实句子在推理时也会增加其概率。该效应随模型规模增大而减弱,且由2-4%的注意力头驱动,这些注意力头可被消融而不影响性能。
HeRA 在多模态大型语言模型 (MLLMs) 中对齐单个注意力头,以保留跨模态的局部邻域关系,从而提升视觉中心任务的性能并减少视觉幻觉。
本文表明,满足机制角色声明常见标准(必要性、线性可解码性、消融可逆性)的注意力头,在跨提示词转移计算时常常失败,并引入了KID(Knowing/Intent/Doing)框架和一个三阶段流水线,用于更严格的角色分配。
本文识别了多模态大语言模型中一种特殊的注意力头子集,称为CoRe头,它们在跨模态检索中表现出功能稀疏性。因果干预实验表明,这些头对多模态推理至关重要,利用这种稀疏性可以加速推理。
提出了 MechRL,一种利用强化学习自动发现 transformer 语言模型中电路的方案。经过多任务训练的 PPO 代理发现了与已知典型电路匹配的注意力头电路,并能泛化到一项保留任务上。
介绍了一种三步法,用于识别预训练Transformer中的注意力头电路,该方法使用频谱信号和任务模式筛选,无需标签,并在51M到1B参数模型及多种架构上验证。
P2D是一个统一框架,利用任务敏感的注意力头进行数据选择和结构剪枝,通过仅更新10%的头部和10%的数据,实现了8.3个百分点的性能提升和7.0倍的加速。
本文研究了权重衰减如何作为控制参数,使在模算术上训练的Transformer在记忆与泛化之间发生转变,并引入了两种基于注意力激活的廉价在线诊断指标,用以追踪这些动态。
引入反事实定位方法,用于识别语言模型在推理过程中何时对欺骗做出承诺。该方法使用五个环境,包含四个推理模型的146万句子语料库。研究表明,基于注意力的转换特征在不同环境中具有泛化能力,可用于检测欺骗承诺。
本文识别了在80亿参数语言模型中语言切换后门的底层电路,其中三个词的拉丁触发器通过注意力头和正交潜在子空间将英语输出重定向为法语,最后一层的MLP将潜在信号转换为法语logits。
本文通过机制分析研究视觉-语言模型中的提示诱导幻觉,识别出导致模型偏向文本提示而忽视视觉证据的特定注意力头。作者证明了删除这些PIH头可以在无需额外训练的情况下减少至少40%的幻觉,揭示了该故障模式背后的模型特定机制。