标签
该论文通过行为分析、表示探查和因果干预,研究了AM、POMO和LEHD等神经组合优化(NCO)路由求解器的内部决策机制,揭示了不同架构在构造解决方案时的差异化模式,例如LEHD依赖当前节点表示进行局部决策、起始节点提供全局导航参考。
本文提出一种结构性电路分析,以在多语言语言模型中识别首令牌分发器和语言标识头部,揭示了稳定的枢纽拓扑结构,并且路由电路主要是在预训练期间建立的。
本文介绍大语言模型内省诊断,一个用于审计语言模型潜在知识的白盒框架,表明行为评估可能无法反映内部知识区别,这在 Minerva-7B-Instruct-v1.0 上得到验证。
本文表明,Transformer模型在早期层编码对话伙伴的专业知识,但仅在后期层才在因果上激活它,这揭示了一个限制多轮对话中引导模型行为的干预点的间隙。
本文提出了一种针对语言模型内部动作映射的校准测试,展示了在无全局仿射闭包的情况下,状态信号可被解码并因果使用,通过证据格框架在有限世界和Qwen3-4B模型上进行了验证。
本文研究LLM中的语言身份是否可以通过紧凑的激活方向进行线性解码和因果控制。通过在多个模型家族上进行引导(steering)和消融(ablation)实验,作者表明语言选择具有方向依赖性、层特异性,并且在语言信号被消融时会恢复为英语。
This paper introduces M2BIND, a benchmark to evaluate whether vision-language models maintain stable visual-linguistic associations across languages. It finds that binding is not language-invariant, with cross-family and cross-script settings causing significant performance collapse and weaker internal causal binding.
This paper investigates when large language models develop domain-specific parametric shells (causally necessary neuron populations), finding that modular training data at the token level (e.g., languages, code) produces functional shells, while academic subject domains do not, despite being linearly decodable.
介绍了 Mechanist,一个自主的智能体系统,利用人工智能来发现和控制模型智能背后的机制,生成假设、执行因果干预,并提高安全性和性能。
CausalGate引入了一种方法,通过因果干预测量Transformer子层的重要性,并将其蒸馏为静态标量门控,实现高效推理且无运行时开销,优于现有的剪枝和路由方法。
本文研究了大型语言模型中的短期注意力衰减,发现了一种普遍的指数衰减后趋于平稳的模式,并且功能标记锚定依赖于架构。因果测试表明,增加功能标记上的注意力权重并不会改善检索性能,这表明注意力衰减是描述性的而非规范性的。
本文介绍了Visual Access Sweep,一种因果干预方法,用于衡量视觉语言模型推理所需的最小图像标记访问量,并发现思维链(Chain-of-Thought)提示并非主要通过延长直接图像访问来提升性能,而是通过在视觉信息上扩展语言侧计算来实现。
本文研究了潜在推理步骤的忠实性在训练过程中如何演变,发现其取决于训练阶段和答案格式,而不仅仅是最终检查点的性能。
本文研究了多模态大语言模型在生成过程中的令牌级注意力转移,揭示了其中的一致模式,并提出了一种简单的测试时干预方法,显著提升了任务性能。
本文揭示了大视觉语言模型中的幻觉是由一种动态结构错位引起的,其中某些注意力头充当风险中介,与视觉证据解耦,转而锁定语言先验。作者提出了Fox,一种无需训练的因果干预框架,能够诊断并物理切断这些病态捷径,在忠实解码中实现了最先进的性能。
本文证明权重范数因果性地控制神经网络中grokking的时间尺度,调和了相互矛盾的论述。通过干预实验,它表明grokking遵循指数延迟定律,且范数大小在不同架构中比学习率更主导grokking时间。
本文识别了MLLMs中不平衡的注意力头组,这些头组驱动或抵抗模态冲突幻觉,并提出了MACI(模态冲突感知因果干预),一种仅在检测到冲突时抑制幻觉驱动头的因果干预方法,在五个模型上实现了大幅的幻觉减少。