标签
本文研究了冻结BERT中驱动AI文本检测的神经元,通过在RAID基准测试上应用稀疏探测和激活补丁技术,识别出一小部分因果相关的神经元,这些神经元在不同生成器家族间具有泛化性。
本文使用激活补丁因果测量思维链中的推理步骤是否关键,发现行为测试高估了忠实性,而更大的模型如Qwen3-4B在不同推理深度上保持更好的忠实性。
本文研究了视觉语言模型如何通过控制反事实激活修补技术从垂直条形图中读取精确数值,揭示了内部计算机制以及Qwen和InternVL等模型之间的差异。
本文采用机制可解释性方法分析LLaMA 3.1 8B如何建模数值序列,揭示其内部计算并存储一阶差分以进行模式外推。
本研究探讨了多语言大型语言模型如何在内部处理跨语言的主谓一致,发现模型为具有显性屈折变化的语言重用共享的计算结构,表明在形态句法处理中存在跨语言重叠。
本文认为,LLM 在隐藏约束推理上的失败是路由问题,而非知识问题,并引入了一种四重诊断法,在 14 个模型上将知识、对称性、路由和修复分离开来,同时进行了激活探测和激活修补实验。
本文通过探测测试和路由是否是可分离的机制,研究语言模型如何执行上下文中的条件规则。利用跨三个开放模型和六种语言的激活修补,作者发现谓词测试是模块化的,而路由表示则受令牌绑定且不可迁移。
本文介绍了Graph-PRefLexOR-8B的图到答案机制追踪案例研究,该模型是一个材料科学假设生成模型,利用可视化和基于激活的诊断方法,定位生成过程中机制支持在何处丢失或恢复。
本文在受控的辛普森悖论世界中测试了预训练中增加干预数据是否能提升大语言模型的因果方向推理能力。研究发现,训练混合比例并不决定干预证据的使用,相反,推理时上下文中的证据类型才是决定性因素。
本文提出了对反应式计算图进行穷举扫描和顺序变异的理论成本核算,推导出加速比,并在基于Julia的图引擎上进行了验证。
本文研究了LLM中的算术启发神经元在符号算术、自然语言文字题和Python代码中是否具有形式不变性。通过激活修补,他们发现了一个共享的神经元回路,该回路对于算术计算是必要且充分的,并且跨格式失败源于激活状态而非不同的回路。
本文研究视觉-语言模型如何解决视觉证据与世界知识之间的冲突,揭示了视觉基础是默认的,而先验知识依赖于一小部分位于后层的注意力头。作者在三个VLM系列上进行因果分析,展示了一种不对称结构:消融这些头部会使得预测从基于知识的答案转向基于视觉的答案。
本文从因果中介分析重新推导激活修补,揭示自然间接效应(NIE)不仅捕捉组件的因果效应,还捕捉与其他组件的交互效应。文章在GPT-2 IOI电路中展示了这些隐藏交互,并论证它们是一种诊断工具而非干扰。
本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。
论文提出了遗忘深度评分(UDS),这是一种利用激活修补来量化目标知识从大语言模型中被彻底擦除程度的指标,在多种遗忘方法上实现了最先进的忠实度和鲁棒性。
提出了交互局部性(interaction locality)这一任务几何感知框架,用于衡量空间推理模型中的信息流是停留在局部单元内还是跨越到全局结构,并将其应用于HRM、TRM和MTU3D模型,在网格基准测试和具身3D定位任务上进行评估。
本文提出了一种用于Transformer语言模型中因果特征分析的五阶段方法论,并在GPT-2 small上针对IOI任务进行了演示。研究发现特征具有特定的因果性但并非必要,并揭示了检测鲁棒性与因果鲁棒性之间的差距。
本文通过机理可解释性研究大型语言模型如何处理情感效价。通过在三个开源LLMs上使用激活修补和引导,作者发现负面效价定位于早期层,而正面效价在中后期层达到峰值,并通过主题控制翻转测试验证了这一点。
本文提供因果证据表明自回归语言模型中的幻觉源于由非对称吸引子动力学驱动的早期轨迹承诺。通过在Qwen2.5-1.5B上进行同提示分叉和激活补丁实验,证明幻觉轨迹在首个token处分叉,并在模型各层间展现强烈的因果非对称性。