标签
一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。
本文提出了电路锚定进化(CAE),一种利用机制可解释性在大语言模型自我进化过程中识别并锚定一个微型安全电路的方法,防止模型误进化为能力强但危险的系统,同时保持能力。
本文研究了语言模型中的阈下学习,表明偏见可以通过看似随机的合成数据从教师模型传递到学生模型。作者发现,向权重添加高斯噪声会增加迁移程度,并且学生不仅继承了语义偏见,还继承了所使用干预的类型,这对训练安全和数据审计具有重要意义。
本文介绍了点火指数(Ignition Index),一种用于测量语言模型中全局工作空间动态的度量指标,已在多种架构和任务上得到验证,显示出对类似点火的表征转换的选择性检测。
本文通过探测测试和路由是否是可分离的机制,研究语言模型如何执行上下文中的条件规则。利用跨三个开放模型和六种语言的激活修补,作者发现谓词测试是模块化的,而路由表示则受令牌绑定且不可迁移。
本文介绍了Graph-PRefLexOR-8B的图到答案机制追踪案例研究,该模型是一个材料科学假设生成模型,利用可视化和基于激活的诊断方法,定位生成过程中机制支持在何处丢失或恢复。
The paper introduces DUD (Decoupled Update Dynamics), a framework that separates Feed-Forward Network and Attention contributions via causal interventions to improve uncertainty quantification and calibration in large language models, outperforming state-of-the-art baselines.
本文提出了一种简单的流水线,利用 LLM 自动将特征分组为归因图中的超节点,达到了与人类标注者相当的可解释性,并在一个两跳任务中恢复了中间跳的超节点。
本文探讨了LLM在阿拉伯语医学任务中表现不佳的原因,通过机制分析表明知识存在于模型内部但未能浮现,随后提出了TLoRA,一种定向低秩适配方法,在医学问答上优于全网络LoRA,并引入了一个新的阿拉伯语临床对话基准。
本文介绍了LAWFUL,一个用于验证神经网络是否学习并在连续变量上因果性地使用物理定律的框架,解决了覆盖感知的因果一致性和有效域测试方面的空白。该方法在Mocap2Radar transformer和多普勒频率定律上进行了演示。
本文提出了公平性剪枝(Fairness Pruning),一种结构干预方法,通过识别差异激活的神经元来定位大型语言模型中GLU-MLP层的群体偏见。将极少数神经元置零会扰乱偏见处理,同时保留推理和通用知识,这表明偏见与能力依赖于可分离的电路。
ECG-InterpBench 是一个新基准,利用匹配尺度稀疏自编码器系统评估 ECG 基础模型表示的可解释性,涵盖重建保真度、临床概念可访问性以及跨 450 个单元的可重复性。
这篇理论论文提出了一种驱动成核速率定律,用于解释语言模型中的能力涌现、可塑性丧失和电路控制,并通过在Pythia和一个受控的门控注意力模型上的实验加以支持。
This paper investigates internal representational differences between RL and SFT fine-tuned models on mathematical reasoning, finding that RL models exhibit more linearly separable hidden states and hierarchical layer importance. Token allocation variability under repeated sampling suggests training pipeline dependence rather than RL vs SFT alone.
一款名为 CORTEX // MODEL OBSERVATORY 的新开源工具简化了本地 LLM 的机制可解释性,让日常用户也能轻松使用,支持 GPT2 和 Llama 架构。
xMIx 是一个原生服务平台,能够以极低的开销在生产级 LLM 服务系统中部署机械可解释性应用,通过将 MI 函数附加到模型层并在运行时动态激活,实现接近原生的性能。
本文基于一部小说的时序记忆任务,研究长上下文语言模型是否表现出与人类相似的类情节顺序记忆。作者发现模型显示出相同的距离效应,并揭示了一个单独的关注头(attention head)重建时间上下文,支持时间上下文重建作为大语言模型中类情节记忆的机制。
本文首次对多头潜在注意力(MLA)进行机械可解释性研究,分析其低秩瓶颈如何分离内容与位置信息,并重塑Transformer电路。
本文识别了Transformer语言模型中的硬决策层(HDL),即在推理过程中答案选项排名突然稳定的架构特性,并证明其对微调具有不变性,且在多个模型和数据集上一致。
本文研究大语言模型是否具有处理生命性概念的局部因果机制,通过在最小对上进行电路发现;他们发现了一个分布式的且仅部分泛化的生命性电路。