标签
ObserverBench是一个基准框架,旨在通过报告估计准确性和下游行动性能来评估AI模型中的内部估计器是否适合指导干预、控制或安全任务。
本文通过Gemma-3-27B-PT的机制可解释性方法,提取抑郁症症状向量并与临床医生判断进行对齐,证明了可解释临床评估工具的应用前景。
本文介绍了一种机理方法,通过描述一个用于拒绝行为的电路并使用电路引导的权重缩放来提升LLM安全性,在攻击下将安全率提升了26.5%,同时仅导致最小的准确率损失。
本文研究指令微调的大语言模型如何仲裁系统指令与用户指令之间的冲突,揭示用户偏好行为与可读的内部仲裁信号共存,并通过机械可解释性技术和引导实验进行演示。
本文提出将张量积表示作为语言模型可解释性的统一框架,并通过数学和实证方法表明它整合了诸如加法类比、线性探测、稀疏自编码器和激活补丁等方法。
本文使用因果干预来研究多语言模型中的句法机制,揭示了基于类型学相似性的分级跨语言迁移。
本文提出了一种基于电路的框架,利用机制性可解释性实现语言模型中的可控数据生成,引入SAMS进行阶段感知的数据调度,以提高训练性能。
本研究探讨多语言大型语言模型是否为跨语言数学推理发展出共享的内部表示,引入了一种新颖的几何不变稀疏自编码器(GI-SAE)方法。研究发现,跨语言特征共享依赖于模型,且几何相似性并不一致意味着功能可互换性。
论文介绍了融贯论概率组合理论(CPC),这是一个通过四种操作者角色解释Transformer计算的框架,并在来自五个架构家族的15个模型上进行了验证。
本文提出机理层析成像作为一种统一框架,用于设计测量以恢复AI模型中的内部机制,并通过干预和校准提高面向控制的可解释性。
本文采用机制可解释性方法分析LLaMA 3.1 8B如何建模数值序列,揭示其内部计算并存储一阶差分以进行模式外推。
本文提出一个计算框架,用于调控表征几何以改善生物和人工神经网络之间的双向对齐,展示了双向预测能力的55%相对提升。
本文介绍了AMRA,一种权重编辑方法,通过模糊拒绝信号来缓解大型语言模型中的Abliteration,在Llama-3-8B和Gemma-2-9B上提升消融后的拒绝分数,同时最小化效用下降。
J-Miner 通过挖掘命名概念和学习决策规则,从微调的语言模型分类器中恢复可执行决策知识,实现检查并高保真地转移到轻量级模型。
本文引入了一个基于检查点的激活干预框架,用于研究概念在语言模型训练过程中如何变得功能充分,并比较了跨层和模型的保存目标。
该研究表明,AI系统的电路级可解释性证据在不同分析设置中表现出高度变异性,未能满足诸如EU AI Act等法规要求的一致性标准。
本文提出了一种针对语言模型内部动作映射的校准测试,展示了在无全局仿射闭包的情况下,状态信号可被解码并因果使用,通过证据格框架在有限世界和Qwen3-4B模型上进行了验证。
本文介绍了PRISM,一种用于大型语言模型空间分辨可解释性的基于扰动的方法,将神经影像减法分析适配到Transformer,并平行应用于卒中后失语症患者,以恢复共享的语音优势分离。
本文研究了训练后Transformer的残差流几何结构,表明预测方向作为一个特权锚点,将残差流的变化分为狭窄的、与读出相关的区域和宽广的计算区域,这一现象在18个模型中均成立。这些发现对可解释性和评估具有启示意义。
本文报告了对Gemma 3 4B IT的激活研究,表明该模型的内部表征能够区分必然性虚假(不可能)与偶然性虚假,其中不可能方向与真实方向正交,并与语义异常方向重叠。