mechanistic-interpretability

标签

Cards List
#mechanistic-interpretability

ObserverBench:测试用于干预和控制的机制估计

arXiv cs.LG ↗ · 2026-09-04 缓存

ObserverBench是一个基准框架,旨在通过报告估计准确性和下游行动性能来评估AI模型中的内部估计器是否适合指导干预、控制或安全任务。

0 人收藏 0 人点赞
#mechanistic-interpretability

大语言模型中抑郁症的可解释症状向量

arXiv cs.CL ↗ · 2026-09-03 缓存

本文通过Gemma-3-27B-PT的机制可解释性方法,提取抑郁症症状向量并与临床医生判断进行对齐,证明了可解释临床评估工具的应用前景。

0 人收藏 0 人点赞
#mechanistic-interpretability

从检测到拒绝:通过电路引导权重缩放实现更安全的LLMs

arXiv cs.CL ↗ · 2026-09-02 缓存

本文介绍了一种机理方法,通过描述一个用于拒绝行为的电路并使用电路引导的权重缩放来提升LLM安全性,在攻击下将安全率提升了26.5%,同时仅导致最小的准确率损失。

0 人收藏 0 人点赞
#mechanistic-interpretability

语言模型如何选择立场:指令层级的内部表示

arXiv cs.AI ↗ · 2026-09-01 缓存

本文研究指令微调的大语言模型如何仲裁系统指令与用户指令之间的冲突,揭示用户偏好行为与可读的内部仲裁信号共存,并通过机械可解释性技术和引导实验进行演示。

0 人收藏 0 人点赞
#mechanistic-interpretability

语言模型表征的统一视角:从填充者角色结构到机械可解释性

arXiv cs.CL ↗ · 2026-09-01 缓存

本文提出将张量积表示作为语言模型可解释性的统一框架,并通过数学和实证方法表明它整合了诸如加法类比、线性探测、稀疏自编码器和激活补丁等方法。

0 人收藏 0 人点赞
#mechanistic-interpretability

因果干预揭示多语言模型中的类型学组织句法机制

arXiv cs.CL ↗ · 2026-09-01 缓存

本文使用因果干预来研究多语言模型中的句法机制,揭示了基于类型学相似性的分级跨语言迁移。

0 人收藏 0 人点赞
#mechanistic-interpretability

用于可控数据生成的机制性电路识别

arXiv cs.LG ↗ · 2026-08-26 缓存

本文提出了一种基于电路的框架,利用机制性可解释性实现语言模型中的可控数据生成,引入SAMS进行阶段感知的数据调度,以提高训练性能。

0 人收藏 0 人点赞
#mechanistic-interpretability

利用几何不变稀疏自编码器探索大型语言模型中的跨语言推理不变性

arXiv cs.LG ↗ · 2026-08-26 缓存

本研究探讨多语言大型语言模型是否为跨语言数学推理发展出共享的内部表示,引入了一种新颖的几何不变稀疏自编码器(GI-SAE)方法。研究发现,跨语言特征共享依赖于模型,且几何相似性并不一致意味着功能可互换性。

0 人收藏 0 人点赞
#mechanistic-interpretability

对齐、统一、抑制、路由:Transformer计算的融贯论视角

arXiv cs.CL ↗ · 2026-08-25 缓存

论文介绍了融贯论概率组合理论(CPC),这是一个通过四种操作者角色解释Transformer计算的框架,并在来自五个架构家族的15个模型上进行了验证。

0 人收藏 0 人点赞
#mechanistic-interpretability

机理层析成像:面向控制的可解释性设计测量

arXiv cs.LG ↗ · 2026-08-21 缓存

本文提出机理层析成像作为一种统一框架,用于设计测量以恢复AI模型中的内部机制,并通过干预和校准提高面向控制的可解释性。

0 人收藏 0 人点赞
#mechanistic-interpretability

LLaMA 3.1 8B中结构感知数值推理的机制可解释性

arXiv cs.LG ↗ · 2026-08-20 缓存

本文采用机制可解释性方法分析LLaMA 3.1 8B如何建模数值序列,揭示其内部计算并存储一阶差分以进行模式外推。

0 人收藏 0 人点赞
#mechanistic-interpretability

生物和人工神经网络之间的双向表征对齐

arXiv cs.LG ↗ · 2026-08-20 缓存

本文提出一个计算框架,用于调控表征几何以改善生物和人工神经网络之间的双向对齐,展示了双向预测能力的55%相对提升。

0 人收藏 0 人点赞
#mechanistic-interpretability

通过拒绝别名缓解Abliteration

arXiv cs.CL ↗ · 2026-08-20 缓存

本文介绍了AMRA,一种权重编辑方法,通过模糊拒绝信号来缓解大型语言模型中的Abliteration,在Llama-3-8B和Gemma-2-9B上提升消融后的拒绝分数,同时最小化效用下降。

0 人收藏 0 人点赞
#mechanistic-interpretability

J-Miner: 从语言模型分类器中恢复可执行决策知识

arXiv cs.LG ↗ · 2026-08-19 缓存

J-Miner 通过挖掘命名概念和学习决策规则,从微调的语言模型分类器中恢复可执行决策知识,实现检查并高保真地转移到轻量级模型。

0 人收藏 0 人点赞
#mechanistic-interpretability

语言模型训练过程中,概念何时实现功能充分性?

arXiv cs.CL ↗ · 2026-08-18 缓存

本文引入了一个基于检查点的激活干预框架,用于研究概念在语言模型训练过程中如何变得功能充分,并比较了跨层和模型的保存目标。

0 人收藏 0 人点赞
#mechanistic-interpretability

解释多重性:电路级可解释性证据在可辩护的分析变异下无法保持

arXiv cs.AI ↗ · 2026-08-17 缓存

该研究表明,AI系统的电路级可解释性证据在不同分析设置中表现出高度变异性,未能满足诸如EU AI Act等法规要求的一致性标准。

0 人收藏 0 人点赞
#mechanistic-interpretability

内部动作映射的校准测试:无全局仿射闭包的状态信号

arXiv cs.AI ↗ · 2026-08-17 缓存

本文提出了一种针对语言模型内部动作映射的校准测试,展示了在无全局仿射闭包的情况下,状态信号可被解码并因果使用,通过证据格框架在有限世界和Qwen3-4B模型上进行了验证。

0 人收藏 0 人点赞
#mechanistic-interpretability

基于扰动的减法映射区域可解释性(PRISM):语言模型与卒中后失语症中的命名错误分离

arXiv cs.LG ↗ · 2026-08-14 缓存

本文介绍了PRISM,一种用于大型语言模型空间分辨可解释性的基于扰动的方法,将神经影像减法分析适配到Transformer,并平行应用于卒中后失语症患者,以恢复共享的语音优势分离。

0 人收藏 0 人点赞
#mechanistic-interpretability

Transformer残差流中的几何与行为分层

arXiv cs.LG ↗ · 2026-08-14 缓存

本文研究了训练后Transformer的残差流几何结构,表明预测方向作为一个特权锚点,将残差流的变化分为狭窄的、与读出相关的区域和宽广的计算区域,这一现象在18个模型中均成立。这些发现对可解释性和评估具有启示意义。

0 人收藏 0 人点赞
#mechanistic-interpretability

虚假与不可能在AI语言表征中指向不同方向

arXiv cs.CL ↗ · 2026-08-14 缓存

本文报告了对Gemma 3 4B IT的激活研究,表明该模型的内部表征能够区分必然性虚假(不可能)与偶然性虚假,其中不可能方向与真实方向正交,并与语义异常方向重叠。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈