mechanistic-interpretability

标签

Cards List
#mechanistic-interpretability

语言模型中的跨架构引导迁移:一项系统性实证研究

arXiv cs.CL · 2天前 缓存

一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。

0 人收藏 0 人点赞
#mechanistic-interpretability

基于电路锚点的安全进化

arXiv cs.CL · 2天前 缓存

本文提出了电路锚定进化(CAE),一种利用机制可解释性在大语言模型自我进化过程中识别并锚定一个微型安全电路的方法,防止模型误进化为能力强但危险的系统,同时保持能力。

0 人收藏 0 人点赞
#mechanistic-interpretability

阈下学习是非语义蒸馏

arXiv cs.AI · 2天前 缓存

本文研究了语言模型中的阈下学习,表明偏见可以通过看似随机的合成数据从教师模型传递到学生模型。作者发现,向权重添加高斯噪声会增加迁移程度,并且学生不仅继承了语义偏见,还继承了所使用干预的类型,这对训练安全和数据审计具有重要意义。

0 人收藏 0 人点赞
#mechanistic-interpretability

点火指数:测量语言模型中的全局工作空间动态

arXiv cs.AI · 2天前 缓存

本文介绍了点火指数(Ignition Index),一种用于测量语言模型中全局工作空间动态的度量指标,已在多种架构和任务上得到验证,显示出对类似点火的表征转换的选择性检测。

0 人收藏 0 人点赞
#mechanistic-interpretability

测试,然后路由:语言模型如何跨模型和语言执行上下文中的条件规则

arXiv cs.CL · 3天前 缓存

本文通过探测测试和路由是否是可分离的机制,研究语言模型如何执行上下文中的条件规则。利用跨三个开放模型和六种语言的激活修补,作者发现谓词测试是模块化的,而路由表示则受令牌绑定且不可迁移。

0 人收藏 0 人点赞
#mechanistic-interpretability

可视化材料科学假设生成中的图到答案机制恢复

arXiv cs.CL · 3天前 缓存

本文介绍了Graph-PRefLexOR-8B的图到答案机制追踪案例研究,该模型是一个材料科学假设生成模型,利用可视化和基于激活的诊断方法,定位生成过程中机制支持在何处丢失或恢复。

0 人收藏 0 人点赞
#mechanistic-interpretability

DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models

arXiv cs.CL · 4天前 缓存

The paper introduces DUD (Decoupled Update Dynamics), a framework that separates Feed-Forward Network and Attention contributions via causal interventions to improve uncertainty quantification and calibration in large language models, outperforming state-of-the-art baselines.

0 人收藏 0 人点赞
#mechanistic-interpretability

LLMs 可以标注归因图

arXiv cs.LG · 4天前 缓存

本文提出了一种简单的流水线,利用 LLM 自动将特征分组为归因图中的超节点,达到了与人类标注者相当的可解释性,并在一个两跳任务中恢复了中间跳的超节点。

0 人收藏 0 人点赞
#mechanistic-interpretability

弥合英语-阿拉伯语医学知识鸿沟:基于因果层选择的定向低秩适配

arXiv cs.CL · 5天前 缓存

本文探讨了LLM在阿拉伯语医学任务中表现不佳的原因,通过机制分析表明知识存在于模型内部但未能浮现,随后提出了TLoRA,一种定向低秩适配方法,在医学问答上优于全网络LoRA,并引入了一个新的阿拉伯语临床对话基准。

0 人收藏 0 人点赞
#mechanistic-interpretability

LAWFUL:用于潜在变量忠实使用的定律对齐见证

arXiv cs.LG · 6天前 缓存

本文介绍了LAWFUL,一个用于验证神经网络是否学习并在连续变量上因果性地使用物理定律的框架,解决了覆盖感知的因果一致性和有效域测试方面的空白。该方法在Mocap2Radar transformer和多普勒频率定律上进行了演示。

0 人收藏 0 人点赞
#mechanistic-interpretability

公平性剪枝:通过差异激活定位GLU-MLP层中的群体偏见

arXiv cs.CL · 2026-07-31 缓存

本文提出了公平性剪枝(Fairness Pruning),一种结构干预方法,通过识别差异激活的神经元来定位大型语言模型中GLU-MLP层的群体偏见。将极少数神经元置零会扰乱偏见处理,同时保留推理和通用知识,这表明偏见与能力依赖于可分离的电路。

0 人收藏 0 人点赞
#mechanistic-interpretability

ECG-InterpBench:使用匹配尺度稀疏自编码器对ECG基础模型可解释性进行基准测试

arXiv cs.LG · 2026-07-31 缓存

ECG-InterpBench 是一个新基准,利用匹配尺度稀疏自编码器系统评估 ECG 基础模型表示的可解释性,涵盖重建保真度、临床概念可访问性以及跨 450 个单元的可重复性。

0 人收藏 0 人点赞
#mechanistic-interpretability

训练的动力学:语言模型中涌现、可塑性丧失与电路控制的驱动成核速率定律

arXiv cs.LG · 2026-07-31 缓存

这篇理论论文提出了一种驱动成核速率定律,用于解释语言模型中的能力涌现、可塑性丧失和电路控制,并通过在Pythia和一个受控的门控注意力模型上的实验加以支持。

0 人收藏 0 人点赞
#mechanistic-interpretability

Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models

arXiv cs.AI · 2026-07-31 缓存

This paper investigates internal representational differences between RL and SFT fine-tuned models on mathematical reasoning, finding that RL models exhibit more linearly separable hidden states and hierarchical layer importance. Token allocation variability under repeated sampling suggests training pipeline dependence rather than RL vs SFT alone.

0 人收藏 0 人点赞
#mechanistic-interpretability

面向日常用户的机制可解释性简化工具😎 🧠

Reddit r/LocalLLaMA · 2026-07-30

一款名为 CORTEX // MODEL OBSERVATORY 的新开源工具简化了本地 LLM 的机制可解释性,让日常用户也能轻松使用,支持 GPT2 和 Llama 架构。

0 人收藏 0 人点赞
#mechanistic-interpretability

xMIx:面向机械可解释性应用的高性能服务时平台

arXiv cs.AI · 2026-07-28 缓存

xMIx 是一个原生服务平台,能够以极低的开销在生产级 LLM 服务系统中部署机械可解释性应用,通过将 MI 函数附加到模型层并在运行时动态激活,实现接近原生的性能。

0 人收藏 0 人点赞
#mechanistic-interpretability

时间上下文重建驱动长上下文语言模型中的类情节顺序记忆

arXiv cs.AI · 2026-07-28 缓存

本文基于一部小说的时序记忆任务,研究长上下文语言模型是否表现出与人类相似的类情节顺序记忆。作者发现模型显示出相同的距离效应,并揭示了一个单独的关注头(attention head)重建时间上下文,支持时间上下文重建作为大语言模型中类情节记忆的机制。

0 人收藏 0 人点赞
#mechanistic-interpretability

穿越瓶颈:多头潜在注意力如何在语言模型中分离内容与位置

arXiv cs.LG · 2026-07-28 缓存

本文首次对多头潜在注意力(MLA)进行机械可解释性研究,分析其低秩瓶颈如何分离内容与位置信息,并重塑Transformer电路。

0 人收藏 0 人点赞
#mechanistic-interpretability

硬决策层:Transformers中承诺推理的证据

arXiv cs.CL · 2026-07-27 缓存

本文识别了Transformer语言模型中的硬决策层(HDL),即在推理过程中答案选项排名突然稳定的架构特性,并证明其对微调具有不变性,且在多个模型和数据集上一致。

0 人收藏 0 人点赞
#mechanistic-interpretability

大语言模型中生命性概念的定位:追踪生命性概念的回路

arXiv cs.CL · 2026-07-24 缓存

本文研究大语言模型是否具有处理生命性概念的局部因果机制,通过在最小对上进行电路发现;他们发现了一个分布式的且仅部分泛化的生命性电路。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈