mechanistic-interpretability

标签

Cards List
#mechanistic-interpretability

重新布线还是门控?指令调优如何塑造LLM中的知识冲突回路

arXiv cs.LG · 昨天 缓存

本文对指令调优下LLM中的知识冲突回路进行了机制性比较,发现调优是门控而非重新布线这些回路,跨越多个模型家族,对可解释性具有影响。

0 人收藏 0 人点赞
#mechanistic-interpretability

Matryoshka归因:学习将语言模型输出归因到表示和权重

arXiv cs.CL · 昨天 缓存

论文介绍了Matryoshka Attribution(MAttr),一种用于将语言模型输出归因到内部组件的掩码学习方法,在Mechanistic Interpretability Benchmark上取得了顶尖性能,并展示了通过调整权重来修改大语言模型行为的实际应用。

0 人收藏 0 人点赞
#mechanistic-interpretability

剖析 Hierarchical Reasoning Models:机制研究

arXiv cs.LG · 2天前 缓存

本文对 Hierarchical Reasoning Models (HRM) 进行机制分析,以理解其在潜在空间中的内部推理过程,采用因果干预和稀疏自编码器等技术,在数独和 ARC-AGI-2 等任务上展开研究。

0 人收藏 0 人点赞
#mechanistic-interpretability

MechaTerp-TRACE:一种用于语言模型组件消融分析的新方法

arXiv cs.CL · 2天前 缓存

该论文介绍了MechaTerp-TRACE,一种用于语言模型组件消融分析的方法,发现实体知识主要来源于通用生成机制,而非局部组件。

0 人收藏 0 人点赞
#mechanistic-interpretability

读取最佳层并非操控最佳层:全模态大语言模型中的探测-操控层分离现象

arXiv cs.CL · 2天前 缓存

本文揭示,在全模态大语言模型中,用于线性探测读取概念的最佳层与用于激活操控的最佳层并不相同,这挑战了表征工程领域的普遍经验法则。

0 人收藏 0 人点赞
#mechanistic-interpretability

如果人工智能行业遵循其自身的研究,它可能已经暂停了。

Wired · 5天前 缓存

文章探讨了如果人工智能行业遵循其自身关于灾难性风险的研究,它可能会暂停开发的情况,重点介绍了Anthropic在AI欺骗和机制可解释性方面的发现。

0 人收藏 0 人点赞
#mechanistic-interpretability

LLM数学推理中应用题求解的四阶段分解与机制脆弱性

arXiv cs.AI · 2026-09-17 缓存

本文提出了一种四阶段的机制分解,描述大型语言模型如何解答数学应用题,并通过特定的注意力头将脆弱性从无关子句定位到操作规划阶段。

0 人收藏 0 人点赞
#mechanistic-interpretability

关系先于实体:语言模型事实回忆中的延迟承诺

arXiv cs.CL · 2026-09-17 缓存

该论文发现,在语言模型中,事实回忆期间,关系类型信息比实体特定信息更早地成为控制生成的因素,表明存在一种时间不对称性,且在多种模型和提示系列中均表现稳健。

0 人收藏 0 人点赞
#mechanistic-interpretability

@Jack_W_Lindsey: 以下是我目前认为最重要的问题:-- 更好的方法来“解读”模型激活…

X AI KOLs Timeline · 2026-09-16 缓存

这条推文讨论了AI可解释性中的关键问题,特别是将神经网络激活解码为人类可读语言的方法进展。

0 人收藏 0 人点赞
#mechanistic-interpretability

诱骗方向优化:针对LLM消融攻击的后置防御

arXiv cs.LG · 2026-09-16 缓存

诱骗方向优化 (DDO) 是一种快速、后置的防御方法,通过向网络注入诱骗信号,保护开放权重的LLM免受拒绝特征消融攻击,在比训练防御更低的成本下实现高鲁棒性。

0 人收藏 0 人点赞
#mechanistic-interpretability

潜在暗涌:普通拼写错误如何击溃探测器

arXiv cs.CL · 2026-09-16 缓存

本文证明,用户输入中的普通拼写错误可以显著降低旨在检测LLMs中提示注入的激活探测器的有效性,但提出了一种KV-cache分叉方法,可以恢复大部分性能损失。

0 人收藏 0 人点赞
#mechanistic-interpretability

有害性传播动态:大型语言模型中对抗意图的逐层轨迹

arXiv cs.CL · 2026-09-15 缓存

该论文在大型语言模型中识别出有害性传播动态,并介绍了 Herald,一个轻量级的输入调节器,它利用跨层激活模式高效检测有害提示。

0 人收藏 0 人点赞
#mechanistic-interpretability

Transformer Circuits 的数学框架(2021)

Hacker News Top · 2026-09-12 缓存

本文提出了一种数学框架,用于逆向工程 Transformer 模型,以增强机制可解释性并解决 AI 系统中的安全问题。

0 人收藏 0 人点赞
#mechanistic-interpretability

智能体是否知道成功?基于内部表示的智能体置信度校准

arXiv cs.AI · 2026-09-11 缓存

本论文提出通过内部表示来校准智能体系统的置信度,在多轮基准测试中展示了其相对于基线方法的性能提升。

0 人收藏 0 人点赞
#mechanistic-interpretability

Capsule Lens: 在模型表征中定位与追踪概念几何

arXiv cs.LG · 2026-09-10 缓存

Capsule Lens 是一个用于机制可解释性的框架,它使用几何胶囊来定位和追踪概念如何在神经网络表征中编码,从而支持对模型静态和动态内部状态的分析。

0 人收藏 0 人点赞
#mechanistic-interpretability

对比投影:通过差分逻辑透镜读取Transformer内部状态

arXiv cs.CL · 2026-09-10 缓存

本文介绍了一种对比投影技术,通过差分配对提示的逻辑透镜来读取Transformer内部状态,从而能够识别不同架构(如Phi-2)中计算特有的差异。

0 人收藏 0 人点赞
#mechanistic-interpretability

SAEScientist-Bench: AI 智能体能否进行自主 SAE 可解释性研究?

Hugging Face Daily Papers · 2026-09-08 缓存

本文介绍了 SAEScientist-Bench,一个用于评估 AI 智能体自主使用稀疏自编码器进行机制可解释性研究能力的基准,揭示了进展但与专家基准相比仍有显著差距。

0 人收藏 0 人点赞
#mechanistic-interpretability

ObserverBench:测试用于干预和控制的机制估计

arXiv cs.LG · 2026-09-04 缓存

ObserverBench是一个基准框架,旨在通过报告估计准确性和下游行动性能来评估AI模型中的内部估计器是否适合指导干预、控制或安全任务。

0 人收藏 0 人点赞
#mechanistic-interpretability

大语言模型中抑郁症的可解释症状向量

arXiv cs.CL · 2026-09-03 缓存

本文通过Gemma-3-27B-PT的机制可解释性方法,提取抑郁症症状向量并与临床医生判断进行对齐,证明了可解释临床评估工具的应用前景。

0 人收藏 0 人点赞
#mechanistic-interpretability

从检测到拒绝:通过电路引导权重缩放实现更安全的LLMs

arXiv cs.CL · 2026-09-02 缓存

本文介绍了一种机理方法,通过描述一个用于拒绝行为的电路并使用电路引导的权重缩放来提升LLM安全性,在攻击下将安全率提升了26.5%,同时仅导致最小的准确率损失。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈