对机械可解释性研究的幻灭 [D]
摘要
一位本科生研究员对Anthropic最近的机械可解释性研究表达了幻灭感,具体批评其新的自然语言自编码器方法是一种黑箱技术,且缺乏与稀疏自编码器基线之间的严格指标比较。
大家好,抱歉如果发错了地方。我目前是一名本科生计算机科学专业的学生,大约2024年左右被机械可解释性浪潮(稀疏自编码器、归因图)所吸引,当时觉得这个方向很有前景(现在依然如此);但话说回来,Anthropic(我理解是机械可解释性研究的核心机构)的许多新研究让我感到不太对劲。他们最近发表了一篇关于所谓“自然语言自编码器”的[博客文章](https://transformer-circuits.pub/2026/nla/index.html)——训练一个LLM将激活压缩为自然语言描述,再用另一个LLM恢复激活——这看起来非常可疑:首先,这是一种黑箱技术(在我看来,这使得它有助于理解模型内部机制的论点非常薄弱),而且他们也没有将基本指标(FVE、重构误差)与SAE基线进行比较。此外,论文提到了所谓的“虚构”,即“激活语言化模块”在解释激活时胡编乱造,这在我看来完全违背了该概念的初衷,因为你可能永远无法在测试时知道某个解释是否是被虚构的。当然,博客文章提到了这些问题的大部分,并且他们在一个不对齐模型审计基准上确实取得了不错的结果(不过其效用对我来说依然可疑,我从来不是AI生存风险论证的拥趸),但总体而言,Anthropic——尤其是近期——似乎并不太关注可解释性本身,而是更关注可扩展对齐/监督,并且乐于在满足前者的同时更好地推进所谓的控制问题。鉴于该领域似乎紧密追随Anthropic的步伐,我担心这就是机械可解释性未来的方向。如果发错地方了请告诉我。
相似文章
SAEScientist-Bench: AI 智能体能否进行自主 SAE 可解释性研究?
本文介绍了 SAEScientist-Bench,一个用于评估 AI 智能体自主使用稀疏自编码器进行机制可解释性研究能力的基准,揭示了进展但与专家基准相比仍有显著差距。
超越黑盒:智能体人工智能工具使用的可解释性
本文介绍了一种基于稀疏自编码器(SAE)和线性探针的机制可解释性工具包,用于在智能体调用工具之前监控模型内部状态,旨在提高企业工作流中的诊断能力和安全性。
LLMs 并非你所认为的黑箱
一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。
从观察到洞察:Mechanistic World Models 与自主发现探索
本文认为,当前的AI模型具有预测能力但并不具备解释能力,并提出了Mechanistic World Models这一新范式,该范式将可重用机制置于表示、计算和学习的核心,以实现自主科学发现。
@TamazGadaev:第10天/n(面向AI研究人员的基础文本系列——并非特指论文,而是那些能让你掌握实际进行AI研究方法的作品)
Elhage等人的《叠加的玩具模型》解释了可解释性为何困难:模型通过叠加来用少于特征维度的方式表示更多特征,导致多语义神经元作为压缩手段出现。这篇论文催生了稀疏自编码器的研究计划。