对机械可解释性研究的幻灭 [D]

Reddit r/MachineLearning 新闻

摘要

一位本科生研究员对Anthropic最近的机械可解释性研究表达了幻灭感,具体批评其新的自然语言自编码器方法是一种黑箱技术,且缺乏与稀疏自编码器基线之间的严格指标比较。

大家好,抱歉如果发错了地方。我目前是一名本科生计算机科学专业的学生,大约2024年左右被机械可解释性浪潮(稀疏自编码器、归因图)所吸引,当时觉得这个方向很有前景(现在依然如此);但话说回来,Anthropic(我理解是机械可解释性研究的核心机构)的许多新研究让我感到不太对劲。他们最近发表了一篇关于所谓“自然语言自编码器”的[博客文章](https://transformer-circuits.pub/2026/nla/index.html)——训练一个LLM将激活压缩为自然语言描述,再用另一个LLM恢复激活——这看起来非常可疑:首先,这是一种黑箱技术(在我看来,这使得它有助于理解模型内部机制的论点非常薄弱),而且他们也没有将基本指标(FVE、重构误差)与SAE基线进行比较。此外,论文提到了所谓的“虚构”,即“激活语言化模块”在解释激活时胡编乱造,这在我看来完全违背了该概念的初衷,因为你可能永远无法在测试时知道某个解释是否是被虚构的。当然,博客文章提到了这些问题的大部分,并且他们在一个不对齐模型审计基准上确实取得了不错的结果(不过其效用对我来说依然可疑,我从来不是AI生存风险论证的拥趸),但总体而言,Anthropic——尤其是近期——似乎并不太关注可解释性本身,而是更关注可扩展对齐/监督,并且乐于在满足前者的同时更好地推进所谓的控制问题。鉴于该领域似乎紧密追随Anthropic的步伐,我担心这就是机械可解释性未来的方向。如果发错地方了请告诉我。
查看原文

相似文章

LLMs 并非你所认为的黑箱

Hacker News Top

一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。