Bag of Dims: 基于维度级符号模式的无需训练机制可解释性

Hugging Face Daily Papers 论文

摘要

提出了Bag of Dims框架,表明Transformer隐藏状态的标准基提供了一种无需训练、架构通用的特征表示,其中维度通过符号模式编码语义内容;在语言、视觉和音频模型上得到验证,无需学习旋转即可实现高精度。

我们证明Transformer隐藏状态的标准基已经提供了一个无需训练、架构通用的特征基。单个维度通过其符号(+/-1)编码语义内容,通过其幅度编码置信度,充当独立的二进制寄存器;一个特征是具有一致符号模式的维度子集,通过统计符号一致性来读取,无需学习旋转。我们在七个模型上验证了Bag of Dims框架,涵盖语言(Qwen 3.5-4B、Gemma 3-4B、Mistral 7B、Qwen3-32B)、视觉(DINOv2、ViT-Base)和音频(AST)。 仅符号就携带预测内容:单位幅度下的符号模式通过语言模型(LM)头部保留了60-93%的top-5下一个token准确率,无解码器的汉明评分达到了80-90%的top-4096准确率。通过单token缓存(每个token一次前向传播,无上下文,无标签),我们根据符号一致性检测到175个类别,AUC达到0.97-0.99;训练后的探针仅增加了+0.018 AUC,并收敛到轴对齐的权重。这些特征具有因果关系:它们通过K/V注意力投影存活下来,追溯到写入它们的FFN神经元联盟(随机权重对照从未重现这一点),并且在实时前向传播中翻转特征的符号会抑制其概念在四个语言模型上的表现,幅度匹配且概念特定。维度始终保持独立(成对互信息低于0.006比特)。 这种结构并非语言特有:相同的逐维度符号出现在自监督视觉(DINOv2,ImageNet超级类别中的9/12)、监督视觉(ViT-Base,11/12)和音频(AST,ESC-50类别中的50/50)中,因此它反映的是Transformer训练的通用特性,而非语言建模目标。标准基已经足以在单次前向传播中读取特征,无需优化,无需GPU天数。开放问题从寻找合适的旋转转变为编录每个维度编码的内容。
查看原文
查看缓存全文

缓存时间: 2026/06/18 15:58

论文页面 - Bag of Dims: 通过维度级符号模式实现无需训练的机制可解释性

来源:https://huggingface.co/papers/2606.12629

摘要

Transformer 隐藏状态的标准基构成了一种无需训练、架构通用的特征表示,其中单个维度通过符号编码语义内容,通过幅度编码置信度,作为独立的二进制寄存器运行,无需学习旋转或优化。

我们展示 transformer 隐藏状态的标准基 (https://huggingface.co/papers?q=standard%20basis) 已经提供了一种无需训练、架构通用的特征基 (https://huggingface.co/papers?q=feature%20basis)。单个维度通过其符号 (+/−1) 编码语义内容 (https://huggingface.co/papers?q=semantic%20content),通过幅度 (https://huggingface.co/papers?q=magnitude) 编码置信度,充当独立的二进制寄存器 (https://huggingface.co/papers?q=binary%20registers);一个特征是具有一致符号模式的维度子集,通过计数符号一致来读取,无需学习旋转。我们在七个模型上验证了这一 Bag of Dims 框架 (https://huggingface.co/papers?q=Bag%20of%20Dims%20framework),涵盖语言(Qwen 3.5-4B、Gemma 3-4B、Mistral 7B、Qwen3-32B)、视觉(DINOv2、ViT-Base)和音频(AST)。仅符号就携带预测性内容:单位幅度 (https://huggingface.co/papers?q=magnitude) 的符号模式 (https://huggingface.co/papers?q=sign%20patterns) 通过 LM 头部保留了 60-93% 的 top-5 下一个 token 准确率 (https://huggingface.co/papers?q=next-token%20accuracy),且无需解码器的汉明评分 (https://huggingface.co/papers?q=Hamming%20scoring) 在 top-4096 上达到 80-90%。从单 token 缓存 (https://huggingface.co/papers?q=token%20cache)(每个 token 一次前向传播 (https://huggingface.co/papers?q=forward%20pass),无上下文,无标签)中,我们通过符号一致检测到 175 个类别,AUC 为 0.97-0.99;训练一个探针仅增加 +0.018 AUC,并收敛到轴向对齐的权重。这些特征具有因果操作性:它们幸存于 K/V 注意力投影 (https://huggingface.co/papers?q=attention%20projections),追溯到写入它们的 FFN 神经元联盟 (https://huggingface.co/papers?q=FFN%20neuron%20coalitions)(随机权重控制从未重现这一点),并且在实时前向传播 (https://huggingface.co/papers?q=forward%20pass) 期间翻转特征的符号会在四个语言模型中抑制其概念,且是幅度 (https://huggingface.co/papers?q=magnitude) 匹配和概念特定的。维度在整个过程中保持独立(成对互信息 (https://huggingface.co/papers?q=pairwise%20mutual%20information) 低于 0.006 比特)。这种结构并非语言特有:相同的逐维度符号出现在自监督视觉 (https://huggingface.co/papers?q=self-supervised%20vision)(DINOv2,9/12 ImageNet 超类)、监督视觉 (https://huggingface.co/papers?q=supervised%20vision)(ViT-Base,11/12)和音频(AST,50/50 ESC-50 类别)中,因此它反映的是 transformer 训练的一般性,而非语言建模目标。标准基 (https://huggingface.co/papers?q=standard%20basis) 在一次前向传播 (https://huggingface.co/papers?q=forward%20pass) 中足以用于特征读取,无需优化,无需 GPU 天数。开放问题从寻找正确的旋转转向编录每个维度编码的内容。

查看 arXiv 页面 (https://arxiv.org/abs/2606.12629)查看 PDF (https://arxiv.org/pdf/2606.12629)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.12629)

在你的代理中获取此论文:

hf papers read 2606.12629

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.12629 以从此页面链接。

引用该论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.12629 以从此页面链接。

引用该论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.12629 以从此页面链接。

包含该论文的收藏集 0

没有包含此论文的收藏集

将论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

权重稀疏Transformer中的单个参数具有可解释性

arXiv cs.LG

本文介绍了一种自动化的大语言模型流水线,用于生成并验证关于Transformer中单个权重何时起作用的、人类可读的描述。研究发现,在权重稀疏的Transformer中,12%至31%的权重在全局范围内具有可解释性,其表现优于稠密Transformer。

推理的几何特征:任务难度的谱视角

arXiv cs.LG

本文研究Transformer隐藏状态空间中思维链轨迹的几何性质,引入有效维度和运动学特征,从而通过早期token预测任务难度和答案正确性。

表征作为机制可解释性的瓶颈:Manifestation Unit协议

arXiv cs.LG

本文介绍了Manifestation Units,这是一种类型化元组协议,用于将机制可解释性分析中的每个组件的统计量组织成结构化、可查询的字段。该协议在视觉(β-VAE、CNN)和语言(GPT-2)模型上进行了演示,展示了改进的检索和因果充分性。