Bag of Dims: 基于维度级符号模式的无需训练机制可解释性
摘要
提出了Bag of Dims框架,表明Transformer隐藏状态的标准基提供了一种无需训练、架构通用的特征表示,其中维度通过符号模式编码语义内容;在语言、视觉和音频模型上得到验证,无需学习旋转即可实现高精度。
查看缓存全文
缓存时间: 2026/06/18 15:58
论文页面 - Bag of Dims: 通过维度级符号模式实现无需训练的机制可解释性
来源:https://huggingface.co/papers/2606.12629
摘要
Transformer 隐藏状态的标准基构成了一种无需训练、架构通用的特征表示,其中单个维度通过符号编码语义内容,通过幅度编码置信度,作为独立的二进制寄存器运行,无需学习旋转或优化。
我们展示 transformer 隐藏状态的标准基 (https://huggingface.co/papers?q=standard%20basis) 已经提供了一种无需训练、架构通用的特征基 (https://huggingface.co/papers?q=feature%20basis)。单个维度通过其符号 (+/−1) 编码语义内容 (https://huggingface.co/papers?q=semantic%20content),通过幅度 (https://huggingface.co/papers?q=magnitude) 编码置信度,充当独立的二进制寄存器 (https://huggingface.co/papers?q=binary%20registers);一个特征是具有一致符号模式的维度子集,通过计数符号一致来读取,无需学习旋转。我们在七个模型上验证了这一 Bag of Dims 框架 (https://huggingface.co/papers?q=Bag%20of%20Dims%20framework),涵盖语言(Qwen 3.5-4B、Gemma 3-4B、Mistral 7B、Qwen3-32B)、视觉(DINOv2、ViT-Base)和音频(AST)。仅符号就携带预测性内容:单位幅度 (https://huggingface.co/papers?q=magnitude) 的符号模式 (https://huggingface.co/papers?q=sign%20patterns) 通过 LM 头部保留了 60-93% 的 top-5 下一个 token 准确率 (https://huggingface.co/papers?q=next-token%20accuracy),且无需解码器的汉明评分 (https://huggingface.co/papers?q=Hamming%20scoring) 在 top-4096 上达到 80-90%。从单 token 缓存 (https://huggingface.co/papers?q=token%20cache)(每个 token 一次前向传播 (https://huggingface.co/papers?q=forward%20pass),无上下文,无标签)中,我们通过符号一致检测到 175 个类别,AUC 为 0.97-0.99;训练一个探针仅增加 +0.018 AUC,并收敛到轴向对齐的权重。这些特征具有因果操作性:它们幸存于 K/V 注意力投影 (https://huggingface.co/papers?q=attention%20projections),追溯到写入它们的 FFN 神经元联盟 (https://huggingface.co/papers?q=FFN%20neuron%20coalitions)(随机权重控制从未重现这一点),并且在实时前向传播 (https://huggingface.co/papers?q=forward%20pass) 期间翻转特征的符号会在四个语言模型中抑制其概念,且是幅度 (https://huggingface.co/papers?q=magnitude) 匹配和概念特定的。维度在整个过程中保持独立(成对互信息 (https://huggingface.co/papers?q=pairwise%20mutual%20information) 低于 0.006 比特)。这种结构并非语言特有:相同的逐维度符号出现在自监督视觉 (https://huggingface.co/papers?q=self-supervised%20vision)(DINOv2,9/12 ImageNet 超类)、监督视觉 (https://huggingface.co/papers?q=supervised%20vision)(ViT-Base,11/12)和音频(AST,50/50 ESC-50 类别)中,因此它反映的是 transformer 训练的一般性,而非语言建模目标。标准基 (https://huggingface.co/papers?q=standard%20basis) 在一次前向传播 (https://huggingface.co/papers?q=forward%20pass) 中足以用于特征读取,无需优化,无需 GPU 天数。开放问题从寻找正确的旋转转向编录每个维度编码的内容。
查看 arXiv 页面 (https://arxiv.org/abs/2606.12629)查看 PDF (https://arxiv.org/pdf/2606.12629)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.12629)
在你的代理中获取此论文:
hf papers read 2606.12629
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.12629 以从此页面链接。
引用该论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.12629 以从此页面链接。
引用该论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.12629 以从此页面链接。
包含该论文的收藏集 0
没有包含此论文的收藏集
将论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
权重稀疏Transformer中的单个参数具有可解释性
本文介绍了一种自动化的大语言模型流水线,用于生成并验证关于Transformer中单个权重何时起作用的、人类可读的描述。研究发现,在权重稀疏的Transformer中,12%至31%的权重在全局范围内具有可解释性,其表现优于稠密Transformer。
推理的几何特征:任务难度的谱视角
本文研究Transformer隐藏状态空间中思维链轨迹的几何性质,引入有效维度和运动学特征,从而通过早期token预测任务难度和答案正确性。
从方向到幅度:多模态指令调优如何重新组织Transformer隐藏状态中身份指定提示的几何编码
本文研究了多模态指令调优如何重新组织Transformer隐藏状态中身份指定提示的几何编码,发现指令调优后编码从基于方向转变为基于幅度。
表征作为机制可解释性的瓶颈:Manifestation Unit协议
本文介绍了Manifestation Units,这是一种类型化元组协议,用于将机制可解释性分析中的每个组件的统计量组织成结构化、可查询的字段。该协议在视觉(β-VAE、CNN)和语言(GPT-2)模型上进行了演示,展示了改进的检索和因果充分性。
基于有界深度文法的深度Transformer层次建模表达性分析
本文对深度Transformer使用有界深度上下文无关文法建模层次结构的能力进行了理论分析,构建了显式的位置注意力Transformer,将文法状态编码到线性可分的子空间中。